Надёжность агентов
Раздел темы «Оценка LLM-приложений и агентов». Вопросы проверяют понимание практики, а не память на API конкретных библиотек. После ответа — разбор: почему верный вариант верен, чем плох каждый неверный и какую главу прочитать.
Сложность теста Форматы: один верный вариант, несколько верных, порядок шагов, ошибка в трейсе агента, пары
01
Что проверяем
- Чем Pass^k отличается от Pass@k
- Какую метрику отчитывать
- Разбор причины провала
- От сбоя к регрессионной задаче
- Регрессия по префиксу траектории
- Действия верные, отчёт неверный
- Поиск ошибки в «тихом» провале
- Сначала правила, потом LLM
- Показатель агента упал
- Судить траекторию, а не только ответ
- Защита от поддельной проверки
02
Где читать
- Ли, AI Agents in Depthразд. 7.2 · разд. 7.4.2 · разд. 7.5.2 · разд. 7.5.3 · разд. 7.6.1 · разд. 7.9
- Хьюэн, Инженерия ИИгл. 3 · гл. 6, «Типы сбоев агентов и их оценка»
- Агенты и вайб-кодинггл. 23