Наборы данных и эвалы
Раздел темы «Оценка LLM-приложений и агентов». Вопросы проверяют понимание практики, а не память на API конкретных библиотек. После ответа — разбор: почему верный вариант верен, чем плох каждый неверный и какую главу прочитать.
Сложность теста Форматы: несколько верных, порядок шагов, один верный вариант
Тест 6.1Эвалы и наборы данныхНачать тренировку Тренировка — без таймера, с разбором после каждого ответа.
01
Что проверяем
- Три источника оценочного набора
- Как трассы становятся тестами
- Срезы и парадокс Симпсона
- Как проверить, что баг исправлен
- Защита набора от утечки в обучение
- Уровни сложности в наборе
- Задача с симулятором пользователя
- Точное условие успеха
- Руководство по оценке
- Связь метрик оценки с бизнесом
- Повторяемая среда для оценки агента
- С чего начать оценочный набор
02
Где читать
- Ли, AI Agents in Depthразд. 7.1.1 · разд. 7.3.1 · разд. 7.4.2 · разд. 7.4.3 · разд. 7.4.4 · разд. 7.4.5 · разд. 7.4.6 · разд. 7.8
- Хьюэн, Инженерия ИИгл. 4
- Агенты и вайб-кодинггл. 23