Бенчмарки и их ограничения
Раздел темы «Оценка LLM-приложений и агентов». Вопросы проверяют понимание практики, а не память на API конкретных библиотек. После ответа — разбор: почему верный вариант верен, чем плох каждый неверный и какую главу прочитать.
Сложность теста Форматы: несколько верных, один верный вариант
Тест 6.6Бенчмарки и их ограниченияНачать тренировку Тренировка — без таймера, с разбором после каждого ответа.
01
Что проверяем
- Зачем нужны публичные бенчмарки
- Рейтинг по попарным сравнениям
- Неожиданная победа в Эло
- Новая модель лучше на бенчмарках
- Метрики задержки при выборе модели
- Короткий бюджет и длинные задачи
02
Где читать
- Ли, AI Agents in Depthразд. 7.5.4 · разд. 7.6.1 · разд. 7.6.4
- Хьюэн, Инженерия ИИгл. 4