Оценка RAG
Раздел темы «Оценка LLM-приложений и агентов». Вопросы проверяют понимание практики, а не память на API конкретных библиотек. После ответа — разбор: почему верный вариант верен, чем плох каждый неверный и какую главу прочитать.
Сложность теста Форматы: несколько верных, порядок шагов, один верный вариант, фраза без опоры в контексте
01
Что проверяем
- Точность и полнота контекста
- Почему полноту считать труднее
- Как считается faithfulness
- Что измеряют метрики RAGAS
- Классы в answer correctness
- Как читать результаты RAG-оценки
- Что оценивать в RAG-конвейере
- Состав набора вопросов для RAG
- Оценка по компонентам
- Метрики с учётом порядка
- Выдумка в ответе бота поддержки
- Вывод, которого нет в данных
02
Где читать
- Хьюэн, Инженерия ИИгл. 4 · гл. 4, Фактическая согласованность · гл. 6
- Bratanič, Hane, Essential GraphRAGгл. 8