Оценивает, насколько ответы вашей AI-модели соответствуют запросу, используя реальные данные и метрики.
⚡ Когда использовать?
- Автотесты генеративных моделей (GPT, LLaMA и др.)
- Сравнение качества ответов разных версий модели
- Настройка и мониторинг качества RAG (retrieval-augmented generation)
👨💻 Пример из практики:
AI PM запускает RAG-бота на базе внутренних документов. С помощью Ragas он тестирует релевантность и полноту ответов, находит «галлюцинации» и улучшает пайплайн (например, фильтрацию источников и re-ranking).
🛠 Сравнение c похожими:
- LangSmith → больше для дебага пайплайнов
- Trulens → фокус на прозрачности и интерпретации
- EvalRS → заточен под рекомендательные системы
- Relevance AI → визуальные оценки и кастомные метрики
