Системный подход, конкретные методы и open-source код. Потрясающая статья, если изучаете RAG.
Делюсь мыслями, которые себе сохранил:
- Semantic splitter: нарезка чанков по смыслу, не по токенам
- 1 база = 1 документ — не мешаем данные разных компаний
- LLM reranking с reasoning + relevance score реально помогает
- Structed Output + Chain of Thought → меньше галлюцинаций
- GPT-4o-mini и JINA — хорошие модели для reranker
- Retrieval как указатель: чанки указывают на страницу
- Multiquery-routing ощутимо повышает качество
- «Я не знаю» = дать модельке подумать с разных углов
- Ошибки JSON? Просто переспросить через LLM
- Стандартизация всех сокращений — важна
- Первые 5 прогонов лучше просмотреть вручную
Работа с таблицами:
- Сериализация таблиц на мелкие чанки
- HTML иногда лучше чем .md, если структура не классическая
Полезные ссылки из статьи:
- github код с чемпионата (промпты, сериализаторы, инструменты)
- Github код и промты сериализатора таблиц
- исследование Row-wise Serialization
- FAISS
Автор оригинальной статьи на habr: Илья
