В одном документе у меня написано 59,7%, в другом — 10 из 10. На первый взгляд кажется, что кто-то ошибся. На самом деле обе цифры правильные.
Просто они относятся к разным бенчмаркам, разным метрикам и отвечают на разные вопросы.
Когда работаешь с этим каждый день, нужный контекст живёт в голове. Ты автоматически помнишь, что здесь измеряли качество по ролевым сценариям, а там — семантическое соответствие. Кажется, что это очевидно.
Перестаёт быть очевидно ровно в тот момент, когда цифра оказывается в статье, презентации или посте.
Человек, который открывает только один документ, этой рамки уже не видит. Для него это просто две противоречащие друг другу цифры.
Самое смешное, что решение этой проблемы я сам уже несколько лет показываю на докладах.
В Source Map есть простая колонка:
«С чем спорит этот источник?»
Она заставляет явно фиксировать такие вещи.
- Какие документы противоречат друг другу.
- Какие метрики нельзя сравнивать напрямую.
- Какие выводы верны только в рамках конкретного эксперимента.
На собственных материалах я эту колонку... не завёл.
Похоже, Source Map нужен не только аналитикам. 😄


