Одна из самых частых ошибок при работе с LLM

Канал о системном и бизнес-анализе, продуктовом мышлении и архитектуре. Как выявлять реальные проблемы, строить работающие решения и не терять здравый смысл в IT. Все вопросы - @innokentyB

llmревью кодаразделение контекста

Вы просите модель написать код. Потом, не меняя контекст, говорите: «А теперь проверь, всё ли здесь правильно.» Она находит пару мелких замечаний, что-то косметически поправляет и в итоге говорит: «В целом решение корректное.»

Честно говоря, было бы странно ожидать другого.

Модель не перечитывает код «свежим взглядом». Она продолжает тот же разговор, в котором уже построила гипотезу, что это решение хорошее. Проверка превращается не в независимое ревью, а в продолжение собственной цепочки рассуждений.

Я столкнулся с этим, когда гонял локальные модели на собственном харнессе. Я проверял их на десяти сценариях, и долго не мог понять, почему результаты выглядят прилично, а реальной работы почти нет.

Ответ оказался неприятно простым.

Модель сначала генерировала решение, а потом сама же его подтверждала.

После разделения контекстов качество выросло заметно.

  • Одна роль только строит решение и вообще ничего не знает о том, что его потом будут проверять.
  • Вторая получает только готовый результат и задачу его сломать. Без истории диалога, без объяснений, без «я уже думал над этим».
  • Третья вообще работает отдельно — она смотрит только на источники и пытается найти противоречия между ними и тем, что получилось.

И здесь, как мне кажется, важен один момент.

Это не история про дорогие агентные платформы. Это можно сделать даже тремя отдельными окнами ChatGPT, если у каждого будет своя роль и свой контекст. Чем независимее эти роли друг от друга, тем больше шансов, что одна действительно поймает ошибку другой.

Попробуйте вспомнить свою последнюю задачу.

Сколько раз вы просили модель проверить то, что она сама только что и написала?

Дискуссия

IT Удильщик by евGEN
Ни разу. Я обычно делаю отдельной сессией ревью проекта для поиска проблем
PRO анализ в ИТ
IT Удильщик by евGEN
Ни разу. Я обычно делаю отдельной сессией ревью проекта для поиска проблем
Только ревью? А планирование?
IT Удильщик by евGEN
PRO анализ в ИТ
Только ревью? А планирование?
Планирование чего? Планирование он в той же сессии делает
PRO анализ в ИТ
IT Удильщик by евGEN
Планирование чего? Планирование он в той же сессии делает
У меня в разных сессиях - глобальное планирование и анализ, проектирование и разработка, ревью, тестирование
IT Удильщик by евGEN
PRO анализ в ИТ
У меня в разных сессиях - глобальное планирование и анализ, проектирование и разработка, ревью, тестирование
Я так не пробовал ещё
IT Удильщик by евGEN
Пока решил вместо глобального планирование пойти по старинке. Я говорю - он делает
Sasha Ra
IT Удильщик by евGEN
Пока решил вместо глобального планирование пойти по старинке. Я говорю - он делает
Аналогично делаю. В моем случае задан контекст, который дополняется по мере доработок , код пишу кусками и валидирую в одной сессии, просто задал, то на что обратить внимание при проверке. Пока достаточно
Sasha Ra
Плюс вывел какой-то более менее подробный уровень спецификации, которое скармливаю.
PRO анализ в ИТ
Sasha Ra
Плюс вывел какой-то более менее подробный уровень спецификации, которое скармливаю.
А можете сказать, насколько детальную спеку делаете?
Sasha Ra
ER диаграмма либо просто табличкой + бизнес ограничения(критичные), роли, методы.
Присоединиться к обсуждению →

Читайте так же