Пять лучших агентов для кода: разброс по баллу и цене

Понимание мира через данные Статистика и данные из разных областей. Минимум оценок и интерпретаций, максимум данных и фактов Чат: @rationalchat https://rationalnumbers.ru По рекламе: @kgreenmedia В реестре: vk.cc/cKf8WS Автор: @kirillgreen

агентыкодцена

(Artificial Analysis, Coding Agent Index 1.5)

Индекс меряет пару «оболочка и модель»: три бенчмарка с равным весом, рядом с баллом — цена задачи по прайсу API

Codex с DeepSeek V4 Pro берёт 43,1 балла за 24 цента — в 52 раза дешевле верхней строчки. Средний балл прячет форму: на двух тестах из трёх эта связка отстаёт от лидера на 3 и 7 баллов, а на третьем, Terminal-Bench, — на 47: 10,1 против 57,6. На один тест приходится 83% всего отставания

Ещё мы писали про цену и качество нейросетей:

Дискуссия

Ariorick
А что за Devin
Alexandr Zeinalov
Ariorick
А что за Devin
Devin AI контора такая, я их помню по deepwiki - проекту автогенерации доки для гитхаба https://deepwiki.com/shurshur/glagolitic-bot
Alexander Alexandrov
Что включает задача ? Иногда Claude ошибается и бред делает , приходится тыкать пальцем как котенка . Задача это что понимается . Реализованный промт или полный md
Alexander Alexandrov
Иногда можно слабый промт решать неделю.
Alexander Alexandrov
А иногда весь и концепт за один подход . Они крутят в моделях температуру и модели по разному соображают, хитрецы ещё те..
Maksim Litvinov
не вижу в списке ouroboros и других немейнстрим агентов. рейтинги такие рейтинги. продажа олигополии
ᅠᅠEDWARD ᅠSNOWᅠᅠ
А где сама задача? Без неё вообще оценивать бесполезно Тут хорошо про бенчи написано с тем что это вообще https://t.me/HorizonGrowth/101
Kirill Oleinichenko
ᅠᅠEDWARD ᅠSNOWᅠᅠ
А где сама задача? Без неё вообще оценивать бесполезно Тут хорошо про бенчи написано с тем что это вообще https://t.me/HorizonGrowth/101
Зачем задавать вопрос, ответ на который есть на первом экране по ссылке в заголовке? Открываете любой из трёх бенчей и смотрите набор задач
Сбоку виднее
Разрыв в 47 баллов на Terminal-Bench при почти равном среднем интересный. Там задачи длинные и в шелле, и дешёвая связка, похоже, теряет нить где-то к двадцатому шагу, в коротких задачах этого не видно.
Присоединиться к обсуждению →

Читайте так же