Новости Claude

Claude и DeepSeek v4 Flash сравнили в разных харнессах

Сравнение ИИ-агентов для работы с кодом на фоне мониторов и распечаток

Команда Koda проверила одну и ту же модель DeepSeek V4 Flash сразу в нескольких агентных оболочках и показала, что результат зависит не только от самой LLM, но и от того, как устроен харнесс. В их замере Koda набрала 52,2% и обошла Kilocode, OpenCode и Claude Code на выбранном наборе задач.

Почему одна и та же модель ведёт себя по-разному

Когда кодовый агент решает задачу, модель не правит файлы сама и не запускает тесты напрямую. Этим занимается агентная оболочка: она передаёт инструкции, даёт доступ к инструментам, показывает ошибки и управляет следующим шагом.

Из-за этого одинаковая LLM в разных харнессах может показывать разные результаты. Где-то ей проще искать по проекту, где-то понятнее ошибки, а где-то лучше организована длинная сессия. Поэтому даже небольшие отличия в промпте или наборе инструментов на длинной дистанции заметно влияют на итог.

Как проходил замер

Чтобы отделить качество модели от качества оболочки, в Koda запускали одинаковые модели с одинаковым уровнем рассуждений в Koda, OpenCode, KiloCode, Claude Code и Ouroboros. Для сравнения агентных оболочек выбрали DeepSeek V4 Flash — популярную и относительно недорогую модель, которую часто используют через Open Router.

В прогон вошёл единый Индекс Кода: 261 агентная задача из опенсорсных бенчмарков. Это не короткие вопросы, а полноценные сценарии, где агент работает в изолированной песочнице, читает файлы, запускает команды, смотрит ошибки и пробует исправления снова и снова. Сетевые возможности и часть git-команд в окружении отключили, чтобы агент не мог подсмотреть готовое решение в интернете или в истории репозитория.

Что показали результаты

На уровне Max оболочка Koda показала 52,2% и опередила ближайшего конкурента на 2,7 процентного пункта. На уровне Medium картина стала плотнее: Claude Code набрала 46,9%, Koda — 46,3%, Ouroboros — 45,8%, KiloCode — 44,9%, OpenCode — 43,4%.

Авторы отдельно подчёркивают, что по одному такому эксперименту нельзя назвать лучшую агентную оболочку вообще: тестировали только DeepSeek V4 Flash. Но сам вывод практический и понятный — не стоит судить об ИИ-агенте только по названию модели. На результат влияет и то, как оболочка организует цикл работы, ошибки, контекст и выбор инструментов. Это полезно тем, кто использует кодовых помощников в разработке: иногда более удачный агент даёт больше пользы, чем смена самой модели.

Частые вопросы

Что такое харнесс в контексте ИИ-агентов?
Это оболочка, через которую модель работает с инструментами: читает файлы, запускает команды, получает ошибки и решает, что делать дальше.
Почему результаты одной модели отличаются в разных системах?
Потому что отличаются системные инструкции, набор инструментов, работа с контекстом и обработка ошибок. Даже небольшие различия на длинной задаче дают заметную разницу.
Можно ли по этому тесту выбрать лучший агент вообще?
Нет, в статье сравнивали только DeepSeek V4 Flash. Замер показывает, что оболочка влияет на результат, но не доказывает абсолютное лидерство одного решения.
Чем это полезно обычным пользователям и командам?
Если вы используете ИИ для кода, стоит смотреть не только на модель, но и на среду, в которой она работает. Иногда именно оболочка помогает агенту решить больше реальных задач.

Читайте также

Попробовать Lord GPT бесплатно →