Claude и DeepSeek v4 Flash сравнили в разных харнессах
Команда Koda проверила одну и ту же модель DeepSeek V4 Flash сразу в нескольких агентных оболочках и показала, что результат зависит не только от самой LLM, но и от того, как устроен харнесс. В их замере Koda набрала 52,2% и обошла Kilocode, OpenCode и Claude Code на выбранном наборе задач.
Почему одна и та же модель ведёт себя по-разному
Когда кодовый агент решает задачу, модель не правит файлы сама и не запускает тесты напрямую. Этим занимается агентная оболочка: она передаёт инструкции, даёт доступ к инструментам, показывает ошибки и управляет следующим шагом.
Из-за этого одинаковая LLM в разных харнессах может показывать разные результаты. Где-то ей проще искать по проекту, где-то понятнее ошибки, а где-то лучше организована длинная сессия. Поэтому даже небольшие отличия в промпте или наборе инструментов на длинной дистанции заметно влияют на итог.
Как проходил замер
Чтобы отделить качество модели от качества оболочки, в Koda запускали одинаковые модели с одинаковым уровнем рассуждений в Koda, OpenCode, KiloCode, Claude Code и Ouroboros. Для сравнения агентных оболочек выбрали DeepSeek V4 Flash — популярную и относительно недорогую модель, которую часто используют через Open Router.
В прогон вошёл единый Индекс Кода: 261 агентная задача из опенсорсных бенчмарков. Это не короткие вопросы, а полноценные сценарии, где агент работает в изолированной песочнице, читает файлы, запускает команды, смотрит ошибки и пробует исправления снова и снова. Сетевые возможности и часть git-команд в окружении отключили, чтобы агент не мог подсмотреть готовое решение в интернете или в истории репозитория.
Что показали результаты
На уровне Max оболочка Koda показала 52,2% и опередила ближайшего конкурента на 2,7 процентного пункта. На уровне Medium картина стала плотнее: Claude Code набрала 46,9%, Koda — 46,3%, Ouroboros — 45,8%, KiloCode — 44,9%, OpenCode — 43,4%.
Авторы отдельно подчёркивают, что по одному такому эксперименту нельзя назвать лучшую агентную оболочку вообще: тестировали только DeepSeek V4 Flash. Но сам вывод практический и понятный — не стоит судить об ИИ-агенте только по названию модели. На результат влияет и то, как оболочка организует цикл работы, ошибки, контекст и выбор инструментов. Это полезно тем, кто использует кодовых помощников в разработке: иногда более удачный агент даёт больше пользы, чем смена самой модели.