Claude и другие нейросети прошли турнир из 3360 битв
Автор собрал семь нейросетей и устроил им необычное соревнование: модели не только выполняли задания, но и сами оценивали чужие ответы. Так получилось сравнение, которое показывает не абстрактные бенчмарки, а то, что реально можно показать заказчику или использовать в работе.
Как устроили турнир нейросетей
Автору нужен был понятный способ сравнить модели для создания сайтов с помощью ИИ. Ему было важно не «кто лучше решает олимпиадные задачи», а какая нейросеть с первого запроса выдаст аккуратный и полезный результат без долгой доработки.
В итоге он собрал семь участников: GPT, Claude и ещё несколько моделей, подключённых через OpenRouter. Формат сделали похожим на Евровидение: каждая модель получала одно и то же задание, а потом оценивала работы других, не видя свою. Ответы были обезличены и отмечены буквами, чтобы судьи не ориентировались на имя автора.
Что показали задания на сайтах, визуале и идеях
Всего в турнире было девять заданий — от простой страницы-визитки в одном HTML-файле до более сложных вещей вроде 3D-модели робота, мини-игры, инфографики и генерации идеи для прибора с рекламным кадром. Такой набор полезен тем, кто делает сайты, презентации, промо-материалы или прототипы: он сразу показывает, где модель помогает с первого раза, а где даёт сырой черновик.
По итогам визуальных задач хорошо проявились разные сильные стороны. Qwen сделал удачную страницу о себе и взял мини-игру, Kimi особенно выделился в 3D и инфографике, а Opus оказался сильным в текстах. В задании с прибором для поиска проблем в квартире Kimi предложил «Тихона» — устройство, которое слушает ультразвук и вибрации, чтобы заранее заметить течь или опасную проводку.
Что было самым любопытным в судействе
Судейство оказалось не менее интересным, чем сами ответы. На каждое задание работало шесть судей: лучшая работа получала 5 баллов, худшая — 0, а одинаковых оценок не было. За себя голосовать нельзя, поэтому каждая модель смотрела на чужие решения максимально трезво.
Особенно ярко это проявилось в загадке про четырёх спасшихся после кораблекрушения. GPT и Grok раскрыли лишь часть ответа, Kimi и DeepSeek потратили очень много токенов, а Gemini задала всего один точный вопрос и быстро вышла на верную гипотезу. Но победителем по общему голосованию стал Grok: не угадав всё сразу, он всё же рассуждал системно, и это понравилось судьями больше, чем случайно найденный ответ.
Зачем это может быть полезно на практике
Главная ценность такого эксперимента — не в развлечении, а в прикладном выборе модели. Если вы делаете сайт, лендинг, карточку продукта, рекламный визуал или небольшую игру, важно понимать, кто из ИИ чаще выдаёт готовый результат, а кто требует долгой правки.
Автор также заметил большой разброс в расходе токенов: одни модели справлялись быстро, другие тратили сотни тысяч токенов на задачу и всё равно уступали в качестве. Для тех, кто работает с ИИ регулярно, это важный ориентир: иногда дешевле и удобнее выбрать более точную модель сразу, чем потом долго исправлять сырой ответ.