Новости Claude

Claude и другие нейросети прошли турнир из 3360 битв

Несколько нейросетей участвуют в сравнительном турнире за ноутбуком

Автор собрал семь нейросетей и устроил им необычное соревнование: модели не только выполняли задания, но и сами оценивали чужие ответы. Так получилось сравнение, которое показывает не абстрактные бенчмарки, а то, что реально можно показать заказчику или использовать в работе.

Как устроили турнир нейросетей

Автору нужен был понятный способ сравнить модели для создания сайтов с помощью ИИ. Ему было важно не «кто лучше решает олимпиадные задачи», а какая нейросеть с первого запроса выдаст аккуратный и полезный результат без долгой доработки.

В итоге он собрал семь участников: GPT, Claude и ещё несколько моделей, подключённых через OpenRouter. Формат сделали похожим на Евровидение: каждая модель получала одно и то же задание, а потом оценивала работы других, не видя свою. Ответы были обезличены и отмечены буквами, чтобы судьи не ориентировались на имя автора.

Что показали задания на сайтах, визуале и идеях

Всего в турнире было девять заданий — от простой страницы-визитки в одном HTML-файле до более сложных вещей вроде 3D-модели робота, мини-игры, инфографики и генерации идеи для прибора с рекламным кадром. Такой набор полезен тем, кто делает сайты, презентации, промо-материалы или прототипы: он сразу показывает, где модель помогает с первого раза, а где даёт сырой черновик.

По итогам визуальных задач хорошо проявились разные сильные стороны. Qwen сделал удачную страницу о себе и взял мини-игру, Kimi особенно выделился в 3D и инфографике, а Opus оказался сильным в текстах. В задании с прибором для поиска проблем в квартире Kimi предложил «Тихона» — устройство, которое слушает ультразвук и вибрации, чтобы заранее заметить течь или опасную проводку.

Что было самым любопытным в судействе

Судейство оказалось не менее интересным, чем сами ответы. На каждое задание работало шесть судей: лучшая работа получала 5 баллов, худшая — 0, а одинаковых оценок не было. За себя голосовать нельзя, поэтому каждая модель смотрела на чужие решения максимально трезво.

Особенно ярко это проявилось в загадке про четырёх спасшихся после кораблекрушения. GPT и Grok раскрыли лишь часть ответа, Kimi и DeepSeek потратили очень много токенов, а Gemini задала всего один точный вопрос и быстро вышла на верную гипотезу. Но победителем по общему голосованию стал Grok: не угадав всё сразу, он всё же рассуждал системно, и это понравилось судьями больше, чем случайно найденный ответ.

Зачем это может быть полезно на практике

Главная ценность такого эксперимента — не в развлечении, а в прикладном выборе модели. Если вы делаете сайт, лендинг, карточку продукта, рекламный визуал или небольшую игру, важно понимать, кто из ИИ чаще выдаёт готовый результат, а кто требует долгой правки.

Автор также заметил большой разброс в расходе токенов: одни модели справлялись быстро, другие тратили сотни тысяч токенов на задачу и всё равно уступали в качестве. Для тех, кто работает с ИИ регулярно, это важный ориентир: иногда дешевле и удобнее выбрать более точную модель сразу, чем потом долго исправлять сырой ответ.

Частые вопросы

Чем этот турнир отличается от обычных бенчмарков?
Здесь модели проверяли на прикладных задачах, похожих на реальную работу: сайты, визуал, тексты, идеи. Плюс они сами судили чужие ответы, поэтому сравнение получилось ближе к практике, чем к сухим тестам.
Какая модель лучше всего подошла для визуальных задач?
В статье отдельно отмечены Kimi для 3D-модели и инфографики, Qwen для мини-игры, а Opus для страницы о себе. Это показывает, что «лучшая модель» зависит от конкретной задачи.
Почему важен расход токенов?
Потому что он влияет и на стоимость, и на удобство работы. Если модель тратит слишком много токенов, задача может оказаться слишком дорогой даже при неплохом результате.
Где посмотреть сами работы и оценки?
Автор выложил материалы открыто на ikorg.ru/rating: там есть работы, голоса с пояснениями, записи партий и код ботов. Это удобно, если хочется сравнить решения самостоятельно.

Читайте также

Попробовать Lord GPT бесплатно →