Новости Claude

Gemini 4 и Claude: почему бенчмарки всё хуже помогают выбрать ИИ

Печатные таблицы с бенчмарками, открытый код на двух мониторах и смартфон с ИИ-приложением на столе

Gemini 4 Argon снова вышла в лидеры по таблицам, но это не значит, что модель лучше в реальной работе. История релиза всё больше напоминает прошлые версии Gemini: красивый анонс, сильные тесты и вопросы к качеству вне бенчмарков.

Что показали в анонсе Gemini 4 Argon

30 сентября Google представила Gemini 4 Argon и сразу сделала ставку на цифры из тестов: модель лидирует в 12 бенчмарках из 18. Формально это сильный результат, и по части опубликованных замеров Google действительно не пришлось ничего приукрашивать.

Но важна не только верхняя строчка таблицы. В самом же анонсе не стали акцентировать слабые места, хотя в программировании Argon уступает Claude Opus 5.5 и GPT-6 Astra по 9–11 пунктов. При этом именно разработка и код — одна из ключевых задач, по которым прошлые версии Gemini уже разочаровывали.

Почему сравнение с Claude снова стало неудобным

У Gemini уже есть повторяющийся сценарий. Сначала Google показывает модель, которая почти везде первая. Потом пользователи начинают проверять её в реальной работе и замечают, что Claude и ChatGPT часто выглядят практичнее. Затем компания обещает исправить недочёты в следующей версии.

Похожая история была с Gemini 3 Pro и 3.1 Pro. Первая версия осенью 2025 года хорошо выглядела в рейтингах, но в 88% случаев выдумывала ответ, если не знала его. Вторая в феврале лидировала в 12 тестах из 18, но в реальных профессиональных задачах проиграла Claude больше чем на 300 очков. Поэтому само наличие первой строчки в таблице уже не вызывает прежнего доверия.

Почему бенчмарки всё хуже показывают реальную пользу

Проблема не только в Google. Сегодня тесты слишком часто становятся целью сами по себе: если лаборатории знают, что именно попадает в пресс-релиз, они начинают подгонять модели под эти проверки. В результате модель учится сдавать тест, а не решать обычную рабочую задачу.

Ещё одна причина — тестов стало слишком много. Из десятков замеров почти любая сильная модель соберёт набор побед, и маркетинг сам выберет, какие цифры вынести в заголовок. Поэтому Argon может быть первой в одном индексе, третьей в другом и восьмой в третьем — и каждый раз это будет выглядеть как победа.

Есть и потолок качества. На некоторых задачах по программированию лидеры уже доходят до 100%, а сами индексы вынуждены часто менять состав, потому что старые тесты быстро перестают различать сильные модели. Поэтому победа в бенчмарках сегодня чаще говорит только о том, что модель хорошо проходит бенчмарки. Для бизнеса и работы важнее другое: помогает ли она писать код, делать интерфейсы, отвечать без выдумок и реально экономить время.

Что это значит для тех, кто выбирает ИИ-сервис

Сейчас Argon доступна только специалистам по кибербезопасности в программе Fairwind, так что обычным пользователям попробовать её пока нельзя. О полноценной оценке модели можно будет говорить только после того, как с ней поработают разработчики и проверят её в живых задачах.

Практический вывод простой: не стоит выбирать ИИ только по красивой таблице в пресс-релизе. Смотрите, где модель ошибается, что о ней говорят в реальных сценариях и совпадает ли рекламный акцент с тем, что для вас действительно важно — код, тексты, интерфейсы или офисные задачи. Именно в таких задачах и проявляется, полезен ли инструмент на самом деле.

Частые вопросы

Почему лидерство в бенчмарках уже не гарантирует качество модели?
Потому что модели всё чаще учатся проходить именно тесты, а не решать реальные задачи. В итоге первая строка в таблице может почти ничего не сказать о том, как модель поведёт себя в работе.
Чем Gemini 4 Argon отличается от прошлых версий Gemini?
По опубликованным данным, Argon лучше выглядит в ряде тестов и заметно снизила долю выдуманных ответов. Но в программировании и ряде живых сценариев она всё ещё уступает конкурентам, включая Claude.
Почему в новости так часто сравнивают Gemini с Claude?
Потому что Claude в реальных задачах нередко выглядит сильнее, даже если Gemini выигрывает таблицы. Для пользователя это важное сравнение: не цифры в анонсе, а итоговая польза в работе.
Что делать обычному пользователю при выборе ИИ-модели?
Смотреть не только на пресс-релиз, но и на живые отзывы, независимые замеры и реальные кейсы использования. Если модель нужна для кода, текстов или работы с интерфейсами, лучше проверять её на своих задачах.

Читайте также

Попробовать Lord GPT бесплатно →