Gemini 4 и Claude: почему бенчмарки всё хуже помогают выбрать ИИ
Gemini 4 Argon снова вышла в лидеры по таблицам, но это не значит, что модель лучше в реальной работе. История релиза всё больше напоминает прошлые версии Gemini: красивый анонс, сильные тесты и вопросы к качеству вне бенчмарков.
Что показали в анонсе Gemini 4 Argon
30 сентября Google представила Gemini 4 Argon и сразу сделала ставку на цифры из тестов: модель лидирует в 12 бенчмарках из 18. Формально это сильный результат, и по части опубликованных замеров Google действительно не пришлось ничего приукрашивать.
Но важна не только верхняя строчка таблицы. В самом же анонсе не стали акцентировать слабые места, хотя в программировании Argon уступает Claude Opus 5.5 и GPT-6 Astra по 9–11 пунктов. При этом именно разработка и код — одна из ключевых задач, по которым прошлые версии Gemini уже разочаровывали.
Почему сравнение с Claude снова стало неудобным
У Gemini уже есть повторяющийся сценарий. Сначала Google показывает модель, которая почти везде первая. Потом пользователи начинают проверять её в реальной работе и замечают, что Claude и ChatGPT часто выглядят практичнее. Затем компания обещает исправить недочёты в следующей версии.
Похожая история была с Gemini 3 Pro и 3.1 Pro. Первая версия осенью 2025 года хорошо выглядела в рейтингах, но в 88% случаев выдумывала ответ, если не знала его. Вторая в феврале лидировала в 12 тестах из 18, но в реальных профессиональных задачах проиграла Claude больше чем на 300 очков. Поэтому само наличие первой строчки в таблице уже не вызывает прежнего доверия.
Почему бенчмарки всё хуже показывают реальную пользу
Проблема не только в Google. Сегодня тесты слишком часто становятся целью сами по себе: если лаборатории знают, что именно попадает в пресс-релиз, они начинают подгонять модели под эти проверки. В результате модель учится сдавать тест, а не решать обычную рабочую задачу.
Ещё одна причина — тестов стало слишком много. Из десятков замеров почти любая сильная модель соберёт набор побед, и маркетинг сам выберет, какие цифры вынести в заголовок. Поэтому Argon может быть первой в одном индексе, третьей в другом и восьмой в третьем — и каждый раз это будет выглядеть как победа.
Есть и потолок качества. На некоторых задачах по программированию лидеры уже доходят до 100%, а сами индексы вынуждены часто менять состав, потому что старые тесты быстро перестают различать сильные модели. Поэтому победа в бенчмарках сегодня чаще говорит только о том, что модель хорошо проходит бенчмарки. Для бизнеса и работы важнее другое: помогает ли она писать код, делать интерфейсы, отвечать без выдумок и реально экономить время.
Что это значит для тех, кто выбирает ИИ-сервис
Сейчас Argon доступна только специалистам по кибербезопасности в программе Fairwind, так что обычным пользователям попробовать её пока нельзя. О полноценной оценке модели можно будет говорить только после того, как с ней поработают разработчики и проверят её в живых задачах.
Практический вывод простой: не стоит выбирать ИИ только по красивой таблице в пресс-релизе. Смотрите, где модель ошибается, что о ней говорят в реальных сценариях и совпадает ли рекламный акцент с тем, что для вас действительно важно — код, тексты, интерфейсы или офисные задачи. Именно в таких задачах и проявляется, полезен ли инструмент на самом деле.