Новости Claude

Claude, Grok 4.7 и GPT-6 Astra сравнили по реальным задачам

Сравнение Grok 4.7, GPT-6 Astra, Claude и китайских моделей на таблицах и экранах с тестами

На рынок почти одновременно вышли Grok 4.7, GPT-6 Astra и Claude Fable 5.1, а вместе с ними в сравнение всё увереннее входят китайские модели. Главное открытие простое: по одним и тем же тестам лидеры меняются в зависимости от задачи, цены и даже способа проверки.

Что вышло и почему это важно

Grok 4.7 появился 21 сентября и стал новой версией поверх Grok 4.6. В xAI сделали ставку на более долгую тренировку с подкреплением: модель должна не просто отвечать, а планировать работу, вызывать инструменты и проверять себя на задачах, которые могут идти часами. У неё контекст до 500 тысяч токенов, текст и картинки на входе, текст на выходе, а режимы рассуждения идут от low до xhigh.

GPT-6 Astra вышла 3 сентября. У неё ещё больше окно контекста — 1,05 миллиона токенов, а ответ может доходить до 128 тысяч токенов. OpenAI позиционирует её как модель для компьютера, браузера, разработки и профессиональной работы, и отдельно усилила проверки на действия, которые модель могла бы сделать без явного разрешения. Claude Opus 5 вышла 24 июля, а Claude Fable 5.1 — 1 сентября: у обеих миллион токенов контекста и одинаковый лимит вывода, но Fable дороже и задумана как вариант на более сложные случаи, когда Opus уже не справляется с задачей.

Китайские модели уже в одной лиге

Важный сдвиг в том, что китайские лаборатории больше не выглядят запасным и дешёвым вариантом. Qwen3.8 Max от Alibaba стоит столько же, сколько Grok, то есть $2 и $6 за миллион токенов, и отстаёт от него лишь на один балл в общем индексе. Kimi K3 от Moonshot тоже держится рядом со свежим Grok на суточных инженерных задачах.

В обзоре также упоминаются GLM-5.3 от Z.ai и семейство DeepSeek V4. У DeepSeek Flash есть открытые веса, лицензия MIT, контекст до 1 миллиона токенов и выход до 384 тысяч. Это важно для тех, кому нужен не только результат, но и возможность скачать модель, доработать её под себя или запустить в своей инфраструктуре.

Для бизнеса это означает, что выбор уже не сводится к двум-трём западным флагманам. Можно сравнивать не только качество ответа, но и цену, доступность, открытость весов и удобство внедрения в свои процессы.

Почему одни тесты показывают победу одной модели, а другие — другой

В статье отдельно подчёркивается: сравнивать модели по одной красивой картинке из анонса нельзя. Лаборатории и независимый прогон Artificial Analysis используют разные наборы задач — от офисной рутины и профессиональных кейсов до терминала, длинного кода, схем и юридических сценариев. Поэтому одна и та же модель может выглядеть сильнее в одном месте и слабее в другом.

Например, на Terminal-Bench результаты у Grok 4.7 заметно расходятся в зависимости от обвязки: в карточке xAI он показывает 38%, а в прогоне Artificial Analysis — 26%. У GPT-6 Astra и Claude Fable 5.1 на этом же наборе цифры выше, но и там порядок зависит от того, как именно запускали тест. Вывод практический: перед покупкой или подключением лучше смотреть не только на рекламу, а на задачи, похожие на ваши.

Если вы выбираете модель для работы, полезнее всего тестировать её на своих сценариях: письма, документы, таблицы, код, работа в браузере или терминале. Для одних задач лучше подойдёт Astra, для других — Claude, а для экономии может хватить и китайской модели с близкими результатами.

Частые вопросы

Что сейчас сильнее: Claude, Grok 4.7 или GPT-6 Astra?
Однозначного победителя нет. Claude Fable 5.1 сильна в офисных, профессиональных и научных задачах, Astra хорошо смотрится в терминале и автоматизации интерфейсов, а Grok 4.7 заметно вырос по сравнению с прошлой версией, но в чужих тестах пока уступает лидерам.
Почему в разных обзорах результаты отличаются?
Потому что модели гоняют на разных обвязках и в разных режимах рассуждения. Даже одна и та же модель может показать заметно разные цифры в карточке разработчика и у независимого тестировщика.
Есть ли смысл смотреть на китайские модели?
Да, если важны цена, длинный контекст или открытые веса. Qwen3.8 Max и Kimi K3 уже находятся рядом с западными флагманами по качеству на ряде задач.
Как обычному пользователю выбрать модель?
Лучше отталкиваться от своей работы: код, документы, терминал, поиск, таблицы или длинные диалоги. Самый полезный тест — не общий рейтинг, а то, насколько модель справляется именно с вашими задачами.

Читайте также

Попробовать Lord GPT бесплатно →