Claude, Grok 4.7 и GPT-6 Astra сравнили по реальным задачам
На рынок почти одновременно вышли Grok 4.7, GPT-6 Astra и Claude Fable 5.1, а вместе с ними в сравнение всё увереннее входят китайские модели. Главное открытие простое: по одним и тем же тестам лидеры меняются в зависимости от задачи, цены и даже способа проверки.
Что вышло и почему это важно
Grok 4.7 появился 21 сентября и стал новой версией поверх Grok 4.6. В xAI сделали ставку на более долгую тренировку с подкреплением: модель должна не просто отвечать, а планировать работу, вызывать инструменты и проверять себя на задачах, которые могут идти часами. У неё контекст до 500 тысяч токенов, текст и картинки на входе, текст на выходе, а режимы рассуждения идут от low до xhigh.
GPT-6 Astra вышла 3 сентября. У неё ещё больше окно контекста — 1,05 миллиона токенов, а ответ может доходить до 128 тысяч токенов. OpenAI позиционирует её как модель для компьютера, браузера, разработки и профессиональной работы, и отдельно усилила проверки на действия, которые модель могла бы сделать без явного разрешения. Claude Opus 5 вышла 24 июля, а Claude Fable 5.1 — 1 сентября: у обеих миллион токенов контекста и одинаковый лимит вывода, но Fable дороже и задумана как вариант на более сложные случаи, когда Opus уже не справляется с задачей.
Китайские модели уже в одной лиге
Важный сдвиг в том, что китайские лаборатории больше не выглядят запасным и дешёвым вариантом. Qwen3.8 Max от Alibaba стоит столько же, сколько Grok, то есть $2 и $6 за миллион токенов, и отстаёт от него лишь на один балл в общем индексе. Kimi K3 от Moonshot тоже держится рядом со свежим Grok на суточных инженерных задачах.
В обзоре также упоминаются GLM-5.3 от Z.ai и семейство DeepSeek V4. У DeepSeek Flash есть открытые веса, лицензия MIT, контекст до 1 миллиона токенов и выход до 384 тысяч. Это важно для тех, кому нужен не только результат, но и возможность скачать модель, доработать её под себя или запустить в своей инфраструктуре.
Для бизнеса это означает, что выбор уже не сводится к двум-трём западным флагманам. Можно сравнивать не только качество ответа, но и цену, доступность, открытость весов и удобство внедрения в свои процессы.
Почему одни тесты показывают победу одной модели, а другие — другой
В статье отдельно подчёркивается: сравнивать модели по одной красивой картинке из анонса нельзя. Лаборатории и независимый прогон Artificial Analysis используют разные наборы задач — от офисной рутины и профессиональных кейсов до терминала, длинного кода, схем и юридических сценариев. Поэтому одна и та же модель может выглядеть сильнее в одном месте и слабее в другом.
Например, на Terminal-Bench результаты у Grok 4.7 заметно расходятся в зависимости от обвязки: в карточке xAI он показывает 38%, а в прогоне Artificial Analysis — 26%. У GPT-6 Astra и Claude Fable 5.1 на этом же наборе цифры выше, но и там порядок зависит от того, как именно запускали тест. Вывод практический: перед покупкой или подключением лучше смотреть не только на рекламу, а на задачи, похожие на ваши.
Если вы выбираете модель для работы, полезнее всего тестировать её на своих сценариях: письма, документы, таблицы, код, работа в браузере или терминале. Для одних задач лучше подойдёт Astra, для других — Claude, а для экономии может хватить и китайской модели с близкими результатами.