Claude, GPT-6 и Grok: что реально дешевле и быстрее
Новые версии Claude, GPT-6, Grok и DeepSeek вышли почти подряд, поэтому сравнивать их по рекламным цифрам уже не очень полезно. Гораздо важнее понять, сколько стоит не токен, а одна законченная задача, и где модели действительно экономят время и деньги.
Почему прейскурант сам по себе мало что говорит
Осенью 2026 года рынок ИИ выдал сразу несколько крупных обновлений: Anthropic показала Claude Fable 5.1, Opus 5.5 и Sonnet 5.5, OpenAI — линейку GPT-6, xAI — Grok 4.7, а DeepSeek — V4.1 Flash и V4 Pro. На первый взгляд кажется, что достаточно посмотреть цену за токен, но в реальной работе это часто вводит в заблуждение.
Авторы обзора разделяют три типа цифр: данные самих компаний, независимые замеры и прямые сравнения на одной задаче. У каждого способа есть слабые места, но самые честные выводы обычно дают именно независимые тесты и пересчёт в стоимость одной решённой задачи.
Кто дешевле в работе, а не на бумаге
По цене задачи картина выглядит не так, как в прайс-листах. Самой дорогой моделью в сводке оказался Claude Sonnet 5.5 — $7,67 за задачу на максимальном уровне рассуждения. Почти рядом идут Claude Fable 5.1 с $7,63 и Claude Opus 5.5 с $5,98.
При этом у Sonnet токен дешевле, чем у Opus и Fable. Но он расходует намного больше выходных токенов, поэтому итоговый счёт растёт. Это хороший пример для бизнеса и обычной работы: если задача длинная, разговорчивая модель может выйти дороже, даже когда токен у неё стоит меньше.
Из новых моделей выгодно смотрится GPT-6.1 Sol: при 52 баллах в сводном индексе его задача стоит 72 цента. GPT-6 Astra обходит его по ряду тестов, но обходится уже в $3,26 за задачу. Grok 4.7 по прайс-листу кажется дешёвым, однако в реальной задаче выходит $3,74. Среди более бюджетных вариантов выделяются GPT-6 Luna — 38 баллов и 7 центов за задачу, DeepSeek V4.1 Flash — 39 баллов и 27 центов, а DeepSeek V4 Pro — 36 баллов и 67 центов.
Что показали независимые тесты
В сводном индексе Artificial Analysis на 3 октября 2026 года лидирует Claude Opus 5.5 с 58 баллами. Далее идут Claude Sonnet 5.5 с 56, Claude Fable 5.1 и GPT-6 Astra с 53, GPT-6.1 Sol с 52, Grok 4.7 с 46, DeepSeek V4.1 Flash с 39, GPT-6 Luna с 38 и DeepSeek V4 Pro с 36.
В отдельных тестах картина меняется в зависимости от сценария. В Terminal-Bench 4.0 Sonnet 5.5 набрал 70,6 %, Opus 5.5 — 66,4 %, GPT-6 Astra — 57,9 %, а Fable 5.1 — 55,8 %. В OSWorld у Opus 5.5 — 81,8 %, у Sonnet 5.5 — 80,1 %. А в AutomationBench GPT-6.1 Sol обошёл Opus 5.5 на 2,2 пункта.
Практический вывод простой: для длинных агентных задач и программирования сильнее выглядит Claude, по соотношению цены и качества особенно интересен GPT-6.1 Sol, а Grok 4.7 и DeepSeek заметно прибавили, но до лидеров пока не дотягивают. Если вы выбираете модель для работы, смотреть стоит не только на имя, но и на то, сколько реально стоит один выполненный кейс.