Новости Claude

Claude и месяц работы с AI-агентом: API или подписка

На столе лежат распечатки с расчётом стоимости AI-агента, рядом калькулятор и два монитора с кодом и цифрами

За сентябрь 2026 автор пересчитал, сколько стоит месяц работы разработчика с AI-агентом, и сравнил API с подписками. Разброс получился огромным: от $87 на DeepSeek до $7 720 на GPT-6 Astra, а на итоговый счёт сильнее всего влияет не количество ваших слов, а кэш и то, как агент собирает контекст.

Почему счёт зависит не от запросов, а от кэша

В расчёте за месяц взяли обычную рабочую нагрузку: 492 миллиона новых входных токенов, 2,3 миллиарда токенов из кэша, 10 миллионов выходных токенов и около 25 тысяч запросов. На такой модели видно важную вещь: 82% всего объёма — это повторное чтение уже отправленного контекста.

Это меняет логику экономии. Раньше старались просто сокращать промпты, а теперь важнее, чтобы начало запроса не менялось между вызовами. Если сессия стабильно повторяет системный промпт, описания инструментов и историю, кэш помогает сильно снизить стоимость. Но если в начале промпта что-то поменять, кэш может инвалидироваться, и всё снова посчитается по полной цене.

На практике у Claude Code уже запущенная сессия занимает десятки тысяч токенов даже до первого осмысленного сообщения. Это значит, что платить приходится не только за то, что человек напечатал, а за весь контекст, который агент отправляет модели сам.

Что может сломать экономию на Claude и других агентах

Автор отдельно разбирает, почему кэш не стоит считать памятью. Если харнес — например, Claude Code, OpenCode или Cursor — не отправил старый фрагмент, модель его просто не увидит. А при смене начала промпта всё, что идёт дальше, уже не считается повтором.

Есть и практические правила. Не стоит переподключать MCP-серверы или редактировать правила, которые входят в системный промпт: у Anthropic даже изменение описаний инструментов может сбросить кэш. Лучше подключать MCP-серверы и скиллы на уровне проекта, а не глобально, чтобы они не уезжали в каждый вызов без необходимости.

Ещё важно смотреть на TTL кэша. У Anthropic API стандартный срок — 5 минут, расширенный — час. В Claude Code на подписках Pro и Max часть служебных запросов и собственные действия пользователя могут получать часовой TTL автоматически, но при переходе на usage credits это снова становится 5 минутами, если не задать promptCacheTtl: 1h. У OpenAI для GPT-5.6 и более новых моделей минимальный TTL — 30 минут.

Подписка не всегда выгоднее API

Отдельная часть пересчёта касается подписок. В прошлой таблице лимиты выглядели привлекательно, потому что считались по числу запросов. Но такой подход обманчив: у OpenCode Go, например, лимит задаётся в долларах, а оценка запросов работает только для запросов определённого размера. Если ваши запросы тяжелее и тянут за собой сотни тысяч токенов кэша, реальная экономика меняется.

Из-за этого пересчёт через API и подписки дал совсем другой результат. OpenCode Go стоит $10 в месяц, а в новых расчётах его лимит уже нельзя сравнивать с лёгкими запросами один к одному. Для бизнеса и разработчиков вывод простой: смотреть нужно не на количество запросов в рекламе, а на реальные токены и структуру контекста.

Разброс по моделям тоже очень большой. Между GPT-6 Astra и DeepSeek V4.1 Flash вне пика разница почти в 90 раз: $7 720 против $87. А если бы кэша не было, тот же месяц на Opus 5 стоил бы около $14 000 вместо $3 860.

Частые вопросы

Почему в расчёте так важен кэш?
Потому что основная часть нагрузки — это не новые слова, а повторное чтение уже отправленного контекста. Если начало промпта стабильно, повторные вызовы обходятся заметно дешевле.
Чем API отличается от подписки для AI-агента?
API считает реальные токены и обычно точнее отражает нагрузку. Подписки часто выглядят выгодно в запросах, но на тяжёлых сессиях их лимиты могут закончиться быстрее, чем кажется.
Почему изменения в начале промпта так опасны для стоимости?
Кэш работает по совпадающему началу. Если вы поменяли системный промпт, инструменты или другие первые блоки, провайдер может перестать считать последующие токены повтором.
Что это даёт обычному разработчику или команде?
Это помогает выбирать более подходящий тариф и не переплачивать за AI-агента. Особенно полезно тем, кто работает с Claude Code, Cursor, OpenCode и похожими инструментами каждый день.

Читайте также

Попробовать Lord GPT бесплатно →