Claude и месяц работы с AI-агентом: API или подписка
За сентябрь 2026 автор пересчитал, сколько стоит месяц работы разработчика с AI-агентом, и сравнил API с подписками. Разброс получился огромным: от $87 на DeepSeek до $7 720 на GPT-6 Astra, а на итоговый счёт сильнее всего влияет не количество ваших слов, а кэш и то, как агент собирает контекст.
Почему счёт зависит не от запросов, а от кэша
В расчёте за месяц взяли обычную рабочую нагрузку: 492 миллиона новых входных токенов, 2,3 миллиарда токенов из кэша, 10 миллионов выходных токенов и около 25 тысяч запросов. На такой модели видно важную вещь: 82% всего объёма — это повторное чтение уже отправленного контекста.
Это меняет логику экономии. Раньше старались просто сокращать промпты, а теперь важнее, чтобы начало запроса не менялось между вызовами. Если сессия стабильно повторяет системный промпт, описания инструментов и историю, кэш помогает сильно снизить стоимость. Но если в начале промпта что-то поменять, кэш может инвалидироваться, и всё снова посчитается по полной цене.
На практике у Claude Code уже запущенная сессия занимает десятки тысяч токенов даже до первого осмысленного сообщения. Это значит, что платить приходится не только за то, что человек напечатал, а за весь контекст, который агент отправляет модели сам.
Что может сломать экономию на Claude и других агентах
Автор отдельно разбирает, почему кэш не стоит считать памятью. Если харнес — например, Claude Code, OpenCode или Cursor — не отправил старый фрагмент, модель его просто не увидит. А при смене начала промпта всё, что идёт дальше, уже не считается повтором.
Есть и практические правила. Не стоит переподключать MCP-серверы или редактировать правила, которые входят в системный промпт: у Anthropic даже изменение описаний инструментов может сбросить кэш. Лучше подключать MCP-серверы и скиллы на уровне проекта, а не глобально, чтобы они не уезжали в каждый вызов без необходимости.
Ещё важно смотреть на TTL кэша. У Anthropic API стандартный срок — 5 минут, расширенный — час. В Claude Code на подписках Pro и Max часть служебных запросов и собственные действия пользователя могут получать часовой TTL автоматически, но при переходе на usage credits это снова становится 5 минутами, если не задать promptCacheTtl: 1h. У OpenAI для GPT-5.6 и более новых моделей минимальный TTL — 30 минут.
Подписка не всегда выгоднее API
Отдельная часть пересчёта касается подписок. В прошлой таблице лимиты выглядели привлекательно, потому что считались по числу запросов. Но такой подход обманчив: у OpenCode Go, например, лимит задаётся в долларах, а оценка запросов работает только для запросов определённого размера. Если ваши запросы тяжелее и тянут за собой сотни тысяч токенов кэша, реальная экономика меняется.
Из-за этого пересчёт через API и подписки дал совсем другой результат. OpenCode Go стоит $10 в месяц, а в новых расчётах его лимит уже нельзя сравнивать с лёгкими запросами один к одному. Для бизнеса и разработчиков вывод простой: смотреть нужно не на количество запросов в рекламе, а на реальные токены и структуру контекста.
Разброс по моделям тоже очень большой. Между GPT-6 Astra и DeepSeek V4.1 Flash вне пика разница почти в 90 раз: $7 720 против $87. А если бы кэша не было, тот же месяц на Opus 5 стоил бы около $14 000 вместо $3 860.