Новости Claude

Claude считает русский текст почти вчетверо дороже GPT-5.5

На столе лежат распечатки русских и английских текстов, рядом калькулятор и два монитора с таблицей сравнения токенов

В новом замере выяснилось, что один и тот же русский текст в Claude Opus 5 превращается в 3,9 раза больше токенов, чем в GPT-5.5. При одинаковой цене за токен это делает работу с русским контентом заметно дороже.

Почему цена за токен не показывает реальный расход

Автор сравнил не просто тарифы, а то, сколько токенов разные модели тратят на один и тот же текст. Проблема в том, что у каждой модели свой токенизатор: одна «режет» русский крупными кусками, другая почти по буквам. Поэтому одинаковая цена за миллион токенов не означает одинаковый счёт для русского текста.

На примере Claude Opus 5 и GPT-5.5 разница оказалась очень большой: Claude насчитал в русском тексте в 3,9 раза больше токенов. Для бизнеса, маркетинга, поддержки и любых русскоязычных продуктов это значит, что реальная стоимость может сильно отличаться даже при внешне похожих тарифах.

Что показал замер 11 моделей

В исследовании сравнили 11 токенизаторов, связанных с GPT, Claude, Gemini, DeepSeek, Qwen, GLM, Kimi, Grok, GigaChat и YandexGPT. Для проверки использовали четыре пары параллельных текстов на русском и английском: технический абзац, диалог клиента и поддержки, уведомление об изменении тарифов и Python-код с комментариями.

Результат получился очень разным. У Claude Opus 5 на один токен приходится около одного символа русского текста. У YandexGPT и GigaChat — наоборот, до примерно пяти символов на токен, и русский у них даже короче английской версии. У GPT-5.x/6, Gemini, Grok и GLM русский текст выходит примерно на 18–23% дороже английского по токенам, у DeepSeek — на 38%, у Qwen — на 52%, у Kimi — на 86%.

Как это применять на практике

Самый полезный вывод для тех, кто считает бюджет на API: смотреть нужно не только на цену за 1M токенов, а на стоимость типичного запроса или тысячи символов именно на ваших текстах. Это особенно важно, если продукт работает по-русски, а в документации модели указана только цена за токены.

Ещё один важный момент — не все агрегаторы показывают настоящий usage. В статье автор показал способ считать токены через разницу двух запросов, чтобы убрать служебные токены чата и системные вставки. Такой подход помогает честнее сравнивать модели и заранее оценить расходы до запуска продукта.

Частые вопросы

Почему Claude выходит дороже именно на русском?
Потому что у него русский текст дробится на большее число токенов. Если цена за токен одинаковая, больше токенов означает больший счёт.
Можно ли ориентироваться только на цену за 1M токенов?
Нет, для русскоязычных задач этого недостаточно. Лучше считать стоимость на ваших реальных текстах — например, на тысячу символов или на типичный запрос.
Какие модели лучше всего экономят русский текст?
В замере лучше всего с русским справились YandexGPT и GigaChat: у них русский текст даже короче английского по токенам.
Зачем обычному пользователю знать про токенизатор?
Если вы платите за API, токенизатор напрямую влияет на расходы. Это важно для чатов поддержки, генерации текстов, автоматизации документов и других русскоязычных задач.

Читайте также

Попробовать Lord GPT бесплатно →