Новости Claude

Claude и Decision-модели: как ИИ начал выбирать без токенов

На столе распечатки с бенчмарками и API-заметками, рядом два монитора с кодом и серверные стойки на фоне

На рынке быстро набирает силу новый класс моделей для агентных сценариев: они не пишут текст, а сразу выбирают ответ из заданных вариантов. Разбираемся, как устроены Jev, Clef, pplx-decider, Strands Decider, Laya и GLiDE, и чем это может быть полезно в поддержке, автоматизации и проверках перед запуском действий.

Зачем вообще нужны decision-модели

Во многих ИИ-агентах большая модель вызывается даже там, где не нужен длинный ответ. На практике агенту часто достаточно понять, стоит ли запускать команду, какой инструмент выбрать или закончена ли задача — и на таких шагах генерация текста лишь замедляет процесс и добавляет лишние расходы.

TypeSafe 15 сентября представила Jev и назвала её первой моделью формата System One. Идея проста: система передаёт модели состояние и набор типизированных вопросов, а на выходе получает вероятности по допустимым вариантам ответа. Никакой генерации токенов здесь нет — решение считается за один прямой проход.

Что появилось после Jev и чем модели отличаются

За следующие 16 дней вышло ещё пять похожих решений: Clef и Clef-flash от Cloudflare, pplx-decider-v1-27b от Perplexity, Strands Decider 2B от AWS, Laya от Convai Innovations и GLiDE от Fastino. У интерфейса у них общая идея, но внутри подходы разные: где-то используют замороженную LLM с обучаемым выходным слоем, где-то меняют LM head, где-то применяют pointer-механизм, а где-то делают отдельный энкодер на 322 млн параметров или включают рассуждение только при необходимости.

Такая схема особенно удобна там, где текст уже есть в состоянии: тикет поддержки, история переписки, трасса агента, страница или JSON. Модель просто оценивает варианты — например, какой отдел должен обработать обращение или какой следующий шаг безопасен — и возвращает распределение вероятностей. Это полезно для фильтрации команд, маршрутизации запросов и дешёвой предварительной оценки решений.

Чем это выгодно в работе и что важно проверить

Главный плюс decision-моделей — скорость и цена. Если обычный LLM на каждом шаге генерирует текст, то здесь всё ограничивается входом: выходных токенов нет, а значит, нет и лишней парсинга/валидации результата. Jev, Clef и pplx-decider тарифицируют только входные токены, а несколько вопросов к одному и тому же состоянию выгодно отправлять одним запросом. У Clef, например, может быть до 64 вопросов за один вызов.

Но перед запуском в продакшен важно проверить детали. У Cloudflare, например, модель может принимать до четырёх картинок за запрос, а на Workers AI длинное текстовое состояние сейчас обрезается примерно до первых 2 000 токенов, что критично для документов и больших переписок. Ещё один момент — точность на конкретных задачах: в тестах Cloudflare одна из их моделей лидировала в 7 из 10 бенчмарков, но на отдельных сценариях уступала другим решениям. Поэтому перед внедрением лучше смотреть не на общую рекламу, а на свои реальные кейсы: поддержку, классификацию, контроль команд и отбор агентов.

Частые вопросы

Чем decision-модель отличается от обычной LLM?
Обычная LLM генерирует текст по токенам, а decision-модель сразу выбирает один из допустимых вариантов ответа. Это обычно быстрее, дешевле и проще для автоматической проверки.
Где такие модели могут пригодиться?
В поддержке клиентов, выборе инструмента для агента, проверке опасных команд, оценке ответов и в сценариях пентеста. Особенно полезны они там, где нужен не текст, а точное решение по правилам.
Можно ли заменить одну decision-модель другой?
Часто да, потому что у многих из них похожий интерфейс. Но перед сменой поставщика стоит проверить лимиты по контексту, числу вопросов, поддержке изображений и то, как модель ведёт себя на ваших данных.
Стоит ли сразу переносить такой подход в продакшен?
Не сразу: сначала лучше прогнать свои кейсы и убедиться, что модель правильно классифицирует ответы и не теряет важные части входа. Особенно это важно, если система работает с длинными документами или опасными действиями.

Читайте также

Попробовать Lord GPT бесплатно →