Claude и Decision-модели: как ИИ начал выбирать без токенов
На рынке быстро набирает силу новый класс моделей для агентных сценариев: они не пишут текст, а сразу выбирают ответ из заданных вариантов. Разбираемся, как устроены Jev, Clef, pplx-decider, Strands Decider, Laya и GLiDE, и чем это может быть полезно в поддержке, автоматизации и проверках перед запуском действий.
Зачем вообще нужны decision-модели
Во многих ИИ-агентах большая модель вызывается даже там, где не нужен длинный ответ. На практике агенту часто достаточно понять, стоит ли запускать команду, какой инструмент выбрать или закончена ли задача — и на таких шагах генерация текста лишь замедляет процесс и добавляет лишние расходы.
TypeSafe 15 сентября представила Jev и назвала её первой моделью формата System One. Идея проста: система передаёт модели состояние и набор типизированных вопросов, а на выходе получает вероятности по допустимым вариантам ответа. Никакой генерации токенов здесь нет — решение считается за один прямой проход.
Что появилось после Jev и чем модели отличаются
За следующие 16 дней вышло ещё пять похожих решений: Clef и Clef-flash от Cloudflare, pplx-decider-v1-27b от Perplexity, Strands Decider 2B от AWS, Laya от Convai Innovations и GLiDE от Fastino. У интерфейса у них общая идея, но внутри подходы разные: где-то используют замороженную LLM с обучаемым выходным слоем, где-то меняют LM head, где-то применяют pointer-механизм, а где-то делают отдельный энкодер на 322 млн параметров или включают рассуждение только при необходимости.
Такая схема особенно удобна там, где текст уже есть в состоянии: тикет поддержки, история переписки, трасса агента, страница или JSON. Модель просто оценивает варианты — например, какой отдел должен обработать обращение или какой следующий шаг безопасен — и возвращает распределение вероятностей. Это полезно для фильтрации команд, маршрутизации запросов и дешёвой предварительной оценки решений.
Чем это выгодно в работе и что важно проверить
Главный плюс decision-моделей — скорость и цена. Если обычный LLM на каждом шаге генерирует текст, то здесь всё ограничивается входом: выходных токенов нет, а значит, нет и лишней парсинга/валидации результата. Jev, Clef и pplx-decider тарифицируют только входные токены, а несколько вопросов к одному и тому же состоянию выгодно отправлять одним запросом. У Clef, например, может быть до 64 вопросов за один вызов.
Но перед запуском в продакшен важно проверить детали. У Cloudflare, например, модель может принимать до четырёх картинок за запрос, а на Workers AI длинное текстовое состояние сейчас обрезается примерно до первых 2 000 токенов, что критично для документов и больших переписок. Ещё один момент — точность на конкретных задачах: в тестах Cloudflare одна из их моделей лидировала в 7 из 10 бенчмарков, но на отдельных сценариях уступала другим решениям. Поэтому перед внедрением лучше смотреть не на общую рекламу, а на свои реальные кейсы: поддержку, классификацию, контроль команд и отбор агентов.