Новости Perplexity

Perplexity победила в бенчмарке Decision Models на русском

Рабочее место с распечатками, мониторами и серверным оборудованием для тестирования моделей принятия решений

Появился новый бенчмарк для моделей, которые не пишут текст, а принимают решения: выбирать вариант ответа, ставить оценку или отвечать «да/нет». В тесте на 5000 русскоязычных примерах локальная Perplexity Decider 27B оказалась точнее всех, а быстрые и дешёвые модели показали, где у них сильные и слабые стороны.

Зачем вообще нужны Decision Models

Автор статьи объясняет, что большие языковые модели всё чаще используют не только для общения или написания текстов, но и для рутинных решений: маршрутизации запросов, модерации, оценок и похожих задач. Проблема в том, что для таких простых случаев мощная LLM часто тратит лишние ресурсы — как будто огромной фурой везут одну упаковку сырников.

Decision Models предлагают другой подход: вместо генерации свободного текста модель выбирает один из нескольких вариантов, отвечает «да/нет», ставит балл по шкале или заполняет несколько связанных полей. Для бизнеса и команд это полезно там, где нужен быстрый и предсказуемый ответ без длинной генерации и лишних затрат на инференс.

Что показал бенчмарк на 5000 примеров

Для сравнения собрали 12 моделей и прогнали их на 5000 русскоязычных примерах в пяти категориях. Задачи были без глубокой узкой специфики: обычный вопрос-ответ с разметкой людьми, чтобы проверить именно качество принятия решений, а не умение рассуждать на редкой доменной теме.

По точности лучше всех выступила локальная Perplexity Decider 27B — 98,14%. Почти вплотную за ней идёт Jev от TypeSafe с результатом 96,46%. Из облачных решений самым быстрым оказался OpenAI Decisions — 109 мс, а самым дешёвым в пересчёте на тысячу решений стал Liquid d1 — $0,009. При этом маленькие модели хорошо смотрятся в узких сценариях, но на универсальном наборе заметно уступают более крупным.

Что важно для практики

У моделей принятия решений разная внутренняя архитектура, но идея одна: не генерировать лишний текст там, где нужно просто выбрать правильный вариант. Среди участников были решения от Perplexity, TypeSafe, Cloudflare, OpenAI, Liquid, Fastino, FRIDA и Laya; часть работает в облаке, часть можно разворачивать локально. Отдельно сравнивали и отечественные варианты FRIDA и FRIDA-Decisions на 823 млн параметров.

Автор делает важный вывод: ошибки возникают не только из-за слабости модели, но и из-за размытых правил самой задачи. Это особенно полезно помнить тем, кто строит автоматизацию в поддержке, модерации или внутренних сервисах: иногда проблема не в ИИ, а в том, что условия выбора сформулированы слишком неоднозначно. В статье также отмечено, что быстрый прогон и честное сравнение требуют аккуратной инфраструктуры: проверок GPU, smoke-вызовов и прогрева модели перед измерениями.

Частые вопросы

Что такое Decision Model простыми словами?
Это модель, которая не пишет ответ целиком, а выбирает один вариант из заданных. Такой формат удобен для классификации, фильтрации, модерации и других прикладных задач.
Чем это отличается от обычного structured output у LLM?
В structured output модель всё равно генерирует текст, просто по схеме. В decision-модели сам ответ ограничен набором вариантов, и она возвращает выбор и вероятности.
Кому полезен этот бенчмарк?
Тем, кто подбирает ИИ для поддержки, маршрутизации обращений, скоринга или модерации. Он помогает сравнить точность, скорость и стоимость, а не полагаться только на маркетинг.
Почему в таких задачах важна неоднозначность правил?
Потому что модель может ошибаться не из-за нехватки «умности», а из-за того, что варианты ответа и критерии выбора описаны неясно. Чем точнее правила, тем стабильнее работает автоматизация.

Читайте также

Попробовать Lord GPT бесплатно →