Perplexity победила в бенчмарке Decision Models на русском
Появился новый бенчмарк для моделей, которые не пишут текст, а принимают решения: выбирать вариант ответа, ставить оценку или отвечать «да/нет». В тесте на 5000 русскоязычных примерах локальная Perplexity Decider 27B оказалась точнее всех, а быстрые и дешёвые модели показали, где у них сильные и слабые стороны.
Зачем вообще нужны Decision Models
Автор статьи объясняет, что большие языковые модели всё чаще используют не только для общения или написания текстов, но и для рутинных решений: маршрутизации запросов, модерации, оценок и похожих задач. Проблема в том, что для таких простых случаев мощная LLM часто тратит лишние ресурсы — как будто огромной фурой везут одну упаковку сырников.
Decision Models предлагают другой подход: вместо генерации свободного текста модель выбирает один из нескольких вариантов, отвечает «да/нет», ставит балл по шкале или заполняет несколько связанных полей. Для бизнеса и команд это полезно там, где нужен быстрый и предсказуемый ответ без длинной генерации и лишних затрат на инференс.
Что показал бенчмарк на 5000 примеров
Для сравнения собрали 12 моделей и прогнали их на 5000 русскоязычных примерах в пяти категориях. Задачи были без глубокой узкой специфики: обычный вопрос-ответ с разметкой людьми, чтобы проверить именно качество принятия решений, а не умение рассуждать на редкой доменной теме.
По точности лучше всех выступила локальная Perplexity Decider 27B — 98,14%. Почти вплотную за ней идёт Jev от TypeSafe с результатом 96,46%. Из облачных решений самым быстрым оказался OpenAI Decisions — 109 мс, а самым дешёвым в пересчёте на тысячу решений стал Liquid d1 — $0,009. При этом маленькие модели хорошо смотрятся в узких сценариях, но на универсальном наборе заметно уступают более крупным.
Что важно для практики
У моделей принятия решений разная внутренняя архитектура, но идея одна: не генерировать лишний текст там, где нужно просто выбрать правильный вариант. Среди участников были решения от Perplexity, TypeSafe, Cloudflare, OpenAI, Liquid, Fastino, FRIDA и Laya; часть работает в облаке, часть можно разворачивать локально. Отдельно сравнивали и отечественные варианты FRIDA и FRIDA-Decisions на 823 млн параметров.
Автор делает важный вывод: ошибки возникают не только из-за слабости модели, но и из-за размытых правил самой задачи. Это особенно полезно помнить тем, кто строит автоматизацию в поддержке, модерации или внутренних сервисах: иногда проблема не в ИИ, а в том, что условия выбора сформулированы слишком неоднозначно. В статье также отмечено, что быстрый прогон и честное сравнение требуют аккуратной инфраструктуры: проверок GPU, smoke-вызовов и прогрева модели перед измерениями.