Новости Qwen

Qwen и FRIDA Decisions ускоряют выбор ответов на русском

Рабочее место разработчиков с кодом, распечатками бенчмарка и серверным оборудованием

Сбер представил FRIDA Decisions — открытую модель, которая быстро принимает решения на русском языке без генерации текста. Она подходит для модерации, маршрутизации обращений, разметки данных и ранжирования в RAG, а по качеству на своем бенчмарке почти догоняет коммерческий API и большую LLM.

Что умеет FRIDA Decisions

FRIDA Decisions отвечает не текстом, а выбором из заранее заданных вариантов. Модель может определить один класс из списка, поставить оценку по шкале, ответить «да» или «нет», а также упорядочить кандидатов в одном проходе энкодера.

Это делает её полезной там, где раньше для простого решения использовали большую языковую модель: при сортировке тикетов, проверке спама, выборе нужного инструмента, модерации сообщений и поиске релевантных фрагментов для RAG. Вместо длинного ответа и разбора JSON система сразу возвращает вероятности и итоговый вариант.

Почему это быстрее и дешевле

По данным статьи, модель отвечает за 28–34 мс на RTX 5060 Ti. Для сравнения, у коммерческого API независимые замеры показывают около 430 мс с учетом сети. Авторы также указывают, что при полной загрузке арендуемой карты один запрос выходит почти в 20 раз дешевле.

Есть и практический плюс по объему задач: несколько вариантов ответа кодируются одной последовательностью, поэтому токенов тратится меньше. В примере с тремя вопросами это примерно в 6 раз экономнее, а каталог из 243 интентов модель разбирает за 0,44 секунды вместо 4,65 секунды.

Что внутри и как это запустить

Основа FRIDA Decisions — FRIDA, русскоязычная эмбеддинг-модель на архитектуре FRED-T5. Её дообучили из эмбеддера в кросс-энкодер: модель смотрит на текст, вопрос и каждый вариант ответа вместе, а на выходе оценивает, какой вариант подходит лучше.

Проект выложен открыто: веса и код инференса доступны под MIT, есть ONNX-версия для CPU, запуск на Mac через MLX и vLLM-сервер. Для работы хватает примерно 2 ГБ видеопамяти, а без видеокарты int8-версия в ONNX работает примерно за 0,9 секунды на шести потоках.

Как оценили качество

Для русского языка авторы собрали бенчмарк razvilka: 735 примеров, 15 задач, все четыре типа вопросов и разметка из опубликованных русских корпусов. Спорные примеры удалили, а вместе с репозиторием выложили скрипт подсчета и тетрадку для прогона любой модели.

На этом тесте FRIDA Decisions набрала 0,893. Коммерческий API TypeSafe Jev показал 0,897, то есть разница минимальна. При этом модель заметно опережает открытые решения того же класса и может стать удобной заменой LLM там, где нужен быстрый и недорогой автоматический выбор ответа.

Частые вопросы

Где FRIDA Decisions может пригодиться в работе?
Везде, где нужно быстро классифицировать текст без генерации: в поддержке клиентов, модерации, фильтрации спама, маршрутизации запросов и ранжировании документов для поиска.
Чем такая модель отличается от обычной LLM?
Она не пишет длинный ответ, а сразу выбирает лучший вариант из списка. Из-за этого она быстрее, дешевле и проще для задач, где нужен именно точный выбор.
Можно ли запустить её без мощной видеокарты?
Да. В статье указано, что есть ONNX-версия для CPU, а int8-вариант работает примерно за 0,9 секунды на шести потоках.
Почему это важно для русского языка?
Для русского рынка не так много открытых решений, которые умеют быстро и качественно принимать классификационные решения. Здесь есть готовая модель, открытый бенчмарк и варианты запуска в разных средах.

Читайте также

Попробовать Lord GPT бесплатно →