Новости Gemini

Gemini и Jev сравнили в реранке для ОКТРУ

На столе распечатки, рядом планшет со стилусом и два монитора с данными для реранка

Для классификации товаров по справочнику ОКТРУ протестировали не только LLM, но и модель Jev, которая не генерирует текст, а сразу возвращает вероятности. На 928 позициях Jev оказался точнее, а по скорости и цене приблизился к компактной 8B-модели.

Почему здесь вообще нужен реранк

Речь о задачe классификации закупочных позиций по справочнику ОКТРУ, где около 77 772 кодов. Часто это не просто выбор названия, а попадание в нужный листовой код с точным путём по иерархии, поэтому соседние варианты легко перепутать.

Обычная схема тут такая: поиск сначала отбирает примерно 30 кандидатов, а затем второй этап выбирает один правильный код. Именно этот шаг и оказался самым дорогим по времени и деньгам, поэтому автор и проверил, можно ли заменить его на модель без генерации текста.

Что показал тест Jev против LLM

Сравнение провели на 928 позициях из технических спецификаций госзакупок, на одном и том же пуле кандидатов. В тесте участвовали gpt-oss-120b в двух режимах, Gemma-4-31B, Gemini 3.5 Flash Lite, Gemini 3.8 Flash, Gemini 3.1 Pro и кросс-энкодер Qwen3-Reranker-8B.

Jev показал лучшую точность среди участников и по парному тесту оказался значимо лучше, включая более дорогие большие модели. При этом по стоимости он вышел дешевле LLM без reasoning примерно в 2 раза, дешевле LLM с reasoning в 2.5 раза и дешевле облачной модели с мышлением в 13 раз. По задержке на позицию Jev тоже был заметно быстрее.

Отдельно автор отметил, что gpt-oss менял ответ примерно на каждой шестой позиции от прогона к прогону, и отключение reasoning это не устраняло. Для задач, где важна повторяемость результата, это может быть неприятным сюрпризом.

Чем Jev удобен на практике

TypeSafe Jev работает не как обычный чат-бот: он принимает состояние и типизированные вопросы, а на выходе даёт вероятности по заранее заданным вариантам. То есть не нужно заставлять модель писать текст, парсить JSON и проверять, не придумала ли она несуществующий код.

Для бизнеса и команд, которые строят поиск, классификацию или внутренние помощники, это полезно тем, что второй этап пайплайна можно удешевить без сильной потери качества. В такой схеме дорогой генеративный ответ не обязателен: если нужно выбрать один вариант из списка, иногда лучше обойтись моделью, которая сразу оценивает вероятности.

В самом пайплайне поиск без реранка дал Acc@1 0.487, но попадание нужного кода в top-30 уже достигало 90%. После реранка точность по листовому коду выросла до 78%, а по правильной группе третьего уровня — до 82%. Это как раз тот случай, когда ИИ помогает не только “понимать текст”, но и экономить на инфраструктуре.

Частые вопросы

Почему не обучить обычный классификатор сразу на 77 тысяч кодов?
Проблема в данных: по большинству кодов размеченных примеров почти нет или нет совсем. Поэтому задача лучше решается как поиск кандидатов и последующий выбор, а не как классическая supervised-классификация.
Что именно делает Jev лучше LLM в этом сценарии?
Он не тратит ресурсы на генерацию текста и работает как вероятностный выбор из заранее заданных вариантов. Это снижает цену и задержку, а качество на этом тесте не просело.
Где такая схема может пригодиться кроме закупок?
В любых задачах, где есть большой справочник и нужно выбрать один вариант из ограниченного списка: каталоги, документы, внутренние базы знаний, классификация заявок и обращений.
Нужно ли полностью отказываться от LLM?
Не обязательно. Но если задача сводится к выбору из нескольких кандидатов, имеет смысл сначала проверить более дешёвый реранкер без генерации — это может дать почти ту же точность при меньших затратах.

Читайте также

Попробовать Lord GPT бесплатно →