Gemini и Jev сравнили в реранке для ОКТРУ
Для классификации товаров по справочнику ОКТРУ протестировали не только LLM, но и модель Jev, которая не генерирует текст, а сразу возвращает вероятности. На 928 позициях Jev оказался точнее, а по скорости и цене приблизился к компактной 8B-модели.
Почему здесь вообще нужен реранк
Речь о задачe классификации закупочных позиций по справочнику ОКТРУ, где около 77 772 кодов. Часто это не просто выбор названия, а попадание в нужный листовой код с точным путём по иерархии, поэтому соседние варианты легко перепутать.
Обычная схема тут такая: поиск сначала отбирает примерно 30 кандидатов, а затем второй этап выбирает один правильный код. Именно этот шаг и оказался самым дорогим по времени и деньгам, поэтому автор и проверил, можно ли заменить его на модель без генерации текста.
Что показал тест Jev против LLM
Сравнение провели на 928 позициях из технических спецификаций госзакупок, на одном и том же пуле кандидатов. В тесте участвовали gpt-oss-120b в двух режимах, Gemma-4-31B, Gemini 3.5 Flash Lite, Gemini 3.8 Flash, Gemini 3.1 Pro и кросс-энкодер Qwen3-Reranker-8B.
Jev показал лучшую точность среди участников и по парному тесту оказался значимо лучше, включая более дорогие большие модели. При этом по стоимости он вышел дешевле LLM без reasoning примерно в 2 раза, дешевле LLM с reasoning в 2.5 раза и дешевле облачной модели с мышлением в 13 раз. По задержке на позицию Jev тоже был заметно быстрее.
Отдельно автор отметил, что gpt-oss менял ответ примерно на каждой шестой позиции от прогона к прогону, и отключение reasoning это не устраняло. Для задач, где важна повторяемость результата, это может быть неприятным сюрпризом.
Чем Jev удобен на практике
TypeSafe Jev работает не как обычный чат-бот: он принимает состояние и типизированные вопросы, а на выходе даёт вероятности по заранее заданным вариантам. То есть не нужно заставлять модель писать текст, парсить JSON и проверять, не придумала ли она несуществующий код.
Для бизнеса и команд, которые строят поиск, классификацию или внутренние помощники, это полезно тем, что второй этап пайплайна можно удешевить без сильной потери качества. В такой схеме дорогой генеративный ответ не обязателен: если нужно выбрать один вариант из списка, иногда лучше обойтись моделью, которая сразу оценивает вероятности.
В самом пайплайне поиск без реранка дал Acc@1 0.487, но попадание нужного кода в top-30 уже достигало 90%. После реранка точность по листовому коду выросла до 78%, а по правильной группе третьего уровня — до 82%. Это как раз тот случай, когда ИИ помогает не только “понимать текст”, но и экономить на инфраструктуре.