ChatGPT и Jev сравнили в тесте на ошибки и цену
Модель Jev проверили не только на точность, но и на то, где ей можно доверять в реальной работе, а где лучше включать дополнительную проверку. В большом наборе тестов она оказалась быстрой и дешёвой, но у неё тоже нашлись свои слабые места.
Что именно проверяли
Автор прогнал Jev-1.13.0 через 22 эксперимента с 19 по 30 сентября 2026 года и отправил около 160 тысяч запросов к самой модели и контрольным моделям OpenAI. Все проверки шли через API раннего доступа и в сумме обошлись примерно в 18 долларов.
Его интересовала не рекламная скорость сама по себе, а практические границы применения: как модель ведёт себя по сравнению с небольшими GPT, можно ли опираться на confidence для автоматического роутинга, что будет при длинном контексте, грязном тексте, большом числе классов и другом языке.
Где Jev выглядит сильнее ChatGPT
В базовой задаче классификации Jev показала точность примерно на уровне gpt-4.1-mini, если обеим моделям дать только описания классов. При этом Jev работала в 2,4 раза быстрее и примерно в 5 раз дешевле.
Отдельно важна калибровка уверенности. У GPT высокий confidence часто не означает, что ответ действительно надёжен: 83% её ошибок были сделаны с уверенностью выше 0.9. У Jev таких ошибок было 29%, поэтому её порог уверенности лучше подходит для автоматической сортировки запросов.
Где начинаются проблемы
Автор отдельно подчёркивает, что порог уверенности нельзя переносить бездумно между разными схемами и наборами классов: если добавить новые категории, тот же cutoff начнёт пропускать больше ошибок. То есть для реального продукта метрику нужно перепроверять на своём сценарии.
Ещё один вывод касается входных данных. Лишний или «грязный» текст мешает модели не только в конце контекста, а сразу, и Jev на такие помехи чувствительнее, чем GPT. Если на вход попадает текст, похожий на письмо или другой чужой жанр, модель может заметно смещаться в сторону неправильного класса. Для совсем чужих запросов отдельный класс other оказался полезнее, чем попытка отсеивать всё через порог.
Что это значит для работы и бизнеса
Из теста полезно вынести простой практический вывод: Jev может быть хороша там, где нужно быстро и дёшево разбирать обращения по категориям, особенно если есть понятные описания классов и важно качество уверенности, а не генерация длинного текста.
Но если в потоке много мусора, нестандартных формулировок или смешанных языков, модель стоит использовать как часть схемы с дополнительной проверкой. В таких случаях особенно полезно заранее тестировать свои данные, а не полагаться только на общие цифры из презентации или описания API.