Всё про ChatGPT

ChatGPT и Jev сравнили в тесте на ошибки и цену

Рабочее место с распечатками, мониторами с кодом и устройствами для тестирования ИИ

Модель Jev проверили не только на точность, но и на то, где ей можно доверять в реальной работе, а где лучше включать дополнительную проверку. В большом наборе тестов она оказалась быстрой и дешёвой, но у неё тоже нашлись свои слабые места.

Что именно проверяли

Автор прогнал Jev-1.13.0 через 22 эксперимента с 19 по 30 сентября 2026 года и отправил около 160 тысяч запросов к самой модели и контрольным моделям OpenAI. Все проверки шли через API раннего доступа и в сумме обошлись примерно в 18 долларов.

Его интересовала не рекламная скорость сама по себе, а практические границы применения: как модель ведёт себя по сравнению с небольшими GPT, можно ли опираться на confidence для автоматического роутинга, что будет при длинном контексте, грязном тексте, большом числе классов и другом языке.

Где Jev выглядит сильнее ChatGPT

В базовой задаче классификации Jev показала точность примерно на уровне gpt-4.1-mini, если обеим моделям дать только описания классов. При этом Jev работала в 2,4 раза быстрее и примерно в 5 раз дешевле.

Отдельно важна калибровка уверенности. У GPT высокий confidence часто не означает, что ответ действительно надёжен: 83% её ошибок были сделаны с уверенностью выше 0.9. У Jev таких ошибок было 29%, поэтому её порог уверенности лучше подходит для автоматической сортировки запросов.

Где начинаются проблемы

Автор отдельно подчёркивает, что порог уверенности нельзя переносить бездумно между разными схемами и наборами классов: если добавить новые категории, тот же cutoff начнёт пропускать больше ошибок. То есть для реального продукта метрику нужно перепроверять на своём сценарии.

Ещё один вывод касается входных данных. Лишний или «грязный» текст мешает модели не только в конце контекста, а сразу, и Jev на такие помехи чувствительнее, чем GPT. Если на вход попадает текст, похожий на письмо или другой чужой жанр, модель может заметно смещаться в сторону неправильного класса. Для совсем чужих запросов отдельный класс other оказался полезнее, чем попытка отсеивать всё через порог.

Что это значит для работы и бизнеса

Из теста полезно вынести простой практический вывод: Jev может быть хороша там, где нужно быстро и дёшево разбирать обращения по категориям, особенно если есть понятные описания классов и важно качество уверенности, а не генерация длинного текста.

Но если в потоке много мусора, нестандартных формулировок или смешанных языков, модель стоит использовать как часть схемы с дополнительной проверкой. В таких случаях особенно полезно заранее тестировать свои данные, а не полагаться только на общие цифры из презентации или описания API.

Частые вопросы

Чем Jev отличается от обычного ChatGPT-подхода?
Jev не генерирует текст в привычном смысле, а выбирает вариант ответа из заданных классов и возвращает ещё и распределение вероятностей. Это удобно для классификации обращений, маршрутизации и автоматической фильтрации.
Можно ли просто взять порог уверенности и использовать его везде?
Нет, автор прямо показывает, что порог зависит от схемы, числа классов и типа данных. Для рабочей системы его нужно калибровать на своих примерах.
Когда Jev особенно полезна?
Когда нужно быстро и дёшево разбирать поток коротких запросов по категориям, например в поддержке, банке, операциях или внутреннем триаже сообщений. Также она может помочь, если важно понимать не только ответ, но и уверенность модели.
Что делать, если входной текст шумный или нестандартный?
В таких случаях лучше не рассчитывать только на confidence. Практичнее добавить класс other, предусмотреть дополнительную проверку и протестировать систему на реальных примерах до запуска.

Читайте также

Попробовать Lord GPT бесплатно →