Claude и другие LLM: как собрать свой бенчмарк
Команда одной лаборатории не стала полагаться только на публичные рейтинги и проверила LLM на своих реальных задачах. Для этого они собрали собственный тест из 24 вопросов по лабораторному журналу и сравнили несколько моделей по качеству, честности и стоимости.
Почему общие рейтинги не всегда помогают
Когда выбирают LLM, обычно смотрят на таблицы лидеров. Но такие рейтинги показывают усреднённые знания и не отвечают на главный вопрос: справится ли модель именно с вашими данными, инструментами и рабочими сценариями.
В этой лаборатории ИИ-ассистент работает с электронным лабораторным журналом: ищет записи, открывает вложения, вытаскивает значения и иногда считает по ним. Для таких задач важно не только угадать ответ, но и честно признаться, если данные не проверены или запрос вообще не стоит выполнять.
Как проверяли DeepSeek, ChatGPT и Claude
Авторы собрали бенчмарк из 24 вопросов, взятых из настоящей работы. Они разделили их на пять групп: навигация, извлечение данных из файлов, многошаговое рассуждение, ловушки и проверка честности ответа.
Тест прогоняли через живой журнал по mcp, а в сравнение попали модели DeepSeek, ChatGPT и Claude. Всего получилось 19 сочетаний модели и уровня reasoning effort, а самих прогонов было около 450. При этом ассистент работал только на чтение: из 58 инструментов базы ему оставили 31.
Что показал тест и почему это важно для бизнеса
Результаты сильно отличались: от 75% до 100% в зависимости от модели и режима рассуждения. Разброс по цене оказался ещё заметнее — примерно в 40 раз: от 12 центов до почти 5 долларов за один и тот же набор из 24 вопросов.
Для бизнеса это хороший урок: дорогая модель не всегда нужна, а дешёвая не всегда достаточно надёжна. Если ассистент работает с документами, журналами, отчётами или базой знаний, лучше проверить его на своих задачах, чем ориентироваться только на общий рейтинг. Особенно это важно там, где ошибка может попасть в отчёт или решение, как в примерах с неверными датчиками, толщиной плёнки или перепутанными файлами.