Новости Claude

Claude и другие LLM: как собрать свой бенчмарк

Лабораторный стол с распечатками, мониторами и базой данных для проверки LLM

Команда одной лаборатории не стала полагаться только на публичные рейтинги и проверила LLM на своих реальных задачах. Для этого они собрали собственный тест из 24 вопросов по лабораторному журналу и сравнили несколько моделей по качеству, честности и стоимости.

Почему общие рейтинги не всегда помогают

Когда выбирают LLM, обычно смотрят на таблицы лидеров. Но такие рейтинги показывают усреднённые знания и не отвечают на главный вопрос: справится ли модель именно с вашими данными, инструментами и рабочими сценариями.

В этой лаборатории ИИ-ассистент работает с электронным лабораторным журналом: ищет записи, открывает вложения, вытаскивает значения и иногда считает по ним. Для таких задач важно не только угадать ответ, но и честно признаться, если данные не проверены или запрос вообще не стоит выполнять.

Как проверяли DeepSeek, ChatGPT и Claude

Авторы собрали бенчмарк из 24 вопросов, взятых из настоящей работы. Они разделили их на пять групп: навигация, извлечение данных из файлов, многошаговое рассуждение, ловушки и проверка честности ответа.

Тест прогоняли через живой журнал по mcp, а в сравнение попали модели DeepSeek, ChatGPT и Claude. Всего получилось 19 сочетаний модели и уровня reasoning effort, а самих прогонов было около 450. При этом ассистент работал только на чтение: из 58 инструментов базы ему оставили 31.

Что показал тест и почему это важно для бизнеса

Результаты сильно отличались: от 75% до 100% в зависимости от модели и режима рассуждения. Разброс по цене оказался ещё заметнее — примерно в 40 раз: от 12 центов до почти 5 долларов за один и тот же набор из 24 вопросов.

Для бизнеса это хороший урок: дорогая модель не всегда нужна, а дешёвая не всегда достаточно надёжна. Если ассистент работает с документами, журналами, отчётами или базой знаний, лучше проверить его на своих задачах, чем ориентироваться только на общий рейтинг. Особенно это важно там, где ошибка может попасть в отчёт или решение, как в примерах с неверными датчиками, толщиной плёнки или перепутанными файлами.

Частые вопросы

Зачем делать свой бенчмарк, если есть публичные рейтинги?
Потому что общий рейтинг не показывает, как модель поведёт себя на ваших данных, в ваших файлах и с вашими инструментами. В реальной работе важны точность, умение ссылаться на источник и честный отказ, а не только общий балл.
Какие задачи вошли в тест?
Четыре основные группы: поиск нужного образца в базе, извлечение значений из файлов, многошаговые расчёты, ловушки на ошибочные данные и проверка того, умеет ли модель признавать, что не смогла ответить.
Что оказалось самым важным в оценке?
Авторы смотрели не только на верный ответ, но и на то, есть ли ссылка на источник и умеет ли модель честно отказаться от ответа. Именно ловушки и честность лучше всего показывают, можно ли доверять ассистенту в рабочем процессе.
Как это может пригодиться обычной команде?
Если вы используете ИИ для документов, поддержки, аналитики или внутренних баз знаний, стоит собрать небольшой тест под свои сценарии. Это помогает выбрать модель, которая будет не просто умной, но и полезной в ежедневной работе.

Читайте также

Попробовать Lord GPT бесплатно →