Новости Claude

Claude, GPT и Gemini: как выбрать LLM для рабочих задач

Рабочее место с кодом, тестами и распечатанными документами для сравнения LLM

Выбрать LLM по бенчмаркам уже недостаточно: одна модель может блестяще писать код, но споткнуться о ваш реальный репозиторий, документы и ручные ограничения. В статье разбирают, как сравнивать Claude, GPT, Gemini и другие модели на своих задачах и не переплачивать за лишние доработки.

Почему тесты из интернета не заменяют вашу задачу

Автор статьи, Игорь Зуриев, советует начинать не с громких рейтингов, а с собственных рабочих сценариев. В реальной работе почти всегда есть нюансы: несколько файлов вместо одного, старые правила расчёта, неполные материалы, ограничения по времени и по правкам.

Поэтому важно проверять не «идеальный» запрос, а задачу в том виде, как она выглядит у вас в проекте. Для кода это должно быть воспроизводимое изменение с тестами, для аналитики — расчёт, который можно повторить, а для мониторинга — выводы, которые можно подтвердить конкретными источниками.

Что автору понравилось в Claude и где он сравнивает модели

В качестве отправной точки Зуриев часто берёт Claude, потому что Fable 5.1, по его наблюдению, хорошо справлялась с кодом и документами: код появлялся почти без ошибок с первого раза, а содержательные материалы было удобно собирать и дорабатывать. Но это пока личные наблюдения, а не полноценный замер качества.

Для сложных задач он предлагает смотреть не только на результат, но и на количество ручной работы после ответа. Если модель выдаёт рабочий код, но потом приходится переписывать полпроекта, то экономия времени исчезает. Поэтому сравнение Claude, Opus, Sonnet и других моделей лучше делать на одном и том же кейсе с понятными условиями приёмки.

Как проверять модели на коде, документах и прототипах

Один из практичных тестов для разработки — исправление ошибки в CSV-импорте. Модель должна найти причину сбоя на определённой дате, добавить тест, который воспроизводит проблему, внести минимальную правку и не сломать существующие проверки. Если новая версия исправляет баг, но меняет публичный интерфейс без необходимости, это уже минус.

Для документов подходит другая проверка: собрать презентацию по готовому отчёту и сохранить исходные цифры, ссылки и оговорки. Важный смысл такой проверки прост — не потерять контекст и не превратить осторожную формулировку в ложную уверенность. Именно так удобно оценивать, насколько Claude или другая LLM помогает в реальной офисной работе, а не только в красивом демо.

Что влияет на стоимость и когда переплата оправдана

В статье также приводятся базовые цены API для Fable 5.1, Opus 5 и Sonnet 5. Для входных и выходных токенов ставки у них разные, а чтение кэша в версии 5.1 стало заметно дешевле. Автор отдельно подчёркивает, что обещание Anthropic о снижении стоимости нельзя автоматически переносить на любой одиночный запрос — выгода сильнее заметна в длинных агентных сценариях.

Главная практическая мысль здесь такая: выбирать модель стоит не по цене за токен в вакууме, а по итоговой пользе. Если более дорогая Claude или другая LLM сокращает число исправлений, экономит часы на ревью и быстрее доводит задачу до результата, она может оказаться выгоднее более дешёвого варианта.

Частые вопросы

Зачем сравнивать модели на своих задачах, если есть публичные бенчмарки?
Публичные тесты помогают сузить круг кандидатов, но не показывают, как модель поведёт себя на ваших файлах, ограничениях и баге в конкретном репозитории. В работе важнее результат на вашем сценарии и количество доработок после ответа.
Чем хорош подход автора к проверке LLM?
Он предлагает смотреть не только на качество ответа, но и на то, сколько ручной работы остаётся человеку. Это особенно полезно для кода, документов и аналитики, где «почти готово» часто означает дополнительные часы исправлений.
Когда Claude может быть особенно полезна?
Автор считает Claude удобной отправной точкой для сложного кода и содержательных документов, а также для сценариев, где важно получить рабочий результат с минимальным микроменеджментом. Но финальный выбор всё равно лучше делать по своему тесту.
Как понять, что модель стоит своих денег?
Сравните не только цену API, но и итоговые затраты времени на проверку, исправления и ручную доработку. Если более дорогая модель сокращает эти затраты заметно, переплата может быть оправдана.

Читайте также

Попробовать Lord GPT бесплатно →