Claude, GPT и Gemini: как выбрать LLM для рабочих задач
Выбрать LLM по бенчмаркам уже недостаточно: одна модель может блестяще писать код, но споткнуться о ваш реальный репозиторий, документы и ручные ограничения. В статье разбирают, как сравнивать Claude, GPT, Gemini и другие модели на своих задачах и не переплачивать за лишние доработки.
Почему тесты из интернета не заменяют вашу задачу
Автор статьи, Игорь Зуриев, советует начинать не с громких рейтингов, а с собственных рабочих сценариев. В реальной работе почти всегда есть нюансы: несколько файлов вместо одного, старые правила расчёта, неполные материалы, ограничения по времени и по правкам.
Поэтому важно проверять не «идеальный» запрос, а задачу в том виде, как она выглядит у вас в проекте. Для кода это должно быть воспроизводимое изменение с тестами, для аналитики — расчёт, который можно повторить, а для мониторинга — выводы, которые можно подтвердить конкретными источниками.
Что автору понравилось в Claude и где он сравнивает модели
В качестве отправной точки Зуриев часто берёт Claude, потому что Fable 5.1, по его наблюдению, хорошо справлялась с кодом и документами: код появлялся почти без ошибок с первого раза, а содержательные материалы было удобно собирать и дорабатывать. Но это пока личные наблюдения, а не полноценный замер качества.
Для сложных задач он предлагает смотреть не только на результат, но и на количество ручной работы после ответа. Если модель выдаёт рабочий код, но потом приходится переписывать полпроекта, то экономия времени исчезает. Поэтому сравнение Claude, Opus, Sonnet и других моделей лучше делать на одном и том же кейсе с понятными условиями приёмки.
Как проверять модели на коде, документах и прототипах
Один из практичных тестов для разработки — исправление ошибки в CSV-импорте. Модель должна найти причину сбоя на определённой дате, добавить тест, который воспроизводит проблему, внести минимальную правку и не сломать существующие проверки. Если новая версия исправляет баг, но меняет публичный интерфейс без необходимости, это уже минус.
Для документов подходит другая проверка: собрать презентацию по готовому отчёту и сохранить исходные цифры, ссылки и оговорки. Важный смысл такой проверки прост — не потерять контекст и не превратить осторожную формулировку в ложную уверенность. Именно так удобно оценивать, насколько Claude или другая LLM помогает в реальной офисной работе, а не только в красивом демо.
Что влияет на стоимость и когда переплата оправдана
В статье также приводятся базовые цены API для Fable 5.1, Opus 5 и Sonnet 5. Для входных и выходных токенов ставки у них разные, а чтение кэша в версии 5.1 стало заметно дешевле. Автор отдельно подчёркивает, что обещание Anthropic о снижении стоимости нельзя автоматически переносить на любой одиночный запрос — выгода сильнее заметна в длинных агентных сценариях.
Главная практическая мысль здесь такая: выбирать модель стоит не по цене за токен в вакууме, а по итоговой пользе. Если более дорогая Claude или другая LLM сокращает число исправлений, экономит часы на ревью и быстрее доводит задачу до результата, она может оказаться выгоднее более дешёвого варианта.