Новости Claude

Claude Fable неожиданно обогнал GPT-5.6 в задаче переписывания кода с нуля

Редакция Lord GPT · 06.08.2026
Два абстрактных ИИ-сервиса сравнивают результаты работы с кодом на экранах в офисе

Лидерборд бенчмарка MirrorCode обновили новыми результатами флагманских моделей Anthropic и OpenAI — и в одном сценарии Claude Fable 5 заметно вырвался вперед. Он справился с переписыванием программ с нуля лучше, чем GPT-5.6 Sol, хотя на других тестах модели обычно идут почти на равных.

Что произошло

Исследователи из Epoch AI обновили таблицу результатов MirrorCode — теста, который проверяет, насколько хорошо ИИ умеет переписывать код заново по заданию. В этом обновлении Claude Fable 5 решил заметно больше задач, чем GPT-5.6 Sol.

Разрыв выглядит необычно, потому что в других бенчмарках эти модели чаще показывают близкие результаты. Значит, речь не о «сильной» или «слабой» модели вообще, а о том, как она ведет себя именно в задачах на полную переработку программного кода.

Почему это важно для работы

Для разработчиков это полезный сигнал: разные модели могут быть хороши в разных типах задач. Одна лучше пишет новые фрагменты, другая — аккуратнее переписывает старый код, а третья сильнее в проверке и исправлении.

Для команд, которые используют ИИ в работе, это напоминание не выбирать сервис только по одному общему рейтингу. Если вам нужно обновлять легаси-код, переносить проект на другой стек или быстро собирать рабочий прототип, стоит смотреть именно на практические тесты, близкие к вашей задаче.

Что с этим делать обычному пользователю

Если вы не программист, новость все равно полезна: ИИ-сервисы нужно оценивать не по громкому имени, а по тому, насколько хорошо они решают конкретную задачу. Это относится и к коду, и к текстам, и к маркетинговым материалам, и к аналитике.

Поэтому перед внедрением ИИ лучше протестировать несколько моделей на своих реальных примерах. Часто именно так проще понять, какой сервис экономит время, а какой только выглядит впечатляюще на бумаге.

Частые вопросы

Что такое MirrorCode простыми словами?

Это бенчмарк, который проверяет, насколько хорошо ИИ умеет переписывать программы по заданию, а не просто дописывать отдельные строки кода.

Почему Claude Fable мог обойти GPT-5.6 именно здесь?

Похоже, эта модель лучше справилась именно с задачей полного переписывания кода. На других тестах разрыв почти не виден, значит, сильная сторона у моделей может отличаться.

Как использовать такой результат в работе?

Смотреть на ИИ не как на универсальный ответ, а как на инструмент под конкретную задачу. Для кода, текстов или аналитики полезно делать короткое сравнение на своих примерах.

Читайте также

Попробовать Lord GPT бесплатно →