Claude Fable неожиданно обогнал GPT-5.6 в задаче переписывания кода с нуля
Лидерборд бенчмарка MirrorCode обновили новыми результатами флагманских моделей Anthropic и OpenAI — и в одном сценарии Claude Fable 5 заметно вырвался вперед. Он справился с переписыванием программ с нуля лучше, чем GPT-5.6 Sol, хотя на других тестах модели обычно идут почти на равных.
Что произошло
Исследователи из Epoch AI обновили таблицу результатов MirrorCode — теста, который проверяет, насколько хорошо ИИ умеет переписывать код заново по заданию. В этом обновлении Claude Fable 5 решил заметно больше задач, чем GPT-5.6 Sol.
Разрыв выглядит необычно, потому что в других бенчмарках эти модели чаще показывают близкие результаты. Значит, речь не о «сильной» или «слабой» модели вообще, а о том, как она ведет себя именно в задачах на полную переработку программного кода.
Почему это важно для работы
Для разработчиков это полезный сигнал: разные модели могут быть хороши в разных типах задач. Одна лучше пишет новые фрагменты, другая — аккуратнее переписывает старый код, а третья сильнее в проверке и исправлении.
Для команд, которые используют ИИ в работе, это напоминание не выбирать сервис только по одному общему рейтингу. Если вам нужно обновлять легаси-код, переносить проект на другой стек или быстро собирать рабочий прототип, стоит смотреть именно на практические тесты, близкие к вашей задаче.
Что с этим делать обычному пользователю
Если вы не программист, новость все равно полезна: ИИ-сервисы нужно оценивать не по громкому имени, а по тому, насколько хорошо они решают конкретную задачу. Это относится и к коду, и к текстам, и к маркетинговым материалам, и к аналитике.
Поэтому перед внедрением ИИ лучше протестировать несколько моделей на своих реальных примерах. Часто именно так проще понять, какой сервис экономит время, а какой только выглядит впечатляюще на бумаге.
Частые вопросы
Что такое MirrorCode простыми словами?
Это бенчмарк, который проверяет, насколько хорошо ИИ умеет переписывать программы по заданию, а не просто дописывать отдельные строки кода.
Почему Claude Fable мог обойти GPT-5.6 именно здесь?
Похоже, эта модель лучше справилась именно с задачей полного переписывания кода. На других тестах разрыв почти не виден, значит, сильная сторона у моделей может отличаться.
Как использовать такой результат в работе?
Смотреть на ИИ не как на универсальный ответ, а как на инструмент под конкретную задачу. Для кода, текстов или аналитики полезно делать короткое сравнение на своих примерах.