Новости Claude

Claude в сравнении с китайскими LLM на 12 рабочих тестах

Редакция Lord GPT · 31.08.2026
Четыре нейросетевые модели сравнивают на задачах кода и шахмат

В новом сравнении авторы проверили не флагманов, а более доступные китайские LLM, которые чаще всего используют в повседневных задачах и в продакшене. В подборку вошли MiniMax M3, LongCat 2.0, MiMo-v2.5-Pro и DeepSeek V4 Pro, а тестировали их на реальных рабочих сценариях — от кода до логики и безопасности.

Почему сравнивали именно эти модели

В этом материале авторы сознательно ушли от гонки флагманов и собрали участников по цене токена. Логика простая: когда модель вызывают не пару раз, а десятки и сотни тысяч раз в месяц, на первый план выходит стоимость работы, а не громкое имя.

В четвёрке оказались MiniMax M3, LongCat 2.0 от Meituan, MiMo-v2.5-Pro от Xiaomi и DeepSeek V4 Pro. Последняя уже была в прошлой части цикла, но теперь её снова прогнали по тем же 12 промптам — это позволило сравнить поведение одной и той же модели с интервалом в месяц.

Как тестировали и что оказалось важным

Методика осталась той же, что и раньше: никаких абстрактных бенчмарков, только прикладные задачи. Модели гоняли через BotHub по API, чтобы убрать влияние веб-интерфейсов, а расходы считали в CAPS, где 1 рубль равен 6370 CAPS.

Набор проверок включал кодинг, длинный контекст, стиль, суммаризацию, сравнение документов, внимание в середине длинного текста, анализ данных, разбор схемы, логику, шаблонность, галлюцинации и безопасность. Отдельно отметили важную деталь: из четырёх участников изображения принимает только одна модель, то есть для мультимодальных сценариев дешёвый китайский сегмент нужно проверять особенно внимательно.

Что показали результаты на простом примере

Самой показательной задачей стали браузерные шахматы. Все четыре модели справились с ней с первого раза: проекты запускались в Chrome без дополнительных условий и действительно игрались. Для этого цикла это лучший результат, и он пришёлся именно на самый дешёвый сегмент.

LongCat 2.0 собрала самый интересный и при этом самый дешёвый вариант. Она сделала проект всего из шести файлов, нарисовала доску на canvas и добавила вещи, которых никто не просил: кнопку отмены хода и отдельные списки захваченных фигур для белых и чёрных. MiniMax M3, наоборот, выдала самый минималистичный вариант — пять файлов, доску из div-ов и базовый интерфейс без лишних деталей. MiMo-v2.5-Pro и DeepSeek V4 Pro сделали более тяжёлые по структуре проекты — по восемь файлов каждая, с выбором фигуры при превращении пешки, подсветкой последнего хода и координатами по краям доски. При этом у MiMo путались захваченные фигуры, а у DeepSeek этот блок читался нормально.

Частые вопросы

Зачем вообще сравнивают более дешёвые модели, если есть флагманы?
Потому что в реальной работе важна не только точность, но и цена каждого запроса. Для компаний и сервисов, где запросов много, рабочая модель часто полезнее дорогого лидера.
Что в этом тесте оказалось самым практичным?
Самым полезным было сравнение на живых задачах: код, документы, логика и безопасность. Такой подход ближе к реальной работе, чем сухие бенчмарки.
Почему авторы отдельно обращают внимание на поддержку картинок?
Потому что в дешёвом китайском сегменте это не гарантированная функция. Если модель нужна для мультимодального пайплайна, поддержку изображений стоит проверять в первую очередь.
Чем DeepSeek V4 Pro отличалась от MiMo-v2.5-Pro?
По коду они оказались очень похожи, вплоть до одинаковой функции отрисовки съеденных фигур. Но у DeepSeek этот блок выглядел аккуратнее и читался лучше, чем у MiMo.

Читайте также

Попробовать Lord GPT бесплатно →