DeepSeek Harness запустил 176B-модель Qwen3.8-Flash-Next на GTX 1080 Ti
На старой GeForce GTX 1080 Ti удалось запустить крупную Qwen3.8-Flash-Next, которую относят к 176B-классу. Эксперимент показал, что даже модель с весами больше 100 GB можно поднять локально, если правильно распределить нагрузку между видеокартой и оперативной памятью.
Что именно запустили и почему это заметно
Речь идёт о Qwen3.8-Flash-Next — мультимодальной MoE-модели, которую команда Qwen описывает как ранний взгляд на архитектуру будущей Qwen4. У неё 125 млрд параметров в основной части, ещё около 51 млрд приходится на n-gram embedding-таблицы, а на один токен активируется примерно 6 млрд параметров. Именно поэтому её часто называют моделью 176B-класса.
Архитектура тоже необычная: в ней сочетаются Gated DeltaNet и Qwen Sparse Attention, всего 48 слоёв, 512 экспертов MoE и контекст до 262 144 токенов. Для обычного пользователя это означает, что модель может работать с очень длинными задачами, а для разработчика — что крупную модель иногда реально запускать не только на дорогом сервере, но и на более старом железе.
Как удалось обойти ограничение в 11 GB VRAM
Главная сложность была очевидной: файл модели занимает больше 100 GB, а у GTX 1080 Ti всего 11 GB видеопамяти. В этом эксперименте помогли llama.cpp и оффлоад части вычислений в оперативную память, а агентной оболочкой выступил DeepSeek Harness.
Автор выбрал не Ollama, потому что для этой конкретной модели и формата были ограничения и ошибки при работе с GGUF в актуальной ветке. В итоге использовали GGUF-вариант UD-Q4_K_XL от Unsloth, состоящий из четырёх shard-файлов общим размером примерно 111 GB. Для сборки потребовались CUDA toolkit, подходящий для карты, и современный Node.js для DeepSeek Harness.
Что это даёт на практике
Полученная скорость составила около 11 токенов в секунду. Для живого чата это не рекорд, но для пакетной обработки, сложных инструкций, работы с кодом и агентных сценариев такой результат уже может быть полезен.
Здесь важен не только сам рекорд ради рекорда. Эксперимент показывает, что предприниматель, разработчик или технический энтузиаст может запускать очень крупные модели локально, не покупая сразу мощный сервер. Это особенно интересно, если нужны длинный контекст, мультишаговые задачи и более аккуратное следование инструкциям, чем у меньших локальных моделей.
Почему автор вообще пошёл в такую сторону
До этого он уже пробовал Qwen3.8-27B и gpt-oss-120b. Меньшая Qwen3.8-27B казалась рациональнее по памяти, но в конкретных сценариях с кодом и агентной работой показала себя хуже, чем хотелось. А опыт с большим gpt-oss-120b подсказал, что sparse-MoE-модели можно поднимать даже на системе с ограниченной VRAM.
По сути, новость здесь не только про одну видеокарту. Она про то, что локальный ИИ становится гибче: иногда можно взять более тяжёлую модель и всё равно заставить её работать на домашнем ПК, если правильно подобрать формат, движок и способ загрузки.