Qwen запустили на FPGA за $50 без NVIDIA
Энтузиаст показал, что большую языковую модель можно поднять не только на привычной видеокарте. Для эксперимента он взял открытую архитектуру openTPU, плату FPGA примерно за $50 и подключил её к мини-ПК.
Что именно удалось собрать
Автор проекта захотел проверить, можно ли запустить настоящий инференс LLM на физической FPGA, а не ограничиваться теорией и схемами из GitHub. Для этого он взял openTPU — открытый AI-ускоритель от Felipe Sens Bonetto — и перенёс идею в железо.
В сборке использовалась плата Xilinx Kintex-7 XC7K480T с 4 ГБ памяти, купленная на AliExpress, а подключение к обычному мини-ПК MINISFORUM было сделано через PCIe. В итоге языковая модель действительно заработала на FPGA, то есть вычисления для нейросети выполнялись не на NVIDIA GPU, а на открытом ускорителе.
Почему это важно не только для энтузиастов
Главная идея здесь не в том, чтобы немедленно заменить мощные серверные ускорители вроде NVIDIA H100. Такой прототип пока не соперник топовым решениям и тем более не серийный ASIC.
Но сам подход полезен: теперь можно не просто рассуждать о собственном AI-процессоре, а тестировать архитектуру на реальном оборудовании. Это важно всем, кто думает о специализированных чипах под задачи машинного обучения — от инженеров и разработчиков до компаний, которые хотят считать модели дешевле и гибче, чем на стандартных GPU.
Что это даёт на практике
Автор отдельно приводит ориентир по производительности на похожей плате: модель Qwen3.5–35B с 35 млрд параметров работала примерно со скоростью 4 токена в секунду при наличии 4 ГБ памяти. Это не рекорд для отрасли, но уже рабочий результат для эксперимента на FPGA старшего поколения.
Для обычного читателя смысл простой: ИИ всё чаще используют не только как программу, но и как инструмент для проектирования самого железа. А для предпринимателей и разработчиков это сигнал, что открытые проекты вроде openTPU могут стать стартовой точкой для собственных прототипов ускорителей, если нужно проверять идеи быстро и без больших затрат.