跳到正文
热点事件持续更新

分享Qwen3.5在FPGA上的推理实现与实测

1 篇报道1 个报道来源12 小时前更新

先了解这件事

AI 综述

2026年10月5日,Reddit r/LocalLLaMA 用户 /u/I_am_purrfect 分享在 FPGA 上运行 Qwen3.5 INT4 推理的工程实践。据其介绍,使用 eBay 购入的 SQRL FK33 矿机 FPGA(280 美元,8GB HBM2)双卡,在 75MHz 下运行 Qwen3.5-9B,生成速度约 2 tok/s,输出已与 llama.cpp 逐层比对;其称更高时钟需进一步优化 RTL 并提高核心电压。该开发者同时给出尚未实际运行的估算:Qwen3.5-27B INT4 基于 9B 实测逐算子画像建模;并称双 die 上下文上限约 45k,因 27B 的 KV cache 在 14.5GB 权重之外放不下,跑满 262k 需四 die。相关代码已以 MIT 协议开源在 GitHub(Nero7991/llm.vhdl)。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. r/LocalLLaMA
    在廉价 eBay 矿机上用 FPGA 实现 Qwen3.5 9B/27B INT4 推理

    开发者用 eBay 矿机 FPGA 搭建 Qwen3.5 INT4 推理方案:SQRL FK33(280 美元,8GB HBM2)双卡在 75MHz 下跑 Qwen3.5-9B,生成约 3.2 tok/s、2-3k 上下文时约 2.4 tok/s,输出已与 llama.cpp 逐层比对。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。