OpenTPU 发布了一套端到端 AI 加速器技术栈,能在约 300 美元的 Kintex-7 FPGA 卡上运行现代语言模型。

采用 Apache-2.0 许可的仓库包含 SystemVerilog 硬件、指令集、位精确模拟器、内核语言与编译器、性能分析工具和主机软件。其价值在于可检查性:同一套小型代码库从 Python 模型内核一直覆盖到实体 PCIe 板卡上的信号。

为什么重要

学习推理(inference)硬件的开发者无需数据中心加速器,就能追踪每个时钟周期和每次内存传输的去向。这台机器比当前 GPU 慢,但它的限制让瓶颈格外清晰。

OpenTPU 报告称,四比特 Qwen3-0.6B 模型每秒生成 30.7 个 token,LFM2.5-230M 每秒生成 82.1 个,均包含主机开销。在列出的配置中,更大的稠密模型速度更慢:Qwen3.5-2B 每秒 12.03 个 token,Gemma 4 E4B 每秒 3.75 个。

解码时,板卡达到两个 DDR3 通道 17.1 GB/s 峰值带宽的 82%–94%。因此,限制资源是内存带宽,而非矩阵运算。四列脉动阵列单元对提示词处理的帮助大于对逐 token 生成的帮助。

超过板卡 4 GiB 容量的模型可以从主机存储流式加载混合专家权重。仓库报告,LFM2.5-8B-A1B 每秒生成 10.6 个 token,Qwen3.5-35B-A3B 每秒 3.95 个,后者每个 token 需经 PCIe 传输 153 MB。这些是项目自己的测量结果,但脚本、标明日期的构建版本和测量条件均已公开。

“由 AI 开发”的描述需要谨慎理解。据项目称,人类主导的智能体(agent)工作流完成了大量设计和优化,但这并不表明自主系统决定创建自己的硬件。具体成果是公开的技术栈,以及项目报告的板卡与模拟器逐比特一致的结果。

下一步测试很明确:在同款板卡上复现已发布的比特流,与低价 GPU 比较功耗和延迟,并观察外部贡献者能否修改架构而不破坏与模拟器的等价性。

核实

说法标签一手来源独立核实
OpenTPU 以 Apache-2.0 许可发布硬件、指令集架构、模拟器、编译器和主机工具已核实OpenTPU 仓库文件和许可证可访问
四比特配置下,按实际耗时计算,Qwen3-0.6B 每秒生成 30.7 个 token,LFM2.5-230M 每秒生成 82.1 个据公司称OpenTPU 测量结果无
解码使用了 17.1 GB/s DDR3 峰值带宽的 82%–94%据公司称OpenTPU 测量结果无
Qwen3.5-35B-A3B 在每个 token 流式传输 153 MB 时达到每秒 3.95 个 token据公司称OpenTPU 测量结果无
板卡逐比特复现模拟器的 token据公司称OpenTPU 仓库存在公开测试;未找到独立硬件复现
“由 AI 开发”不能证明硬件开发具有自主性分析OpenTPU 仓库区分依据是文档记载的人类主导工作流