Gemma-4 在 2016 Xeon 上运行
#Gemma-4 在一个老化 Xeon 上的演示
一篇个人博客文章证明了开源的 Gemma-4 模型可以在 2016 Xeon 服务器上运行,而不需要 GPU 加速。作者在点.free 上发布了详细的教程,并链接到 GitHub 仓库和 Hacker News 讨论,讨论已经获得 200 个点和 72 个评论。教程列出了准确的 CPU 代号、操作系统和 Python 环境用于启动模型。
这篇文章并没有宣称是历史性时速。它只是显示了 inference 在几秒钟内完成,足够用于交互式使用。作者注意到 Xeon 的 12 核构型和 2.6 GHz 基频足以保持模型的内存占用在服务器的 64 GB RAM 限制之内。
#为什么老旧硬件仍然有效
现代 LLM 通常要求高端 GPU,但 Gemma-4 演示提醒读者 CPU-only inference 在许多负载中仍然可行。 Xeon 的 AVX-512 扩展加速了控制 transformer inference 的矩阵乘法。博客指出模型的 4 位整数量化将内存占用降低了大约 75%,适合于老化 RAM。
作者还突出了成本差异:一台重制的 2016 Xeon 服务器可以低于 500 美元,而一台可比的 GPU rig 的价格高达数千美元。这一价格差异对于无法负担云 GPU 代币的初创公司和业余爱好者来说至关重要。
#软件成为新的不同iator
英特尔最近推出了软件第一的战略,echoed Gemma-4 故事。 2022 年英特尔创新 2022 年,该公司发布了 beta Quantum SDK 和更新的 Lava 堆栈用于神经计算。 在新闻发布会上,英特尔强调了软件将推动采用,而不是底层芯片。 该逻辑适用于 LLM:一个优化的运行时和量化管道可以使老旧的 CPU 竞争。
英特尔的公告还包括 Kapoho Point,一块将 Loihi 2 芯片与软件堆栈配对的板子。 虽然硬件很令人印象深刻,但英特尔的宣传重点在于让开发者通过软件工具提取性能而不需要重新设计硅。 Gemma-4 演示是草根版的这一叙述:软件技巧平衡了平面。
#AI 部署的影响
已经投资于老旧服务器场的企业现在可以考虑重新部署它们用于 inference 负载。 演示表明数据中心刷新周期可以延长,从而减少电子废物。 然而,性能瓶颈仍然低于 GPU 集群,因此 latency 敏感的应用程序可能仍然需要专用加速器。
更广泛的 AI 社区可能会看到混合硬件管道的转变。 公司可以在 CPU 上运行批量 inference,同时保留 GPU 进行训练或实时服务。 这一混合模型与英特尔的软件第一策略相符,并可能影响未来一年的采购决定。
##要关注
关注 GitHub 上 Gemma-4 运行时脚本的下一个版本,它承诺将添加英特尔 oneAPI 库的支持。 还要关注英特尔的 Quantum SDK 和 Lava 堆栈的路线图,因为它们对 CPU-only 运行时的更紧密集成将巩固软件第一的方法。 最后,监测云供应商的价格层次,特别是 CPU-only LLM 推理,表明该行业正在认真对待老旧硬件。