Gemma-4 を 2016 Xeon で実行
デモ: Gemma-4 を 2016 Xeon で実行する
オープンソースのGemマ-4モデルの個人ブログ投稿が、GPU加速なしで2016 Xeonサーバーで実行できることを示した。投稿者は、GitHubレポジトリとHacker Newsの議論へのリンクを付けて、ポイントが200点、コメントが72点を獲得した。書き手は、モデルを起動するために使用した精確なCPU世代、オペレーティングシステム、Python環境をリストアップしている。
投稿者は、記録的な高速性を主張していない。代わりに、トークンあたり数秒でインサージョンを完了できることを示している。書き手は、Xeonの12コアレイアウトと2.6GHzベースクロックが、モデルをサーバーの64GB RAM制限内に保持するのに十分だったと説明している。
古いハードウェアはまだ使える
現代のLLMsは高エンドGPUを要求することが多いが、Gemマ-4のデモは、CPUのみインサージョンが多くのワークロードで実行可能であることを思い出す。XeonのAVX-512拡張子が行列乗算を加速し、トランスフォーマーインサージョンを支配する。ブログは、量化を4ビット整数にするとメモリ使用量が約75%削減され、古いRAMに収まることを指摘している。
書き手はまた、コスト差異を強調している。再利用可能な2016 Xeonサーバーを500ドル以下で購入できるのに対し、同等のGPU基板の価格は数千ドルである。この価格差は、スタートアップやハブリスターがクラウドGPUクレジットを購入できない場合に重要である。
ソフトウェアは新しい課題者
インテルの最近のソフトウェアファースト戦略の推進は、Gemマ-4の物語を呼び覚ました。2022年のインテルイノベーションでは、ベータ版の量子SDKとアップデートされたLavaスタックを発表し、ニューロモーフィックコンピューティングのために。インテルはプレスリリースで、ソフトウェアがハードウェアよりも採用を推進する、と強調した。この論理は、LLMsにも適用できる。モデルを最適化したランタイムと量化パイプラインは、古いCPUを競争力に戻す。
インテルの発表もKapoho Pointを含んでいた。このボードはLoihi 2チップをソフトウェアスタックと組み合わせている。ハードウェアは素晴らしいが、インテルはメッセージは開発者がシリコンをリデザインすることなくパフォーマンスを抽出できるようにするためのオープンソースツールに注力していた。Gemマ-4デモは、この物語の草莽版である。これは、ソフトウェアが平等な戦場を作り出す。
AIデプロイメントの影響
既存のサーバファームを投入した企業は、再利用を検討できる。デモは、データセンターの更新サイクルが伸び、e-wasteが減ることを示唆している。しかし、パフォーマンスの制限はGPUクラスタより下にあるため、レイテンシーに敏感なアプリケーションはまだ専用アクセラレータが必要かもしれない。
AIコミュニティ全体では、混合ハードウェアパイプラインへの移行が起こるかもしれない。企業はバッチインサージョンをCPUで行い、トレーニングまたはリアルタイムサービス用にGPUを予約する。Intelのソフトウェアファーストのピッチに合致し、次の財政年度の購入決定に影響を与えるかもしれない。
観察
GitHubでGemマ-4インサージョンスクリプトの次回のリリースをウォッチし、IntelのQuantum SDKとLavaスタックのロードマップをチェックし、CPUのみLLMインサージョンをターゲットにした価格帯をクラウドプロバイダーが提供している場合、業界が遺産ハードウェアの論理を真剣に受け止めていることを確認する。