Gemma-4 2016 Xeon'de çalışır
Demo: 2016 Xeon’da Gemma-4
Bir kişisel blog yazısı, açık kaynak Gemma-4 modelinin 2016 Xeon sunucusunda herhangi bir GPU hızlandırma olmadan çalışabileceğini kanıtladı. Yazı, bir GitHub deposu ve 200 puan ve 72 yorum alan Hacker News tartışmasıyla bağlantısını verdi. Yazı, tam bir walkthrough’unu point.free’da yayınlayarak, oluşturmak için kullanılan exact CPU jenerasyonu, işletim sistemi ve Python ortamını listelemektedir.
Yazı, rekor kırıcı hızda çalışmadığını belirtmeksizin, bir parça token için birkaç saniye içinde tamamlanma süresini gösterir. 2006 Xeon’un 12-kodlu düzeni ve 2.6 GHz temel saat hızı, modelin bellek izini sunucunun 64 GB RAM sınırlarına sokmak için yeterli oldu.
Öldüğü Donanım Halen İşliyor
Modern LLM’ler genellikle yüksek-güç GPU’leri talep eder, ancak Gemma-4 demo okurlara CPU-only infereance’nın birçok yük için hala geçerliliğini hatırlatıyor. Xeon’un AVX-512 uzantıları, transformer infereance’da hâkim olan matris çarpımlarını hızlandırıyor. Blog, modelin 4-bit tam sayılara quantizasyonu, bellek kullanımını yaklaşık %75 oranında azaltıyor ve bu da legacy RAM’de rahatça oturabiliyor.
Yazar, aynı zamanda fiyat farklılığını vurguladı: yenilenmiş 2016 Xeon sunucusu, birkaç bin dolarlık bir GPU riginden daha ucuz, 500 dolar altı fiyatla satın alınabiliyor. Bu fiyat farklılığı, cloud GPU kredisini satın alamayan startuplar ve hobiler için önemli.
Yazılımın Yeniden Tadilatı
Intel’in son zamanlardaki yazılım-öncesi stratejilerine verdiği önem, Gemma-4 hikayesi tarafından teyit ediliyor. 2022 Intel Innovation’da şirket, beta Quantum SDK ve güncellenen Lava stack’i için neuromorfik hesaplama için yayınladı. Basın açıklamasında Intel, yazılımın daha çok alt yüklemli çiplerden daha fazla benimseme göstereceğini vurguladı. Aynı mantık, LLM’ler için de geçerlidir: iyi optimizasyonlu bir runtime ve quantization akış hattı, eski bir CPU’yı rekabetçi yapabilir.
Intel’in açıklamalarının da dahil olduğu Kapoho Point, Loihi 2 çiplerini bir yazılım paketi ile bir araya getiren bir karttır. Cihazlar impression edici, ancak Intel’in mesajı, geliştiricilerin silikon yeniden tasarımı yapmadan performans extraksiyonu yapabilmelerine izin veren açık kaynak araçlara odaklandı. Gemma-4 demo, bu hikayenin grassroots versiyonudur: yazılım triki, sahaya eşitlik sağlar.
AI Deployment’ın İpotezleri
Gemi-4 demo’su eski sunucuların yeniden amaçlanıp, infereance yükleri için kullanılabileceğini gösteriyor. Demo, veri merkezlerinde yenileme döngülerinin uzatılmasına ve e-atık azaltılmasına yol açabilir. Ancak, performansı GPU kümelerinden daha düşük olduğu için, gecikme-cihaz uygulamaları hala özel hızlandırıcılar gerekebilir.
Beyazötesi AI topluluğunda, birleşik-hardware akımlarının bir shifti olabilir. Şirketler CPU’ler için batch infereance çalıştırabilirken, GPU’ler için eğitim ya da gerçek zamanlı sunum için ayrılmış olabilir. Bu karma model, Intel’in yazılım-öncesi önerisini destekliyor ve gelecekteki mali yılı satın alma kararlarını etkileyebilir.
İzleyin
Gemma-4 infereance scriptinin sonraki sürümünü izleyin, Intel’in oneAPI kütüphaneleri için destek ekleyeceğini vaat ediyor. Ayrıca, Intel’in Quantum SDK ve Lava stack’ine olan rota takibini izleyin; daha sıkı bir entegrasyon CPU-only runtimes ile, yazılım-öncesi yaklaşımın kalıcılığı sağlatabilir. Son olarak, bulut sağlayıcıları fiyatlandırma seviyelerini izleyin ki, açıkça CPU-only LLM infereance hedef alırsa, endüstri, legacy-donanım argümanını ciddiye alıyor gibi görünüyor.