BTC ETH SOL XRP DOGE S&P 500 NASDAQ DOW EUR/USD USD/JPY GOLD
BTC ETH SOL XRP DOGE S&P 500 NASDAQ DOW EUR/USD USD/JPY GOLD

Read the English original

جيمما-4 تعمل على إكسون 2016

old server rack with blinking lights running AI model

المثال: Gemma-4 على Xeon السابق

posted مدونة شخصية أن Gemma-4 يمكن أن تعمل على خادم إكسون 2016 بدون تسريع GPU. تم نشر المقال الكامل على point.free، مع رابط لملف توزيع GitHub ومُناقشة Hacker News التي تجاوزت 200 نقطة و 72 تعليقاً. المقال ي ราย اسماء المعالج الدقيق، نظام التشغيل، والمبيت Python المستخدم لتشغيل نموذج المقال.

لا يزعم المقال سرعة سجلية. فقط يظهر أنه تکمل الاستنتاج في عدد من الأيام على لكل token، كافياً للاستخدام المتصلة. يلاحظ المؤلف أن إكسون 12-cores والذاكرة الأساسية 2.6 GHz كانت كافية لتوفير footprint ذاكرة نموذج المقال داخل خادم المقال 64 GB RAM الحد.

لماذا يعمل hardware القديم لا يزال يعمل

LLMs الحديثة غالباً تحتاج إلى GPUs عالية الجودة، ولكن المثال Gemma-4 يذكر القراء أن التمثيل CPU فقط لا تزال قابلة للاستخدام لبعض الاوجهات العمل. Extensions AVX-512 ل إكسون تسريع ضربات المصفوفة التي تحكم استنتاج transformer. المدونة تذكر أن نموذج المقال تم تحويله إلى 4-bit integers خفض استخدام الذاكرة بتقريباً 75%، مما يجعلها مناسبة للذاكرة القديمة.

المؤلف يضيف أيضاً أنه يتطلب differential التكلفة: خادم إكسون 2016 قابل للتعديل يمكن شراءه تحت 500 دولار، بينما خادم GPU قابل للتعديل يلزم بضعة آلاف دولار. هذا الفرق في التكلفة يهم للشركات الصغيرة والمتعلمين الذين لا يستطيعون شراء credits GPU النوافذة.

البرمجيات كالفرق الجديدة

Intel’s recent push على strategies البرمجية الأولى يلفت الانتباه إلى قصة Gemma-4. في Intel Innovation 2022 تم إطلاق beta Quantum SDK والبرمجية Lava stack for neuromorphic computing. في بيان الإعلان، Intel stressed أن البرمجيات سوف تنقل الادخار أكثر من المكونات الأساسية. نفس المنطق ينطبق على LLMs: pipeline Runtime Optimized وpipeline quantization يمكن أن يجعل CPU قديماً competitive.

announcements Intel أيضاً شامل Kapoho Point، لوحة تجمع chips Loihi 2 مع البرمجية stack. بينما hardware هو مذهل، Intel’s messaging مركزة على أدوات مفتوحة المصدر التي تتيح لل разработة extracting performance دون الحاجة إلى redesigning silicon. المثال Gemma-4 هو نسخة grassroots من تلك القصة: البرمجية tricks level اللاعبين.

Be implications for تنفيذ الذكاء الاصطناعي

شركات التي قد投资ت بالفعل في مزارع السيرفر السابقة الآن يمكن أن تستعيد استخدامها لاوجهات العمل للتمثيل. المثال يبدو أن دورة ت refresh البيانات يمكن أن تكون Stretch، مما يقلل من waste الإلكتروني. ومع ذلك، فإن الحد الأقصي للتحديث يظل أقل من GPU clusters، لذلك التطبيقات الحساسة للزمن قد تحتاج إلى تخصيص accelerators.

من المجتمع AI الواسع قد يرى تحول نحو pipelines hardware المختلطة. الشركات يمكن أن تتشغيل batch inference على CPUs بينما تترك GPUs لتدريب أوخدمة الوقت الحقيقي. هذا الحمل النجمي مع Intel’s البرمجية pitch الأولى ويمكن أن يؤثر على قرارات الشراء في العام المالي التالي.

ماذا يجب أن يكون المراقب

راقب releases التالية من script inference Gemma-4 على GitHub، التي تضم الدعم لل libraries oneAPI Intel. أيضاً، مر على roadmap Intel لل SDK Quantum و Lava stack، حيث tighter integration مع runtimes CPU فقط يمكن أن يثبت approach البرمجية الأولى. أخيراً، رصد cloud providers ل Pricing tiers التي تهدف بشكل صريح إلى تمثيل CPU فقط LLM inference، علامة على أن السوق يتخذ argument legacy hardware بجدية.