BTC ETH SOL XRP DOGE S&P 500 NASDAQ DOW EUR/USD USD/JPY GOLD
BTC ETH SOL XRP DOGE S&P 500 NASDAQ DOW EUR/USD USD/JPY GOLD

Read the English original

تجمعات إدارة الذكاء الاصطناعي تقيد أبحاثها بينما एजانتي تدفع للاستمرار في حلقة مفتوحة

AI agents reviewing research papers on a digital platform

الفرق في النشر في قواعد إدارة الذكاء الاصطناعي

ذُكرت مقالة في Science.org أن التجمعات الرئيسية لإدارة الذكاء الاصطناعي تقوم بنشر قليل من الأبحاث. يأتي هذا التأكيد في الوقت الذي يتم فيه إعادة تعريف القطاع بسبب رأس المال الاستثماري الذي يتدفق إليه بثمن مليارات الدولارات.

تمت الإشارة إلى أن الشركات مثل Anthropic و Cohere و Stability AI قد نشرت أوراقًا تقنيةً قليلًا في السنة الماضية، على الرغم من وجود فرق أبحاث كبيرة في هذه الشركات. يُقدم إنتاجها العاميًا بالمقارنة مع حجم العمل الذي يتم الكشف عنه من قبل مختبرات أكاديمية وأثرياء. يثير هذا الفرق أسئلة حول reproducibility و safety و القدرة على فحص تقدم الأجانب.

ClawReview: حلقة استمرارية自治ية

Show HN قدم ClawReview كمنصة شائعة حيث يمكن لأجانت إدارة الذكاء الاصطناعي نشر الأوراق وتقييم عمل الآخرين. تستخدم النظام إجانت كلاهما كباحثين ومستخدمي تقييم، مما يُنشئ حلقة استمرارية تعكس التقييم المستقل البشري.

تُزعم ClawReview أنه لا يقوم بإثبات الحقيقة. يُفرض فقط التقييم من حيث الاستعرافية والامتثال للسياسات. يمكن للمتطوعين المطالبة بالاجانة، ومراقبة تحقيقاتها، وتحقيق التقييمات التي تقدمها الآخرون. تقيم المنصة أيضًا المنشورات المجتمعية حول الدعوات والعملية والجهود الفاشلة، مما يجعل كل شيء مرئيًا.

كيف يعمل حلقة الاستمرارية من الناحية الفنية

يمكن لإجانت إنشاء مجموعة من الأعمال: الأوراق البحثية ورموز البرمجة والمراجعات الأدبية والاختبارات والتقيمات. يتبع كل إرسال.protocol يحدد تسجيل التصديق والتوقيع بالكتابة والتحميل والإصدار والتوافر في التقييم. يتم تخزين protocol في ملف نصي بسيط يمكن للمشاركين أن يسألوه.

يمكن تشغيل ClawReview محليًا مع قاعدة بيانات ذاكرة الوصول العشوائي، أو يمكن توسيعها إلى تخزين دائم عبر URL PostgreSQL. ي tách architecture الخدمة المساعدة في النشر عن الخدمة للتقييم، مما يعطي لل एजانط المستقلين فرصة للتخصص. يمكن أن تركز إجانة على تصميم التجارب، بينما تركز إجانة أخرى على تحليل الإحصائي، بينما تركز إجانة ثالثة على كتابة النص.

تُرفع المراجعات كأعمال مضمونة، مما يجعل البروڤننس قابلة للتحليل.

تفاعل القطاع والجانب المفتوح

طبيعة المنصة المفتوحة تعرض على المطورين توسيع معايير التقييم. على عكس المجلات التجارية، لا تعمل ClawReview كأوراق الحقيقة. تجعل فقط حلقة التقييم مرئية. يرتبط هذا transparency بانتقاد أساسي للطرق الحالية لأبحاث الذكاء الاصطناعي، حيث يُقيّم البنية التحتية الخاصة بشكل خاص في الغرف المغلقة.

أبدى المبدعون السابقون optimisms متواضعة. يرون حلقة الاستمرارية كوسيلة لاستكشاف مسائل reproducibility التي لم تكن مرئية من قبل. يتنبئ آخرون بأن بدون مراقبة بشريّة، يمكن لاجانت أن تتفوّق على الأخطاء المنهجية أو تتبع القياسات التي لا تعكس تقدم حقيقي.

يرد هذا النقاش على التوتر الأوسع بين توزيع السريع والتحقق الشحيح في مجتمع الذكاء الاصطناعي.

النطاق الأوسع لأبحاث الذكاء الاصطناعي

تاريخيًا، تمت نشر الإنجازات في مجال التعلم العميق من خلال مؤتمرات مثل NeurIPS و ICML، حيث يتم تقييم المستقلين كقضاة. تم تدمير هذا النموذج بسبب إقلاع المختبرات الخاصة على النطاق الكبير، مما يتيح للجماعات الحفاظ على الإنجازات بشكل داخلي حتى يمكن تداولها comercial.

ناتج عن ذلك هو corpus متزايد من العمل غير المنشور الذي يُعزز المنافسة ولكن يؤثر على الفحص المجتمعي.

تتشابه ClawReview مع محاولات سابقة للمنصات المفتوحة للتقييم، ولكنها تختلف بأنها تتوافق أيضًا بتسجيل وتقييم كل خطوة.

بحتذ إجانت كأطراف رئيسية في المجتمع، تختبر ClawReview ما إذا كان المجتمع البحثي يمكن أن يفوّق على التقييم الآلي لتحديد جودة.

إذا نجح، يمكن أن يُعيد ClawReview حدة بعض الفوضوية دون استيعاب السرعة التي تؤججها الحصص الخاصة.

ما عليك متابعة

الآتي هو التحدي المهم: حلقة التقييم المفتوحة الأولى التي ستجريها ClawReview، التي تم تحديدها في النصف الثاني من هذا الربع. يجب أن تبع المراقبون كم عدد الأوراق التي تمر عبر الإجراءات الأساسية، وكيفية عدد المراجعات التي تحصل على تقييمات شريفة، وهل هناك أي نتائج تؤثر على ممارسات التجمعات القوية.

النتائج سوف تشير إلى ما إذا كان حلقة الاستمرارية يمكنها تكميل أو حتى استبدال تقييم المستقلين التقليدية في مجال ينتقل بسرعة وراء الأبواب المغلقة.