Les benchmarks d'IA s'élargissent au-delà des échecs pour inclure du code réel et du matériel
Real‑SWE a publié un benchmark qui exécute de grands modèles de langage sur des codebases de production privées. Ce mouvement oblige les fournisseurs à prouver que leurs modèles peuvent gérer les scripts mélangés et non documentés qui alimentent les services réels.[^1][^2][^3]