AI-Benchmarks erweitern sich von Schach zu echtem Code und Hardware
Real‑SWE veröffentlichte einen Benchmark, der große Sprachmodelle auf private, produktionsreife Codebasen läuft. Der Schritt zwingt Anbieter, zu beweisen, dass ihre Modelle die chaotischen, undokumentierten Skripte, die reale Dienste antreiben, bewältigen können.[^1][^2][^3]