KI-Benchmark: GPT-6 Astra bleibt trotz Korrektur Zweiter hinter Fable 5.1
Nach Kritik an der Bewertung von GPT-6 Astra überarbeitet Artificial Analysis seinen Intelligence Index, doch an der Spitze ändert sich nichts: Claude Fable 5.1 bleibt vorn.
Ein Ranking, das Investoren, Labs und Entwicklerteams als Kompass nutzen, gerät ins Wanken, sobald der eigene Favorit schlecht abschneidet. Genau das ist Artificial Analysis passiert: Nach öffentlicher Kritik an der Einordnung von OpenAIs GPT-6 Astra hat das Analysehaus seinen viel beachteten Intelligence Index in Version 4.2 überarbeitet.
Das Ergebnis ist ein Lehrstück darüber, wie fragil Kompositmetriken sind, sobald ein einzelnes Modell die Erwartungen der eigenen Hersteller nicht erfüllt. Trotz methodischer Nachbesserung bleibt die Rangfolge an der Spitze überraschend stabil, was die eigentliche Geschichte hinter der Geschichte ist.
Der Streit begann mit Platz fünf statt Spitzenplatz
Als OpenAI GPT-6 Astra als Schritt in Richtung AGI positionierte, landete das Modell bei Artificial Analysis in der alten Version 4.1 nur auf Rang fünf, wie Trending Topics berichtet. Unabhängige Bewertungen zeichneten ein anderes Bild: Epoch AI sah Astra über 50 Benchmarks hinweg mit 169 Punkten auf Platz eins von 267 Modellen, bei ARC-AGI-3 zeigte sich laut The Decoder ein deutlicher Sprung.
Diese Diskrepanz nährte den Verdacht, der Intelligence Index bilde aktuelle Modellfortschritte nicht sauber ab. Artificial Analysis selbst erklärt, man habe Updates während großer Modell-Launches bewusst zurückgehalten, um Vergleichbarkeit zu sichern, dann aber wegen des schnellen Tempos an der Frontier vorzeitig nachgesteuert.
Vierzig Prozent geheime Testdaten sollen Gaming erschweren
Die zentrale strukturelle Änderung in Version 4.2 betrifft den Anteil nicht-öffentlicher Testdaten, der laut The Decoder von zuvor rund zwanzig auf 40 Prozent der Gewichtung steigt. Neu hinzugekommen sind AA-Briefcase für praxisnahe Wissensarbeit und GDP.pdf von Surge AI für Dokumentenanalyse, während der als gesättigt geltende Test GPQA-Diamond entfällt, weil ihn Spitzenmodelle bereits gelöst haben.