KI-unterstützt, redaktionell geprüft Tech & Trends · künstliche Intelligenz

KI-Benchmark: GPT-6 Astra bleibt trotz Korrektur Zweiter hinter Fable 5.1

Open AI launcht GPT-6 Astra
picture alliance / CFOTO | CFOTO Open AI launcht GPT-6 Astra
Erschienen
Aktualisiert
Lesezeit3 Min · 613 Wörter

Nach Kritik an der Bewertung von GPT-6 Astra überarbeitet Artificial Analysis seinen Intelligence Index, doch an der Spitze ändert sich nichts: Claude Fable 5.1 bleibt vorn.

Ein Ranking, das Investoren, Labs und Entwicklerteams als Kompass nutzen, gerät ins Wanken, sobald der eigene Favorit schlecht abschneidet. Genau das ist Artificial Analysis passiert: Nach öffentlicher Kritik an der Einordnung von OpenAIs GPT-6 Astra hat das Analysehaus seinen viel beachteten Intelligence Index in Version 4.2 überarbeitet.

Das Ergebnis ist ein Lehrstück darüber, wie fragil Kompositmetriken sind, sobald ein einzelnes Modell die Erwartungen der eigenen Hersteller nicht erfüllt. Trotz methodischer Nachbesserung bleibt die Rangfolge an der Spitze überraschend stabil, was die eigentliche Geschichte hinter der Geschichte ist.

Der Streit begann mit Platz fünf statt Spitzenplatz

Als OpenAI GPT-6 Astra als Schritt in Richtung AGI positionierte, landete das Modell bei Artificial Analysis in der alten Version 4.1 nur auf Rang fünf, wie Trending Topics berichtet. Unabhängige Bewertungen zeichneten ein anderes Bild: Epoch AI sah Astra über 50 Benchmarks hinweg mit 169 Punkten auf Platz eins von 267 Modellen, bei ARC-AGI-3 zeigte sich laut The Decoder ein deutlicher Sprung.

Diese Diskrepanz nährte den Verdacht, der Intelligence Index bilde aktuelle Modellfortschritte nicht sauber ab. Artificial Analysis selbst erklärt, man habe Updates während großer Modell-Launches bewusst zurückgehalten, um Vergleichbarkeit zu sichern, dann aber wegen des schnellen Tempos an der Frontier vorzeitig nachgesteuert.

Vierzig Prozent geheime Testdaten sollen Gaming erschweren

Die zentrale strukturelle Änderung in Version 4.2 betrifft den Anteil nicht-öffentlicher Testdaten, der laut The Decoder von zuvor rund zwanzig auf 40 Prozent der Gewichtung steigt. Neu hinzugekommen sind AA-Briefcase für praxisnahe Wissensarbeit und GDP.pdf von Surge AI für Dokumentenanalyse, während der als gesättigt geltende Test GPQA-Diamond entfällt, weil ihn Spitzenmodelle bereits gelöst haben.

Auch die Bewertungsinfrastruktur wurde überarbeitet: AA-LCR läuft jetzt in Version 1.1 mit korrigierten Antwortschlüsseln, GDPval-AA und AA-Briefcase erhielten eine neu verankerte Elo-Skala. Der erklärte Zweck der Maßnahmen: Labs sollen es schwerer haben, gezielt auf einzelne Benchmarks hin zu optimieren.

Anthropic führt weiter, Meta bleibt Dritter, OpenAI punktet selektiv

Am oberen Ende der Tabelle bleibt es bei der bekannten Reihenfolge: Claude Fable 5.1 führt mit 57 Punkten vor GPT-6 Astra mit 55 Punkten, ein Zugewinn von vier Punkten gegenüber dem Vorgänger GPT-5.6 Sol. Meta liegt als drittes Lab dahinter, gefolgt von SpaceXAI, Moonshot, Z.AI und Google.

Differenzierter wird das Bild bei Teiltests: Bei GDP.pdf liegt Astra mit 33,2 Prozent vor Fable 5.1 mit 26,2 Prozent und beim Tokenverbrauch pro Aufgabe gilt Astra laut The Decoder als effizienter als alle Konkurrenten. Anthropic kann somit auf den Gesamtsieg verweisen, OpenAI auf klare Stärken in Einzeldisziplinen, während Meta selbst zeigt, wie begrenzt aussagekräftig ein einzelner Kompositwert für die reale Modellqualität sein kann.

Business Punk Check

Fakt ist: Der Intelligence Index bleibt trotz Überarbeitung bei Fable 5.1 auf Platz eins, Astra auf Platz zwei.

Interpretation: Die Aufregung um Version 4.1 zeigt, wie stark Benchmark-Ergebnisse die öffentliche Wahrnehmung von KI-Fortschritt prägen, obwohl sie nur einen Ausschnitt messen. Offen bleibt, ob mehr geheime Testdaten tatsächlich weniger Gaming bedeuten oder nur weniger Transparenz für Außenstehende, ein Zielkonflikt, den Artificial Analysis mit Version 5 erst noch lösen muss.

Auf einen Blick

  • Artificial Analysis hat den Intelligence Index nach Kritik an der Bewertung von GPT-6 Astra in Version 4.2 überarbeitet.
  • Claude Fable 5.1 führt mit 57 Punkten weiter vor GPT-6 Astra mit 55 Punkten, Meta bleibt Dritter.
  • Der Anteil nicht-öffentlicher Testdaten stieg auf 40 Prozent, GPQA-Diamond wurde entfernt, AA-Briefcase und GDP.pdf kamen hinzu.
  • Bei der Teilaufgabe GDP.pdf liegt GPT-6 Astra mit 33,2 Prozent vor Claude Fable 5.1 mit 26,2 Prozent.

Quellen: The Decoder, Trending Topics, Trending Topics, Artificialanalysis, Artificialanalysis, Artificialanalysis

Martin Wald

Tech & Security

Martin Wald analysiert die Schnittstelle zwischen Geld, Macht und Alltag. Seine Themen reichen von Rente, Sozialstaat und Gesundheit bis zu Wirtschaft, Märkten und technologischen Umbrüchen. Er zerlegt politische Entscheidungen, Urteile und Trends auf ihre ökonomischen Folgen und macht sichtbar, wer gewinnt, wer verliert und wo Risiken liegen. Der Blick ist pragmatisch, pointiert und nutzenorientiert. Keine Wohlfühltexte, sondern Einordnung für Menschen, die verstehen wollen, wie Systeme funktionieren und was das für ihre Entscheidungen bedeutet.