let's techle it · künstliche Intelligenz

GPT-6 gegen Claude Opus 5.5: Wer liefert mehr KI fürs Geld?

GPT-6 Sol und Luna vs. Claude Opus 5.5 bitte mit beiden Logos der ANbiter Anthopic Claude Opus 5.5 und Open AIs Chat GPT
BP | KI-generiert mit ChatGPT GPT-6 Sol und Luna vs. Claude Opus 5.5: Preise fallen, Benchmarks widersprechen sich. Der schonungslose Vergleich für Entscheider.
Erschienen
Lesezeit3 Min · 669 Wörter
Seite2 / 2

Benchmarks zeigen ein gespaltenes Bild

Auf dem AutomationBench übertrifft GPT-6 Sol bei höchster Leistungsstufe laut OpenAI Claude Opus 5 bei nur 9 Prozent der Kosten pro Aufgabe. Auf dem anspruchsvolleren DeepSWE-Benchmark fällt Sol dagegen mit 68,8 Prozent hinter Claude Opus 5 mit 73,7 Prozent zurück, sogar der eigene Vorgänger GPT-5.6 Sol schnitt mit 72,7 Prozent besser ab.

Die unabhängige Plattform Artificial Analysis bestätigt dieses durchwachsene Bild: Die Intelligenzwerte von Sol und Luna blieben auf dem Niveau von GPT-5.6, mit Fortschritten in einzelnen Tests und Rückschritten bei Wissensarbeits-Benchmarks wie GDPval-AA, wo Sol rund 100 Elo-Punkte verliere. Opus 5.5 punktet hier deutlicher: Laut Artificial Analysis erreicht das Modell mit 58 Punkten den höchsten je gemessenen Wert im Intelligence Index und führt in sechs von zehn Evaluierungen, darunter Humanity’s Last Exam mit 61,4 Prozent. Ein Nachteil bleibt der Token-Verbrauch: Opus 5.5 benötigt rund 119.000 Output-Token pro Aufgabe, deutlich mehr als GPT-6 Astra mit nur 27.000.

Sicherheit als mögliches neues Verkaufsargument

Anthropic stattet Opus 5.5 laut Heise erstmals mit Schutzmaßnahmen aus, die automatisch mit den Fähigkeiten des Modells mitwachsen sollen.

Riskante Anfragen zu Cybersicherheit oder Biologie werden demnach transparent an ältere, schwächere Modelle umgeleitet. Wie zuverlässig diese Filter funktionieren, bleibt offen. Bei Fable 5.1 hätten Nutzer bereits über blockierte, eigentlich harmlose Anfragen geklagt.

Business Punk Check

OpenAI feiert die Halbierung der API-Preise, verschweigt aber ausgerechnet die Benchmarks, auf denen die Konkurrenz stark ist: GDPval und Terminal-Bench 4.0 fehlen komplett in der eigenen Ankündigung. Wer selektiv vergleicht, hat meist etwas zu verbergen. Bei DeepSWE fällt GPT-6 Sol sogar hinter den eigenen Vorgänger zurück, während Anthropic mit Opus 5.5 einen neuen Bestwert im Intelligence Index von Artificial Analysis markiert. Für Marktbeobachter zeigt sich: Wer auf reine Kosten pro Aufgabe schaut, findet bei Luna aktuell die guenstigere Option.

Bei komplexer Wissensarbeit fallen die Rückschritte von Sol und Luna bei GDPval ins Gewicht, während Opus 5.5 trotz höherem Tokenverbrauch als Alternative im Blick bleibt. Vorsichtige Beobachter warten auf unabhängige Praxistests, Early Adopters testen beide Modelle parallel gegen die eigene Aufgabenrealität, bevor sie sich festlegen.

Auf einen Blick

  • OpenAI senkt die API-Preise für GPT-6 Sol und Luna um 50 Prozent gegenüber den Vorgängermodellen GPT-5.6 Sol und Luna.
  • Claude Opus 5.5 soll laut Anthropic rund 40 Prozent weniger kosten als der Vorgänger Opus 5 und dabei nahe an Claude Fable 5.1 heranreichen.
  • Auf dem DeepSWE-Benchmark fällt GPT-6 Sol mit 68,8 Prozent hinter Claude Opus 5 und sogar den eigenen Vorgänger GPT-5.6 Sol zurück.
  • Artificial Analysis bescheinigt Opus 5.5 mit 58 Punkten den höchsten je gemessenen Wert im Intelligence Index, während Sol und Luna bei Wissensarbeits-Benchmarks wie GDPval-AA Rückschritte zeigen.

Quellen: The Decoder, Heise, KI-unterstützt

Martin Wald

Tech & Security

Martin Wald analysiert die Schnittstelle zwischen Geld, Macht und Alltag. Seine Themen reichen von Rente, Sozialstaat und Gesundheit bis zu Wirtschaft, Märkten und technologischen Umbrüchen. Er zerlegt politische Entscheidungen, Urteile und Trends auf ihre ökonomischen Folgen und macht sichtbar, wer gewinnt, wer verliert und wo Risiken liegen. Der Blick ist pragmatisch, pointiert und nutzenorientiert. Keine Wohlfühltexte, sondern Einordnung für Menschen, die verstehen wollen, wie Systeme funktionieren und was das für ihre Entscheidungen bedeutet.