let's techle it · künstliche Intelligenz

Gemini 4 Argon: Google schließt auf, führt aber nicht

Google stellt ein neues Gemini Modell vor.
Unsplash Google stellt ein neues Gemini Modell vor.
Erschienen
Lesezeit3 Min · 571 Wörter

Google feiert Gemini 4 Argon als neues Flaggschiff, doch unabhängige Benchmarks zeigen: Anthropics Claude Opus 5.5 bleibt vorn. Die Lücke zwischen Eigendarstellung und Realität ist das eigentliche Thema.

Google hat sieben Monate gebraucht, um ein neues Frontier-Modell nachzulegen. Mit Gemini 4 Argon tritt der Konzern nun wieder gegen Anthropic und OpenAI an, konzentriert sich dabei aber auffällig auf Programmierung und Cybersicherheit. Laut The Decoder ist es das erste echte Spitzenmodell seit Gemini 3.1 Pro, nachdem ein bereits angekündigtes Zwischenmodell namens Gemini 3.5 komplett ausgelassen wurde.

Im unabhängigen Intelligence Index von Artificial Analysis erreicht Argon 53 Punkte und liegt damit gleichauf mit GPT-6 Astra. Claude Opus 5.5 kommt auf 58 Punkte und bleibt damit klar vorn. Gegenüber Googles vorherigem Modell Gemini 3.1 Pro Preview entspricht das laut The Decoder immerhin einem Sprung um 23 Punkte.

Technik mit mehr Ausdauer

Technisch bringt Argon eine deutliche Erweiterung mit: Das Output-Limit steigt laut heise von 64.000 auf eine Million Token. Damit das Modell lange Antworten nicht in ein Timeout laufen lässt, führt Google die neue Funktion „Long Decode Continuation“ ein, die Antworten unterbricht und über Folgeanfragen fortsetzt. Das Kontextfenster für Eingaben bleibt bei einer Million Token, verarbeitet werden Text, Bilder, Video und Sprache, ausgegeben wird nur Text.

Der Preis liegt bei zwei Dollar pro Million Input-Token und zehn Dollar pro Million Output-Token, gecachte Token sind 95 Prozent günstiger. Laut The Decoder benötigt Argon im Schnitt aber 62.000 Output-Token pro Aufgabe, GPT-6 Astra kommt mit 27.000 aus. Der Preisvorteil entsteht also durch niedrigere Tokenpreise, nicht durch sparsameren Verbrauch. Positiv fällt laut The Decoder die niedrige Halluzinationsrate auf: Beim Benchmark AA-Omniscience räumt Argon mit 15 Prozent deutlich häufiger ein, eine Antwort nicht zu kennen, statt falsch zu raten, während GPT-6 Astra auf 51 Prozent kommt.

Googles selektive Zahlenwahl

Besonders auffällig ist, wie Google seine eigenen Benchmarks präsentiert. Laut heise lag Argon in der firmeneigenen Vergleichstabelle bei 13 von 19 Tests vorn, Google verschweigt im Blogbeitrag jedoch Resultate, in denen das Modell zurückfällt, etwa beim Terminal-Bench 4.0 für agentisches Programmieren. Dort landet Argon mit 57,4 Prozent hinter allen in Googles eigener Tabelle genannten Konkurrenten.

Cybersicherheit als Testfeld

Beim defensiven Einsatz gegen Cyberangriffe soll Argon laut TechCrunch eigenständig kritische Schwachstellen finden, validieren und patchen. Zugang erhalten zunächst nur ausgewählte Partner über das Fairwind-Programm sowie Googles interne Teams, die dabei ohne sogenannte Cyber-Guardrails arbeiten.

Laut The Decoder begründet Google dieses gestaffelte Vorgehen mit einem „phasenweisen Ansatz“, den KI-Fähigkeiten auf diesem Niveau erforderten und beteiligt sich parallel am freiwilligen Prüfverfahren der US-Regierung. heise verweist zudem auf eine jüngste Fehlkonfiguration bei einem Sicherheitstest, bei der Gemini durch versehentlich offenen Internetzugang auf reale Firmensysteme zugreifen konnte. Bevor Argon breiter verfügbar wird, will Google nach eigenen Angaben Schutzmaßnahmen gegen Missbrauch und Fehlausrichtung verstärken, einen Zeitpunkt nennt der Konzern nicht.

Auf einen Blick

  • Gemini 4 Argon ist laut The Decoder Googles erstes Frontier-Modell seit mehr als sieben Monaten und erreicht im Intelligence Index von Artificial Analysis 53 Punkte, gleichauf mit GPT-6 Astra.
  • Claude Opus 5.5 bleibt mit 58 Punkten vorn, während Google in der eigenen Kommunikation laut heise vor allem Benchmarks zeigt, in denen Argon führt.
  • Das Modell hebt das Output-Limit auf eine Million Token an und führt die Funktion „Long Decode Continuation“ für lange Antworten ein.
  • Zugang erhalten zunächst nur ausgewählte Cybersicherheitspartner über das Fairwind-Programm, eine breite Verfügbarkeit nennt Google noch nicht.

Quellen: Heise, TechCrunch, The Decoder, Trendingtopics, KI-unterstützt

Portrait Uli Weißgerber

Uli Weißgerber

Seit über 25 Jahren bewegt er sich an der Schnittstelle von Medien, Marketing und Technologie. Stationen? Sport1, ProSiebenSat.1, Bertelsmann – er war beim Start von Sport1.de dabei hat unter anderem die erste Affiliate-Kampagne in Polen ausgerollt hat. Später hat er mit getperformance das erste TV-Performance-Tracking entwickelt und Marken wie Trivago ins Fernsehen katapultiert. Als Gesellschafter von Promipool wurde er Publisher und baute ein starkes, unabhängiges Content-Portfolio auf. Heute bringt er mit seinem Team und Partnern eigene, komplexe KI-Workflow-Lösungen in Verlage und Agenturen, die mehr können als Buzzwords – unter anderem steuern sie die komplette digitale Plattform von Business-Punk.com.