Aleph Alphas KI-Model Kolibri: trainiert mit viel deutsch und chinesischen Modellen
Aleph Alpha feiert Kolibri als souveräne deutsche KI. Doch während das Start-up Unabhängigkeit verspricht, steht es vor der Fusion mit dem kanadischen Konzern Cohere.
Aleph Alpha nennt sein neues Sprachmodell Kolibri „souverän“. Zeitgleich verhandelt das Heidelberger Start-up seinen Zusammenschluss mit dem kanadischen Anbieter Cohere. Diese Gleichzeitigkeit wirft eine Frage auf, die weit über Technikdetails hinausgeht: Wie viel deutsche Souveränität bleibt übrig, wenn das Unternehmen dahinter bald unter kanadischer Flagge firmiert? Kolibri ist technisch kein Leichtgewicht.
Das Mixture-of-Experts-Modell verfügt laut Heise über insgesamt 78,1 Milliarden Parameter, von denen pro Token rund 3,46 Milliarden aktiv sind. Diese Architektur soll die Leistung größerer Modelle bei geringerem Rechenaufwand erreichen, die Vergleichswerte stammen allerdings von Aleph Alpha selbst. Eine unabhängige Bestätigung steht noch aus.
Deutsch als Kernkompetenz
Rund 23 Prozent der Pretraining-Daten sind deutschsprachig, so Heise. The Decoder beziffert den Anteil auf 21,3 Prozent und ergänzt, Aleph Alpha habe dafür eine eigene Daten-Pipeline für deutsche Texte aufgebaut.
Kolibri soll laut Unternehmensangaben auf der Pareto-Front von Qualität und Betriebskosten liegen: Kein verglichenes, bauähnliches Modell liefere demnach bei gleichen Kosten mehr Qualität. Trainiert wurde auf 768 B200-GPUs in Deutschland und Finnland, Kontexte von bis zu einer Million Tokens sind möglich.
Souveränität mit Importware
Die Pointe liegt im Kleingedruckten. Zur Erzeugung synthetischer Trainingsdaten griff Aleph Alpha auf externe Modelle zurück, im technischen Bericht werden GLM-5.2 und GLM-5.3 von Z.ai sowie Qwen3.8-27B genannt, also chinesische Systeme. Wer „Souveränität“ als Marketingbegriff verkauft, muss sich fragen lassen, ob die Lieferkette der KI-Entwicklung das Versprechen überhaupt einlösen kann.
Die Modellgewichte stehen immerhin offen unter Apache-2.0-Lizenz auf Hugging Face, laut Model Card gilt die Lizenz jedoch nicht für Code, Architektur und Trainingsmethoden. Fürs regulierte Business positioniert Aleph Alpha Kolibri als Werkzeug für Behörden, lange Dokumente und agentische Workflows. Trainingsdaten wurden nach eigenen Angaben mit einer Sperrliste von mehr als 4,5 Millionen URLs abgeglichen, die unter anderem auf der Piracy Watch List der EU-Kommission basiert. Das Unternehmen verweist zudem auf den EU AI Act als Entwicklungsrahmen.
Zusammenschluss mit Cohere in Aussicht
Aleph Alpha wurde 2019 gegründet, beschäftigt nach eigenen Angaben rund 200 Mitarbeitende und sammelte 2023 ein Finanzierungspaket von 470 Mio. Euro ein, an dem sich unter anderem die Schwarz Gruppe und Bosch Ventures beteiligten.
Im September 2026 vereinbarte das Start-up laut Heise einen Zusammenschluss mit Cohere, das gemeinsame Unternehmen soll weltweit unter dem Namen Cohere auftreten. Die Transaktion steht noch unter dem Vorbehalt regulatorischer Genehmigungen. Für den deutschen Mittelstand, der nach DSGVO-konformen KI-Lösungen sucht, ist das ein Signal: Die Marke „Made in Germany“ könnte bald unter einem anderen Namen weitergeführt werden.
Auf einen Blick
- Aleph Alpha hat das Sprachmodell Kolibri mit 78,1 Milliarden Parametern veröffentlicht, aktiv sind pro Token rund 3,46 Milliarden.
- Rund ein Fünftel der Trainingsdaten ist deutschsprachig, die Leistungsvergleiche stammen jedoch von Aleph Alpha selbst und sind unabhängig nicht bestätigt.
- Trotz des Labels „souverän“ nutzte Aleph Alpha für synthetische Trainingsdaten auch chinesische Modelle wie GLM-5.2 und Qwen3.8-27B.
- Aleph Alpha steht vor einem Zusammenschluss mit dem kanadischen Unternehmen Cohere, die Transaktion benötigt noch regulatorische Genehmigungen.
Quellen: Heise, Golem, The Decoder, KI-unterstützt