← Zurück zu Einblicke

Alibaba veröffentlicht Qwen3.8-Max mit 2,4 Billionen Parametern

Nils Liu
AI Alibaba Qwen Open Weights AI Models Nachrichten

Kurzfassung

Alibaba veröffentlicht Qwen3.8-Max mit 2,4 Billionen Gesamtparametern und 95 Milliarden aktiven Parametern; die offenen Gewichte sollen nächste Woche folgen.

Alibaba veröffentlicht Qwen3.8-Max mit 2,4 Billionen Parametern

Der überprüfbare Teil von Qwen3.8-Max beginnt erst, wenn sich die Gewichte tatsächlich herunterladen lassen. Falls unabhängige Teams die gemeldeten Coding- und Langzeitresultate in den kommenden drei bis sechs Monaten mit veröffentlichten Einstellungen nicht reproduzieren können oder die Betriebskosten das Modell auf wenige Cloudanbieter beschränken, belegt die Veröffentlichung zwar Alibabas Fähigkeit zur Skalierung, aber nicht die Eignung für eine vom Unternehmen selbst kontrollierte Infrastruktur.

Das Qwen-Team veröffentlichte Qwen3.8-Max am August 3, 2026. Alibaba beschreibt es als Mixture-of-Experts-Modell mit insgesamt 2.4 trillion parameters und 95 Milliarden aktiven Parametern pro Inferenzdurchlauf. Das Modell ist bereits über die QwenCloud-API verfügbar; die Gewichte sollen in der folgenden Woche erscheinen. Damit würde Qwen erstmals ein Modell der Max-Klasse mit offenen Gewichten anbieten. Externe Entwickler könnten das Modell dann selbst untersuchen und betreiben, statt ausschließlich einen gehosteten Endpunkt zu testen.

Was 2,4 Billionen Parameter bei der Inferenz bedeuten

Die Gesamtzahl beschreibt die vollständige Kapazität des Modells. Die 95 Milliarden aktiven Parameter entsprechen eher dem Anteil, der für jedes Token eingesetzt wird. Eine Mixture-of-Experts-Architektur kann so ihre Kapazität erhöhen, ohne bei jeder Anfrage sämtliche Parameter auszuwerten. Die veröffentlichte Konfiguration nennt außerdem ein Kontextfenster von einer Million Token sowie die Reasoning-Stufen low, medium und xhigh. Diese Einstellungen beeinflussen Speicherbedarf, Latenz und Kosten. Die Ankündigung nennt jedoch weder die benötigte Hardware noch den Durchsatz im Eigenbetrieb, die Trainingskosten oder einen vollständigen Preisvergleich pro Token.

Alibaba positioniert Qwen3.8-Max für Coding, Cowork, Forschung und lang laufende Agentenaufgaben. Die Tabelle weist 86,6 Punkte in Terminal Bench 2.1 aus, weniger als 88,8 für GPT-5.6 Sol und mehr als 84,6 für Claude Opus 4.8. In PaperBench meldet Qwen 93,0 Punkte. Die Bedingungen sind nicht einheitlich: Das Qwen-Ergebnis verwendet Claude Code, den Mittelwert aus zehn Läufen, ein Zeitlimit von fünf Stunden und höchstens 131.072 Token. Bei den anderen Modellen übernimmt die Tabelle die jeweils besten veröffentlichten Werte aus unterschiedlichen Harnesses. Die Zahlen dokumentieren benannte Abläufe, aber keinen Blindtest mit identischem Rechenbudget.

Offene Gewichte machen die Betriebskosten messbar

Die Beispiele der Veröffentlichung setzen auf Rückkopplungsschleifen. Das Modell formuliert eine Methode, schreibt Code, führt ein Experiment aus und verändert danach den nächsten Versuch. In einem Forschungsfall lief dieser Prozess ungefähr 88 Stunden und entwickelte eine Methode, die auf AIME24 um 2,7 Prozentpunkte besser abschnitt als die reproduzierte Methode der zugrunde liegenden Arbeit. Ein solcher Agent hängt nicht allein von Modellgenauigkeit ab. Werkzeugrechte, aufeinander aufbauende Fehler, GPU-Stunden und mögliche menschliche Eingriffe verändern Kosten und Ergebnis. Alibaba veröffentlicht weder alle gescheiterten Aufgaben noch eine vollständige Inferenzrechnung für die Demonstrationen.

Reuters berichtete unabhängig über die Veröffentlichung von Alibabas bislang leistungsfähigstem Modell und ordnete sie in den Wettbewerb chinesischer Anbieter um Leistung und Preise ein. Damit ist das Ereignis bestätigt; die detaillierten Leistungsangaben stammen weiterhin überwiegend aus Qwens eigenen Tests. Zuerst lässt sich prüfen, ob die Gewichte termingerecht erscheinen, welche kommerziellen Rechte die Lizenz einräumt und wie viel GPU-Speicher der Betrieb von 2.4 trillion parameters benötigt. Anschließend können Dritte Terminal Bench 2.1 mit demselben Harness, Tokenlimit und Zeitfenster wiederholen und feststellen, ob der Wert 86,6 außerhalb von Alibabas Umgebung Bestand hat.

Quellen:

Abonnieren Sie die neuesten Erkenntnisse

Abonnieren Sie den Newsletter, um meine neuesten Artikel über AI Agents in Finanzinstituten, GenAI und Architektur zu erhalten.

Kein Spam. Jederzeit kündbar.