Alibaba veröffentlicht Qwen3.8-Max mit 2,4 Billionen Parametern
Kurzfassung
Alibaba veröffentlicht Qwen3.8-Max mit 2,4 Billionen Gesamtparametern und 95 Milliarden aktiven Parametern; die offenen Gewichte sollen nächste Woche folgen.
Der überprüfbare Teil von Qwen3.8-Max beginnt erst, wenn sich die Gewichte tatsächlich herunterladen lassen. Falls unabhängige Teams die gemeldeten Coding- und Langzeitresultate in den kommenden drei bis sechs Monaten mit veröffentlichten Einstellungen nicht reproduzieren können oder die Betriebskosten das Modell auf wenige Cloudanbieter beschränken, belegt die Veröffentlichung zwar Alibabas Fähigkeit zur Skalierung, aber nicht die Eignung für eine vom Unternehmen selbst kontrollierte Infrastruktur.
Das Qwen-Team veröffentlichte Qwen3.8-Max am August 3, 2026. Alibaba beschreibt es als Mixture-of-Experts-Modell mit insgesamt 2.4 trillion parameters und 95 Milliarden aktiven Parametern pro Inferenzdurchlauf. Das Modell ist bereits über die QwenCloud-API verfügbar; die Gewichte sollen in der folgenden Woche erscheinen. Damit würde Qwen erstmals ein Modell der Max-Klasse mit offenen Gewichten anbieten. Externe Entwickler könnten das Modell dann selbst untersuchen und betreiben, statt ausschließlich einen gehosteten Endpunkt zu testen.
Was 2,4 Billionen Parameter bei der Inferenz bedeuten
Die Gesamtzahl beschreibt die vollständige Kapazität des Modells. Die 95 Milliarden aktiven Parameter entsprechen eher dem Anteil, der für jedes Token eingesetzt wird. Eine Mixture-of-Experts-Architektur kann so ihre Kapazität erhöhen, ohne bei jeder Anfrage sämtliche Parameter auszuwerten. Die veröffentlichte Konfiguration nennt außerdem ein Kontextfenster von einer Million Token sowie die Reasoning-Stufen low, medium und xhigh. Diese Einstellungen beeinflussen Speicherbedarf, Latenz und Kosten. Die Ankündigung nennt jedoch weder die benötigte Hardware noch den Durchsatz im Eigenbetrieb, die Trainingskosten oder einen vollständigen Preisvergleich pro Token.
Alibaba positioniert Qwen3.8-Max für Coding, Cowork, Forschung und lang laufende Agentenaufgaben. Die Tabelle weist 86,6 Punkte in Terminal Bench 2.1 aus, weniger als 88,8 für GPT-5.6 Sol und mehr als 84,6 für Claude Opus 4.8. In PaperBench meldet Qwen 93,0 Punkte. Die Bedingungen sind nicht einheitlich: Das Qwen-Ergebnis verwendet Claude Code, den Mittelwert aus zehn Läufen, ein Zeitlimit von fünf Stunden und höchstens 131.072 Token. Bei den anderen Modellen übernimmt die Tabelle die jeweils besten veröffentlichten Werte aus unterschiedlichen Harnesses. Die Zahlen dokumentieren benannte Abläufe, aber keinen Blindtest mit identischem Rechenbudget.
Offene Gewichte machen die Betriebskosten messbar
Die Beispiele der Veröffentlichung setzen auf Rückkopplungsschleifen. Das Modell formuliert eine Methode, schreibt Code, führt ein Experiment aus und verändert danach den nächsten Versuch. In einem Forschungsfall lief dieser Prozess ungefähr 88 Stunden und entwickelte eine Methode, die auf AIME24 um 2,7 Prozentpunkte besser abschnitt als die reproduzierte Methode der zugrunde liegenden Arbeit. Ein solcher Agent hängt nicht allein von Modellgenauigkeit ab. Werkzeugrechte, aufeinander aufbauende Fehler, GPU-Stunden und mögliche menschliche Eingriffe verändern Kosten und Ergebnis. Alibaba veröffentlicht weder alle gescheiterten Aufgaben noch eine vollständige Inferenzrechnung für die Demonstrationen.
Reuters berichtete unabhängig über die Veröffentlichung von Alibabas bislang leistungsfähigstem Modell und ordnete sie in den Wettbewerb chinesischer Anbieter um Leistung und Preise ein. Damit ist das Ereignis bestätigt; die detaillierten Leistungsangaben stammen weiterhin überwiegend aus Qwens eigenen Tests. Zuerst lässt sich prüfen, ob die Gewichte termingerecht erscheinen, welche kommerziellen Rechte die Lizenz einräumt und wie viel GPU-Speicher der Betrieb von 2.4 trillion parameters benötigt. Anschließend können Dritte Terminal Bench 2.1 mit demselben Harness, Tokenlimit und Zeitfenster wiederholen und feststellen, ob der Wert 86,6 außerhalb von Alibabas Umgebung Bestand hat.
Quellen:
Verwandte Artikel
Alibaba verbietet Claude Code: Anthropics verstecktes China-Erkennungscode nach 90 Tagen aufgedeckt
Alibaba verbietet ab dem 10. Juli konzernweit Claude Sonnet, Opus, Fable und Claude Code, nachdem ein Reddit-Nutzer versteckten China-Erkennungscode fand, der drei Monate unangekündigt lief. Das ist Alibabas Gegenschlag im Destillationsstreit mit Anthropic und zugleich eine eigene Vertrauenskrise.
Doubao und Qwen schalten ihre KI-Begleiter-Agenten gemeinsam ab, und China meint es ernst
ByteDance und Alibaba haben diese Woche angekündigt, dass Doubao und Qwen ihre menschenähnlichen Begleiter-Agenten zwischen dem 10. und 15. Juli komplett abschalten, betroffen sind Plattformen mit zusammen hunderten Millionen monatlichen Nutzern. Das ist keine einzelne Produktabschaltung, sondern Chinas erstes landesweites Verbot für emotional bindende KI, während US-Bundesstaaten noch einzeln Gesetze verabschieden.