← Zurück zu Einblicke

Google bringt drei Gemini-Flash-Modelle: 17 % weniger Tokens, aber kein 3.5 Pro

Nils Liu
Google Gemini AI Agents Cybersecurity Nachrichten

Kurzfassung

Google veröffentlichte am 21. Juli 2026 Gemini 3.6 Flash, 3.5 Flash-Lite und das eingeschränkt verfügbare 3.5 Flash Cyber. Preise, Tempo und Benchmarks verbessern sich, 3.5 Pro fehlt weiterhin.

Google bringt drei Gemini-Flash-Modelle: 17 % weniger Tokens, aber kein 3.5 Pro

Ob diese Veröffentlichung die realen Kosten von KI-Agenten senkt, entscheidet sich an der Gesamtzahl der Tokens und Werkzeugaufrufe pro erfolgreicher Aufgabe, nicht an der API-Preisliste. Falls Produktionstests in den kommenden drei Monaten keine niedrigeren Kosten pro erledigtem Auftrag zeigen, besteht die Effizienzbehauptung ihren Praxistest nicht. Google lieferte am 2026-07-21 die ersten Zahlen für diesen Vergleich und veröffentlichte Gemini 3.6 Flash, Gemini 3.5 Flash-Lite sowie Gemini 3.5 Flash Cyber.

Gemini 3.6 Flash kostet 1,50 US-Dollar je Million Eingabe-Tokens und 7,50 US-Dollar je Million Ausgabe-Tokens. Unter Berufung auf den Artificial Analysis Index erklärt Google, das Modell verbrauche 17% weniger Ausgabe-Tokens als 3.5 Flash. Unter den abweichenden Testbedingungen des DeepSWE-Benchmarks von DataCurve beobachtete das Unternehmen eine Reduktion um bis zu 65 Prozent. Diese Werte lassen sich nicht automatisch auf jede Arbeitslast übertragen. Unternehmen müssen Wiederholungen, Denkschritte und externe Werkzeugaufrufe einrechnen, um die Kosten einer abgeschlossenen Aufgabe zu bestimmen.

Auch die ausgewählten Qualitätsmessungen fallen höher aus. Google meldet im DeepSWE-Test 49 Prozent gegenüber 37 Prozent für 3.5 Flash, im MLE Bench 63,9 gegenüber 49,7 Prozent und bei OSWorld-Verified 83,0 gegenüber 78,4 Prozent. Die Ergebnisse stützen unter den genannten Bedingungen die Aussagen zu Codeänderungen, Forschung im maschinellen Lernen und Computersteuerung. Es bleiben allerdings vom Anbieter ausgewählte Resultate. TechCrunch bestätigte unabhängig die Produkteinführung und ihre Positionierung, berichtete jedoch nicht über eine separate Wiederholung der Tests.

Flash-Lite gibt hohem Durchsatz einen Preis

Gemini 3.5 Flash-Lite kostet 0,30 US-Dollar je Million Eingabe-Tokens und 2,50 US-Dollar je Million Ausgabe-Tokens. Google nennt unter Berufung auf Artificial Analysis eine Geschwindigkeit von 350 Ausgabe-Tokens pro Sekunde. Im Terminal-Bench 2.1 soll der Wert gegenüber 3.1 Flash-Lite von 31 auf 54 Prozent gestiegen sein. Das Modell zielt auf agentische Suche, Dokumentenverarbeitung und große Mengen kleiner Teilaufgaben. Ein Unternehmen kann risikoarme Schritte an Flash-Lite leiten und ein stärkeres Modell für die Kontrolle einsetzen. Einsparungen entstehen aber nur, wenn Routing und Prüfung keine zusätzlichen Wiederholungen auslösen.

Gemini 3.5 Flash Cyber wird vorsichtiger bereitgestellt. Google kombiniert das spezialisierte Modell mit seinem Sicherheitsagenten CodeMender. Mehrere Agenten suchen, prüfen und beheben Schwachstellen, bevor sie einen gemeinsamen Bericht erstellen. Da sich die Fähigkeit defensiv einsetzen und missbrauchen lässt, soll sie zunächst nur Regierungen und vertrauenswürdigen Partnern in einem begrenzten Pilotprogramm zur Verfügung stehen. Die Ankündigung nennt konkurrenzfähige Spitzenleistung auf CyberGym, veröffentlicht aber kein vollständiges, unabhängig reproduzierbares Ergebnis. Der tatsächliche Nutzen dieser Zugangsbeschränkung bleibt deshalb offen.

Die Lücke bei Pro bleibt bestehen

Gemini 3.5 Pro war nicht Teil der Veröffentlichung. TechCrunch erinnert daran, dass Google im Mai von einer internen Nutzung sprach und eine Einführung im folgenden Monat erwartete. Im Juli erklärte Produktleiter Logan Kilpatrick lediglich, die Tests mit Partnern liefen weiter und das Modell solle bald erscheinen. Flash-Modelle priorisieren Tempo und Kosten, während Pro-Modelle komplexere Denk- und Programmieraufgaben übernehmen. Die drei neuen Modelle schließen diese Lücke daher nicht vollständig.

In den kommenden drei bis sechs Monaten lassen sich zwei Ergebnisse prüfen: ob 3.6 Flash die Kosten je erfolgreicher Aufgabe eines Produktionsagenten um mindestens 17% senkt und ob 3.5 Pro allgemein verfügbar wird. Die erste Kennzahl zeigt, ob Token-Einsparungen Wiederholungen und Werkzeugkosten überstehen. Die zweite zeigt, ob Google den Partnertest seines Spitzenmodells in ein tatsächlich einsetzbares Produkt überführen kann.

Quellen:

Abonnieren Sie die neuesten Erkenntnisse

Abonnieren Sie den Newsletter, um meine neuesten Artikel über AI Agents in Finanzinstituten, GenAI und Architektur zu erhalten.

Kein Spam. Jederzeit kündbar.