Google startet Gemini 3.8 Live: Gesprochene Fortschrittsmeldungen müssen helfen
Kurzfassung
Gemini 3.8 Live und die Variante mit erweitertem Denken sind über die API allgemein verfügbar und unterstützen 97 Sprachen. Hintergrunddenken kann Stille verkürzen; hilfreiche Meldungen, Aufgabenstatus und Audiokosten bestimmen den Nutzen.
Google stellte am 2026-09-15 Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking vor. Damit kann ein Sprachmodell weiter antworten, während es im Hintergrund nachdenkt. Öffentliche Daten belegen bislang nicht, ob Meldungen während der Wartezeit wiederholte Nutzeranweisungen verringern. Diese Lücke betrifft eine Produktentscheidung: Ein Assistent kann weniger schweigen, doch die Nutzer müssen weiterhin erkennen können, ob ihre ursprüngliche Anfrage bearbeitet wird.
Die Ankündigung und die API-Versionshinweise tragen das Datum 15. September, nennen aber keinen genauen Aktivierungszeitpunkt. SiliconANGLE weist eine Aktualisierung um 19:41 EDT an diesem Tag aus; in Taipeh entspricht das dem 16. September um 07:41. Dieser Artikel erscheint mit dem Taipeher Datum 16. September und behandelt neu verfügbare Funktionen, deren Ankündigung vom Vortag datiert. Die Nachrichtenaktualisierung wird nicht als Aktivierungszeitpunkt des Modells ausgegeben.
Google führt beide Modelle als allgemein verfügbar in der Gemini API und bietet Zugang über AI Studio. Die Dokumentation der Live-API-Schnittstelle kennzeichnet den Dienst weiterhin als Preview; das ist von der Modellverfügbarkeit zu unterscheiden. Gemini Enterprise bleibt eine private Vorschau; das Angebot für Kundenservice soll später folgen. Verbraucher erhalten die Standardvariante über Search Live. Extended Thinking wird in Gemini Live und je nach Abonnement in Workspace-Funktionen eingeführt. Die Modelle unterstützen 97 Sprachen und Sprachwechsel im laufenden Gespräch. Unabhängige Ergebnisse für taiwanische Akzente oder Kundenservice in traditionellem Chinesisch fehlen in den Quellen.
Extended Thinking kann nach einer gesprochenen Antwort weiter nachdenken und das Ergebnis später mitteilen. Laut API-Dokumentation muss die Anwendung auch nach Empfang von turnComplete weitere Nachrichten entgegennehmen. Erst interaction_status unterscheidet laufende Verarbeitung von einem inaktiven Zustand. Wer einen Ablauf beibehält, der mit dem Ende einer Äußerung schließt, könnte die Interaktion beenden, während das Modell noch Informationen abruft.
Google demonstriert mehrstufige Buchungen und die Umsetzung von Skizzen samt gesprochenem Feedback in React-Komponenten, nennt aber keinen Umfang des produktiven Kundeneinsatzes. Die Ankündigung fasst für Extended Thinking 68,6 Prozent bei τ-Voice und 35.1% bei Sierras Bankaufgaben zusammen. Die Methodik nennt hohes Reasoning, voreingestelltes Sampling und grundsätzlich einen einzelnen Versuch, sofern nicht anders angegeben. Artificial Analysis führte seine Tests selbst durch. Ergebnisse verschiedener Aufgabensätze sind nicht unmittelbar vergleichbar und entsprechen keinen Erfolgsquoten realer Kunden.
Meldungen an veränderten Suchergebnissen ausrichten
Angenommen, ein Assistent vergleicht mehrere Hotels. Eine Bestätigung von Reisedaten und Budget kann zeigen, dass er richtig zugehört hat. Ein kurzer Hinweis, dass verfügbare Angebote eine Bedingung nicht erfüllen, könnte helfen, die Anfrage frühzeitig anzupassen. Wiederholt er hingegen nur, dass er noch sucht, unterbricht er möglicherweise den Nutzer, ohne neue Entscheidungsinformationen zu liefern. Das ist eine aus dem Hintergrunddenken abgeleitete Designüberlegung und kein gemessenes Ergebnis der Demonstrationen.
Ich würde gesprochene Meldungen an hilfreiche Statusänderungen knüpfen und in der Anwendung eine Möglichkeit zum stillen Warten vorsehen. Die proaktive Audioausgabe des Modells lässt sich derzeit nicht deaktivieren; eine gesteuerte Wiedergabe bedeutet nicht automatisch, dass keine Generierungsgebühren mehr anfallen. Wer lediglich eine Antwort möchte, muss nicht jeden internen Denkschritt hören. Zusätzliche Angaben oder Bestätigungen kann das Produkt dann erfragen, wenn sie gebraucht werden. Die klare Unterscheidung zwischen Empfang, laufender Suche und Abschluss verhindert zudem eher, dass flüssige Sprache eine bereits erledigte Transaktion suggeriert.
Die Länge der Meldungen beeinflusst auch die Gebühren. Die Preisliste nennt 3 US-Dollar je Million Audio-Eingabetokens und 12 US-Dollar für die Ausgabe, entsprechend ungefähr 0,005 US-Dollar je Eingabeminute und 0,018 US-Dollar je Ausgabeminute. Das sind getrennte Audiotarife: Eine Gesprächsminute entspricht nicht automatisch einer Minute erzeugter Sprache. Text- und Denktokens werden gesondert bepreist; weitere Systemkosten sind darin nicht enthalten. Mehr Meldungen während der Wartezeit können somit die Audioausgaben erhöhen. Ob sie wiederholte Anfragen reduzieren, muss sich noch zeigen.
Für Kundenserviceprodukte schafft die API-Freigabe ein Werkzeug, um das Warten anders zu gestalten. Ich würde Fortschrittsmeldungen dazu nutzen, dieselbe Aufgabe fortzusetzen, und Suchverlauf sowie bestätigte Bedingungen erhalten. Eine Zwischenfrage könnte dann die ursprüngliche Anfrage korrigieren. Beginnt die Suche nach jeder Unterbrechung von vorn, kann selbst ein natürliches Gespräch zusätzliche Arbeit verursachen. Bei vergleichbaren Anfragen mit und ohne Meldungen sollten wiederholte Anweisungen, Abbrüche während des Wartens und Audiokosten je abgeschlossener Anfrage betrachtet werden. Diese Daten können zeigen, ob mehr gesprochene Worte tatsächlich helfen.
Das Titelbild verwendet die vorhandene Grafik zur Einführung von Gemini 3.8 Flash / Flash Cyber. Es zeigt nicht die neuen Live-Modelle.
Quellen:
- Google: Ankündigung von Gemini 3.8 Live und Extended Thinking
- Google: Gemini-API-Versionshinweise und allgemeine Verfügbarkeit
- Google: Hintergrunddenken und Interaktionsstatus in der Live API
- Google: Extended-Thinking-Modell und Anforderungen beim Wechsel
- Google: Live-API-Funktionen und Vorschaustatus
- Google: Preise der Gemini API
- Google DeepMind: Evaluationsmethodik für Gemini 3.8 Live
- SiliconANGLE: Googles neue Sprachmodelle Gemini 3.8 Live
Verwandte Artikel
Google veröffentlicht Gemini 3.7 Flash: Halbpreis bis Jahresende, Agentenkosten hängen weiter von Wiederholungen ab
Google positioniert Gemini 3.7 Flash als Arbeitsmodell für Programmierung und KI-Agenten, mit höheren Anbieter-Benchmarks und vorübergehend halbiertem Preis; Architektur, Training und Wiederholungsraten im Betrieb bleiben offen.
Google stellt Gemini 4 Argon vor: Code-Modernisierung braucht den richtigen Vergleich
Gemini 4 Argon erhöht das Ausgabelimit auf 1M Tokens und startet bei vertrauenswürdigen Cyberverteidigern. Das libgav1-Beispiel zeigt eine schnellere Rust-Portierung; der Faktor 2,7 bezieht sich jedoch nicht auf das optimierte C++-Original.