Zum Inhalt
← Zurück zu Einblicke

Google startet Gemini 3.8 Live: Gesprochene Fortschrittsmeldungen müssen helfen

AI Google Gemini Voice AI AI Agents Nachrichten

Kurzfassung

Gemini 3.8 Live und die Variante mit erweitertem Denken sind über die API allgemein verfügbar und unterstützen 97 Sprachen. Hintergrunddenken kann Stille verkürzen; hilfreiche Meldungen, Aufgabenstatus und Audiokosten bestimmen den Nutzen.

Google startet Gemini 3.8 Live: Gesprochene Fortschrittsmeldungen müssen helfen

Google stellte am 2026-09-15 Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking vor. Damit kann ein Sprachmodell weiter antworten, während es im Hintergrund nachdenkt. Öffentliche Daten belegen bislang nicht, ob Meldungen während der Wartezeit wiederholte Nutzeranweisungen verringern. Diese Lücke betrifft eine Produktentscheidung: Ein Assistent kann weniger schweigen, doch die Nutzer müssen weiterhin erkennen können, ob ihre ursprüngliche Anfrage bearbeitet wird.

Die Ankündigung und die API-Versionshinweise tragen das Datum 15. September, nennen aber keinen genauen Aktivierungszeitpunkt. SiliconANGLE weist eine Aktualisierung um 19:41 EDT an diesem Tag aus; in Taipeh entspricht das dem 16. September um 07:41. Dieser Artikel erscheint mit dem Taipeher Datum 16. September und behandelt neu verfügbare Funktionen, deren Ankündigung vom Vortag datiert. Die Nachrichtenaktualisierung wird nicht als Aktivierungszeitpunkt des Modells ausgegeben.

Google führt beide Modelle als allgemein verfügbar in der Gemini API und bietet Zugang über AI Studio. Die Dokumentation der Live-API-Schnittstelle kennzeichnet den Dienst weiterhin als Preview; das ist von der Modellverfügbarkeit zu unterscheiden. Gemini Enterprise bleibt eine private Vorschau; das Angebot für Kundenservice soll später folgen. Verbraucher erhalten die Standardvariante über Search Live. Extended Thinking wird in Gemini Live und je nach Abonnement in Workspace-Funktionen eingeführt. Die Modelle unterstützen 97 Sprachen und Sprachwechsel im laufenden Gespräch. Unabhängige Ergebnisse für taiwanische Akzente oder Kundenservice in traditionellem Chinesisch fehlen in den Quellen.

Extended Thinking kann nach einer gesprochenen Antwort weiter nachdenken und das Ergebnis später mitteilen. Laut API-Dokumentation muss die Anwendung auch nach Empfang von turnComplete weitere Nachrichten entgegennehmen. Erst interaction_status unterscheidet laufende Verarbeitung von einem inaktiven Zustand. Wer einen Ablauf beibehält, der mit dem Ende einer Äußerung schließt, könnte die Interaktion beenden, während das Modell noch Informationen abruft.

Google demonstriert mehrstufige Buchungen und die Umsetzung von Skizzen samt gesprochenem Feedback in React-Komponenten, nennt aber keinen Umfang des produktiven Kundeneinsatzes. Die Ankündigung fasst für Extended Thinking 68,6 Prozent bei τ-Voice und 35.1% bei Sierras Bankaufgaben zusammen. Die Methodik nennt hohes Reasoning, voreingestelltes Sampling und grundsätzlich einen einzelnen Versuch, sofern nicht anders angegeben. Artificial Analysis führte seine Tests selbst durch. Ergebnisse verschiedener Aufgabensätze sind nicht unmittelbar vergleichbar und entsprechen keinen Erfolgsquoten realer Kunden.

Meldungen an veränderten Suchergebnissen ausrichten

Angenommen, ein Assistent vergleicht mehrere Hotels. Eine Bestätigung von Reisedaten und Budget kann zeigen, dass er richtig zugehört hat. Ein kurzer Hinweis, dass verfügbare Angebote eine Bedingung nicht erfüllen, könnte helfen, die Anfrage frühzeitig anzupassen. Wiederholt er hingegen nur, dass er noch sucht, unterbricht er möglicherweise den Nutzer, ohne neue Entscheidungsinformationen zu liefern. Das ist eine aus dem Hintergrunddenken abgeleitete Designüberlegung und kein gemessenes Ergebnis der Demonstrationen.

Ich würde gesprochene Meldungen an hilfreiche Statusänderungen knüpfen und in der Anwendung eine Möglichkeit zum stillen Warten vorsehen. Die proaktive Audioausgabe des Modells lässt sich derzeit nicht deaktivieren; eine gesteuerte Wiedergabe bedeutet nicht automatisch, dass keine Generierungsgebühren mehr anfallen. Wer lediglich eine Antwort möchte, muss nicht jeden internen Denkschritt hören. Zusätzliche Angaben oder Bestätigungen kann das Produkt dann erfragen, wenn sie gebraucht werden. Die klare Unterscheidung zwischen Empfang, laufender Suche und Abschluss verhindert zudem eher, dass flüssige Sprache eine bereits erledigte Transaktion suggeriert.

Die Länge der Meldungen beeinflusst auch die Gebühren. Die Preisliste nennt 3 US-Dollar je Million Audio-Eingabetokens und 12 US-Dollar für die Ausgabe, entsprechend ungefähr 0,005 US-Dollar je Eingabeminute und 0,018 US-Dollar je Ausgabeminute. Das sind getrennte Audiotarife: Eine Gesprächsminute entspricht nicht automatisch einer Minute erzeugter Sprache. Text- und Denktokens werden gesondert bepreist; weitere Systemkosten sind darin nicht enthalten. Mehr Meldungen während der Wartezeit können somit die Audioausgaben erhöhen. Ob sie wiederholte Anfragen reduzieren, muss sich noch zeigen.

Für Kundenserviceprodukte schafft die API-Freigabe ein Werkzeug, um das Warten anders zu gestalten. Ich würde Fortschrittsmeldungen dazu nutzen, dieselbe Aufgabe fortzusetzen, und Suchverlauf sowie bestätigte Bedingungen erhalten. Eine Zwischenfrage könnte dann die ursprüngliche Anfrage korrigieren. Beginnt die Suche nach jeder Unterbrechung von vorn, kann selbst ein natürliches Gespräch zusätzliche Arbeit verursachen. Bei vergleichbaren Anfragen mit und ohne Meldungen sollten wiederholte Anweisungen, Abbrüche während des Wartens und Audiokosten je abgeschlossener Anfrage betrachtet werden. Diese Daten können zeigen, ob mehr gesprochene Worte tatsächlich helfen.

Das Titelbild verwendet die vorhandene Grafik zur Einführung von Gemini 3.8 Flash / Flash Cyber. Es zeigt nicht die neuen Live-Modelle.

Quellen:

Abonnieren Sie die neuesten Erkenntnisse

Abonnieren Sie den Newsletter, um meine neuesten Artikel über AI Agents in Finanzinstituten, GenAI und Architektur zu erhalten.

Kein Spam. Jederzeit kündbar.