Google 推出 Gemini 3.8 Live:語音助理邊想邊說,進度播報也要有用途
重點摘要
Gemini 3.8 Live 與延伸思考版正式開放 API,支援 97 種語言。背景推理能減少對話沉默,但播報內容、任務狀態與語音成本仍決定產品價值。
Google 在 2026-09-15 發表 Gemini 3.8 Live 與延伸思考版,讓語音模型在背景推理時繼續回話。公開資料尚未交代,等待期間的播報是否降低使用者重複下指令的比例。這個缺口影響產品選擇:助理可以少一點沉默,但使用者仍需要知道原本的請求有沒有在處理。
官方公告與 API 更新紀錄標示 9 月 15 日,未提供精確啟用時刻。SiliconANGLE 報導的更新時間為當天 19:41 EDT,即台北 9 月 16 日 07:41。本篇採台北 9 月 16 日出刊,依前一日公告日期報導新近開放的功能,沒有把新聞更新時間當成模型的啟用時刻。
Google 已將兩個模型列為 Gemini API 正式可用版本,並提供 AI Studio。Live API 介面文件仍標示 Preview,須與模型的正式可用狀態分開看;Gemini Enterprise 仍屬私人預覽,企業客服產品則預告稍後推出。一般使用者可透過 Search Live 取得標準版,延伸思考版則開始進入 Gemini Live 與依訂閱資格開放的 Workspace 功能。模型支援 97 種語言與對話中切換語言,來源卻沒有台灣口音或繁體中文客服的獨立成效資料。
延伸思考版可在語音回應後繼續推理,完成時再回報結果。API 文件提醒,收到 turnComplete 仍須繼續接收後續訊息;interaction_status 才用來區分仍在處理與閒置狀態。開發者若沿用「說完就結束」的流程,可能在模型還查資料時提早關閉互動。
Google 展示多步驟訂位,以及依草圖與語音修改 React 元件,未提供正式客戶的使用規模。公告彙整的 τ-Voice 成績為 68.6%,Sierra 銀行任務為 35.1%,都屬延伸思考版。方法文件標明高推理、預設採樣及原則上單次嘗試;Artificial Analysis 的測試由該機構執行。不同題組的數字不能直接互比,也不能讀成真實客戶的成功率。
播報應隨查詢結果改變
假設助理正在比較幾家旅館,先確認已收到日期與預算,能讓使用者知道系統沒有漏聽;找到不符合條件的選項時,簡短說明也有助於使用者及早修改需求。若只是反覆說「正在查詢」,增加的聲音可能打斷使用者,卻沒有提供新的選擇依據。這是從背景推理機制延伸的設計判斷,並非上述展示已測得的結果。
我會讓播報跟著有用的狀態變化出現,並在用戶端保留安靜等待的選項。模型的主動音訊目前不能關閉,控制播放也不能據此假定停止計費。使用者只是想取得答案時,產品不必把每一步內部推理都念出來;需要補充條件或確認操作時,再請對方參與。這樣也能讓產品明確區分「已收到」「仍在查」與「已完成」,避免流暢語氣讓人誤以為交易已經辦妥。
播報長度同時會影響費用。定價頁列出每百萬音訊輸入 Token 為 3 美元,音訊輸出為 12 美元,約合每分鐘輸入 0.005 美元、輸出 0.018 美元。這些是各自的音訊用量價格,不能把一分鐘通話直接當成一分鐘輸出;文字與思考 Token 另有計費,其他系統成本也不在其中。延伸思考版若以更多播報填滿等待,語音支出便可能增加,仍須確認是否減少了重複請求。
對客服產品而言,這次 API 開放提供了調整等待體驗的工具。我傾向把進度說明當成協助使用者繼續同一項工作的功能,保留查詢紀錄與已確認條件,讓中途插話能修正原請求。若插話後系統重新開始查詢,再自然的語音也可能增加工作。比較有無進度播報的同類請求時,應觀察使用者重複下指令、放棄等待的比例,以及每件完成請求的語音費用;這些資料才能說明多說幾句是否有用。
封面沿用本站 Gemini 3.8 Flash/Flash Cyber 發表資料圖,並非本次 Live 模型的產品畫面。
來源: