← 返回文章列表

Google 把 SL2T 放進 Pixel 11:手語輸入開始面對真實場景誤差

Nils Liu
AI Google DeepMind Pixel 11 Accessibility Sign Language 新聞觀察

重點摘要

Google DeepMind 將美國手語轉文字模型 SL2T 導入 Pixel 11 的 Gboard 與 Live Transcribe;模型只把姿態座標送往伺服器,但獨立實機錯誤率仍未公開。

Google 把 SL2T 放進 Pixel 11:手語輸入開始面對真實場景誤差

目前公開資料缺少一項會影響使用判斷的數字:聾人或聽障使用者在室內弱光、戶外逆光與移動中操作 Pixel 11 時,SL2T 的句子錯誤率是多少。Google DeepMind 公布自家基準與失敗案例,尚未提供獨立實機測試;未來三至六個月若能取得不同膚色、服裝對比與手語變體的錯誤率,才足以檢驗這次部署能否從示範跨進日常溝通。

Google DeepMind 在 August 12, 2026 發布手語轉文字模型 SL2T,先支援美國手語轉英文,並放進 Pixel 11 的 Gboard 與 Live Transcribe,使用者不必另外付費。聾人使用者可以對著手機鏡頭打手語,在搜尋、訊息、文件或 Gemini 查詢欄位產生文字;Live Transcribe 則讓使用者在對話時用手語回覆。Google 表示後續會擴至更多裝置與語言,但沒有公布時間表。

影像留在手機,座標送往伺服器

SL2T 的資料流程先由手機上的 MediaPipe Holistic 追蹤臉部、身體與雙手的姿態點,再把幾何座標送到伺服器翻譯,原始影片可立即丟棄。模型直接從連續座標產生英文,不經過傳統手語翻譯常用的 gloss 中介標籤。這項設計減少原始影像外傳,也避免固定標籤漏掉臉部表情、空間位置等語法資訊;它仍然需要伺服器處理座標,不能等同完全離線。

訓練資料超過 100,000 hours,涵蓋 50 多種手語,其中約四分之一是美國手語。Google 在 FLEURS-ASL 的零樣本測試回報 70 BLEURT,並稱成績高於先前公開結果。這些數字由供應商自行公布,測試集也不能覆蓋手機在晃動、遮擋或多人同框時的全部情況,因此文章不能用 70 BLEURT 推導每位使用者都會得到相同準確度。

Pixel 11 把模型限制帶到輸入欄位

Google 公開的例子顯示,SL2T 仍可能把快速手指拼字的「prey」翻成「grey」,也會漏掉被動語態、分類詞描繪或缺少上下文時的時態。團隊還特別處理沒有手語輸入時產生文字的幻覺、左撇子公平性,以及單手持機時的單手手語。這些修正說明研究團隊已辨識實際風險,卻沒有給出各類錯誤的發生率。

獨立科技媒體 SiliconANGLE 核對了 Pixel 11 上線範圍、100,000 hours 訓練規模、座標上傳流程與 70 BLEURT 成績。Google 與 AI Sign Language Advisory Committee 共同發布的影響報告則把 SL2T 1.0 定位為一般溝通的輔助工具,不應取代高風險情境中的合格手語翻譯員。兩個應用都先顯示文字預覽,讓使用者編輯後再送出;這個保護措施也假設使用者能讀懂英文並抓出錯譯。

接下來可量測的結果包括 Pixel 11 使用者修正譯文的比例、非手語畫面誤觸發率,以及更多裝置與手語的推出日期。若 Google 只公布擴大支援範圍,沒有按光線、膚色、手勢速度與語言變體拆分錯誤率,外界仍無法判斷 SL2T 在日常輸入中節省多少時間,或把多少查錯成本轉回使用者。

來源

訂閱最新分享

加入電子報,第一時間獲取關於金融 AI Agent 實戰與架構設計的最新文章。不訂閱你會慢別人一個週期!

絕不發送垃圾信。隨時皆可取消訂閱。