資料中心的機櫃走道
示意圖。Carl Lender 攝,CC BY 2.0,Wikimedia Commons。
AI 代理人Google

Google Gemini 3.8 Live 加影像分身正式上線:97 種語言對嘴,自訂分身要過白名單

Google Cloud 9 月 25 日在官方部落格宣布,Gemini 3.8 Live with Live Avatar 在 Gemini Enterprise 正式上線,美國與歐盟兩個端點可用。這個功能把原生的語音對語音對話,配上近即時生成、嘴型同步的影像分身,可以放在網頁、手機與互動式資訊亭上;模型能聽懂並說 97 種語言,自動偵測語言切換。

文章由 Gemini Live 產品經理 Fabien Blanc-Paques 署名。技術上它同時吃語音、即時攝影機畫面與螢幕分享,並在對話進行中於背景呼叫工具與 API。正式上線的版本附帶預留吞吐量、企業合規與資料治理;同一家族的 Gemini 3.8 Live Extended Thinking 仍在私人預覽。

分身怎麼來:預建可直接用,自訂要驗證

文章把分身分成兩種來源。客戶可以「從一個經策展的預建分身庫部署」;自訂分身則「受嚴格的企業白名單與驗證流程管制」,只開放白名單使用。 所有生成的音訊與影像串流都帶有 SynthID 浮水印,Google 的說法是確保 AI 生成內容「保持透明且可驗證」。

文中列的客戶案例有四個:Cox Automotive 的 Autotrader 用它做找車與比較車款的購物助理,會在畫面上即時標示;印度的 Equal AI 用它跨九種印度語言做客服,自稱每天處理超過一百萬通即時通話;Salesforce 的 Agentforce 接進去做從首次接觸到結案的客服;Specs 則提到語音活動偵測與延遲的改善。這些數字是各客戶在 Google 文章裡的自述,本站沒有第二個來源。