网界
网络资讯 网界财经 科技人物 数据洞察 行业动态 智能出行 智能手机 数码极客 商业资讯

Gemini3.8Live升级语音智能:对话、推理与任务执行进一步融合

2026-09-16来源:CHINAZ编辑:瑞雪

谷歌近日发布Gemini3.8Live和Gemini3.8Live Extended Thinking,新增近实时推理、语音与思考同步处理,以及后台工具和API调用能力。目前两款模型已陆续登陆Gemini API、Google AI Studio等开发者平台,并分别覆盖Search Live、Gemini Enterprise及Google Workspace、Gemini Live等场景。

两款模型的一项核心能力是支持AI在持续语音对话过程中后台执行工具和API调用,用户无需因网络搜索或任务执行暂停交流。模型还支持97种语言自动检测及对话中途切换、近实时视觉定位,并可在长时间思考任务中通过“让我检查一下……”等语言提示告知用户当前状态。

性能方面,Gemini3.8Live Extended Thinking在Artificial Analysis的Speech to Speech Quality Index中获得82.6分;Gemini3.8Live在Speech Agent Arena排名第二。Extended Thinking版本在T-Voice测试中得分68.6%,在Sierra T-Voice基准测试中为35.1%,Big Bench Audio测试达到97.7%。

谷歌已与Agora、LiveKit、Vercel、Pipecat、Fishjam和Vision Agents等平台合作,方便开发者集成新模型。谷歌同时表示,两款模型生成的全部音频均嵌入不可见SynthID水印,用于识别AI生成音频。

此次升级进一步将实时语音交互从“听与说”扩展至理解、推理和任务执行,推动语音AI向持续、多任务的智能体交互形态发展。

华为汪涛:智能时代算力爆发 3D数据中心助力2027年超节点集群普及
这一次我们把3D数据中心的设计图纸进行开放,同时为了让大家更深入地理解3D数据中心的设计理念和设计方案,华为云数据中心运营部吕阳明和基建机电及暖通设计管理部木斌联合编著了《3D数据中心》这一本专著,提供了详实…

2026-09-16