谷歌发布 Gemini 3.8 Live:语音模型能一边推理一边说话

来源:互联网 时间:2026-09-16

A5站长网9月16日消息,谷歌在今日发布两款实时语音模型,Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking。前者面向规模化与成本效率,把对话能力和流畅语音、视觉理解放在一起;后者面向高复杂度任务,把多步推理单独拆了出来。开发者现在可以在 Gemini API 与 Google AI Studio 里调用,企业侧进入 Gemini Enterprise 私测,普通用户则先在 Search Live 用上标准版。

真正值得看的是它在对话过程中怎么处理等待。文字场景里工具调用跑四秒,界面上转个圈就过去了;语音里沉默四秒,对面的人会以为掉线。Extended Thinking 的做法是把工具调用放到后台,边跑边用口语把空档填上,先用一句 Let me check that 接住提问,再用进度播报交代多步任务走到哪儿了。谷歌在官方演示里给了三个场景:实时指导下棋、把白板草图连同语音反馈转成可用的 React 组件、协调多步预订并异步调用函数。

官方公布的成绩集中在两处。Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的 Speech to Speech Quality Index 上拿到 82.6 分,位列总榜首位;Big Bench Audio 得分 97.7%。在 τ-Voice 上的任务完成率是 68.6%,Sierra 的 τ-Voice-banking 跑出 35.1%;Gemini 3.8 Live 在 Speech Agent Arena 排名第二。

谷歌同时提到,在 ServiceNow 的 EVA-Bench 上,两款模型把准确率和对话质量之间的帕累托前沿往前推了一段。这个基准在 Gemini Enterprise Agent Platform 的 Live API 上运行,考察的是语音智能体处理复杂流程时的表现。

交互细节上,3.8 Live 能近实时处理视觉输入,支持在对话中自动识别并切换 97 种语言。工具调用和 API 请求被放到后台执行,模型先确认请求,任务在后台跑的时候对话不中断。谷歌列出的语音开发生态合作方包括 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents,这些平台负责实时媒体流基础设施,开发者不必自己搭底层;Salesforce、Genspark、Lumeris 则作为应用侧伙伴出现在公告里。

音频溯源也做了处理。谷歌称自家 AI 产品生成的音频都会嵌入 SynthID 水印,这种水印听不出来,但能被检测工具识别,目的是让 AI 生成内容可被追溯。相关的安全与责任说明写在该模型的 model card 里,音频输入与输出按分钟计费,官方给出的口径是与同类前沿模型相比价格有竞争力。

把这次发布放进最近的节奏里看会更清楚:这是 3.x 系列在约七周内的第四次更新,此前月初刚有 3.8 Flash 和 Flash Cyber。版本越切越细、越贴近具体任务,选型也就从默认选项变成一件要权衡的工程决策。同一周,苹果还在为 Siri 搭建可以接入外部模型的通道,语音交互正从附属功能变成一个独立赛道。

相关文章

标签:

A5创业网 版权所有