← 返回新闻列表
InfoQ AI 🗓️ 2026-09-17

最新动态:边说话边推理、边聊天边调用工具,谷歌 Gemini 3.8 Live 要攻克语音 Agent 的沉默时刻

⚡ 一句话看懂:最新动态:边说话边推理、边聊天边调用工具,谷歌 Gemini 3.8 Live 要攻克语音 Agent 的沉默时刻。来源:InfoQ AI。

谷歌发布两款实时对话模型 昨晚,谷歌发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,并表示这是其迄今为止最先进的实时对话模型。

两款模型在智能和并行推理方面进行了重大升级,让用户能够更直观地使用语音进行协作并执行复杂任务。

两款模型虽然都面向语音 Agent,但分工不同:Gemini 3.8 Live 侧重低延迟和规模化部署,Extended Thinking 则为需要多步骤推理、调用多个工具的复杂任务增加了后台思考能力。

据介绍,这两款模型已通过 Gemini API 和 Google AI Studio 向开发者开放。

那么,谷歌新发的这两款语音模型,要解决什么问题?

据谷歌方面称,此次更新要解决一个语音 Agent 常见的问题:用户要求助手查数据、调用系统或完成预约时,对话往往会停下来,等待工具返回结果。

文字界面可以显示“正在处理”,但语音通话中的几秒沉默会让人难以判断它究竟在思考、执行任务,还是已经失去响应。

谷歌在 Live API 技术文档中解释,Gemini 3.8 Live Extended Thinking 可以在后台规划任务并异步调用工具,同时先给出“我来查一下”之类的语音回应。

任务继续执行时,模型还能口头报告进度,最后再说出结果。

例如,用户要求比较航班与酒店,Agent 可以分别查询相关服务,查询过程中维持对话,而不是等所有接口返回后才第一次开口。

这也改变了开发者判断“一轮对话结束”的方式。

普通实时语音模型说完一段话,通常就意味着该轮响应结束;Extended Thinking 可能已经说完一句进度提示,却仍在后台推理或等待工具结果。

因此,开发者需要根据 Live API 返回的 IN_PROGRESS

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接