← 返回新闻列表
InfoQ AI 🗓️ 2026-07-18

深度解读:豆包视频通话背后,火山引擎重构 Agent 时代多模态传输底座

⚡ 一句话看懂:深度解读:豆包视频通话背后,火山引擎重构 Agent 时代多模态传输底座。来源:InfoQ AI。

对通用 Agent 来说,多模态交互正在成为一项能大幅提升用户体验的关键基础技术。

过去,用户和 AI 的交互更多是输入文字、上传图片,然后等待回答。

现在,家长希望可以直接把镜头对准孩子正在做的题目,让 AI 一步步讲解;在穿搭建议、视障人群视频导航等场景里,用户也希望 AI 不再是一问一答,而是在整个任务过程中持续倾听、对话。

这种变化提高的不只是功能丰富度,还有用户与 AI 建立连接的频率和深度。

火山引擎智能视频技术负责人裴志伟在分享中提到,视频通话等多模态场景“极大地拓宽了技术方案的普适性,带来了更多的想象力”,同时也帮助豆包获得了更多流量,“几乎是在没有做太多投放的情况下,业务规模翻了 10 倍,从千万级 DAU 变成了亿级 DAU”。

这种多模态体验不是模型能力单独决定的。

用户打开摄像头和麦克风后,真正影响体验的还有传输质量——连接是否足够快,弱网下是否稳定,音画是否同步,用户打断能否被及时响应,以及模型能否在正确时间拿到正确的信息。

也因此,国内的豆包和海外的 ChatGPT,都在构建让 AI 与人自然沟通的更成熟技术底座。

OpenAI 在 7 月 8 日推出了新的 GPT-Live,将连续对话与更深入的搜索、推理和智能体任务解耦,打造了一个相对独立的、低延迟、可打断、可持续的多模态信息交互层。

更早举办的 2026 火山引擎 FORCE 原动力大会上,火山引擎也介绍了背后支撑豆包进行实时多模态交互的多模态传输系统(MMT)。

最终,火山引擎和 OpenAI 要解决的,都不是单纯的音视频性能问题,而是如何为 Agent 时代搭建一套支撑大规模、多场景、低延迟、可打断、可同步的多模态传输系统。

音视频传输技术不够用了 火山引擎和 OpenAI 在介绍自己的多模态交互技术时,都提到了传统音视频传输技术与 Agent 时代的多模态交互需求存在落差。

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接