人与 AI 的沟通正在变得越来越像人与人之间的沟通。
一位店员用 AI 制作门店宣传视频时,不再把需求列成一段非常细致的 Prompt 发给 AI,然后等待它返回结果;而是直接开启一个与 AI 的对话,告诉它“帮我剪一条今天新品上架的视频”,然后通过连续对话敲定任务的具体细节,就像与人类剪辑师一样。
同样的情况已经发生在很多具体场景中。
一些程序员在通勤或散步时会用语音和 Agent 讨论一个功能该怎么设计,如何实现;有用户在玩游戏时,会不断与 AI 游戏助手沟通现在应该做哪些任务,当前的关卡还有哪些道具没有收集…… 进入 Agent 时代,AI 不再只是输入框另一端的响应系统,而是开始进入需求讨论、方案判断和任务执行的全过程。
这种角色变化,也让音视频对话成为越来越多人与 Agent 交互的主要方式。
数据显示,豆包 App 在今年一季度的音频用量环比增长约 200%,视频用量增长约 350%;近一年来的音视频模型日均 Token 消耗已经达到千亿级别。
联想天禧 AI 看世界功能从 2025 年 8 月上线到 2026 年 5 月,人均对话轮次提升至刚上线时的 1.65 倍,是传统一问一答主对话的 3 倍。
当越来越多的人把与 Agent 的主要沟通方式从打字切换到视频或语音,多模态对话就很可能会成为人与 Agent 协作的主要交互界面。
语音、视频、屏幕共享和环境信息都会成为这个界面的一部分。
用户不再只是“输入问题”,而是在一个持续的上下文中,让 Agent 理解任务、补充信息、调用工具并参与执行。
但要真正实现这一点,对多模态交互能力的要求就不能只是“能听见声音”或“能看见画面”,而是要具备接近人的沟通能力,同时做好听觉、视觉、记忆和意图四项能力。
只有当这些能力同时成立,多模态对话才会从一种输入方式,升级为支撑任务判断、方案形成和执行推进的协作机制,支持 Agent 完成从工具到伙伴的进化。
一、从等待指令到参与讨论 多模态交互真正改变的,不只是用户向 Agent 发出指令的方式,而是 Agent 进入任务的时间点。
在人与人的协作中,很多需求和答案并不是一开始就完整存在。
往往先是有一个模糊的想法,然后在大家讨论中不断被追问细节,结合场景、资源和目标不断补充信息,最终才被沉淀成一个清晰的执行方案。
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜