站在大同善化寺的大雄宝殿中,我打开与豆包的视频通话,将镜头对准殿左右的金代彩塑,问道:“给我讲讲这些金代彩塑,哪几尊塑像最值得细细端详?
”豆包会像真人讲解一样,先“看到和认出”彩塑,再“听懂”问题,然后“思考”如何回答,最后说出答案。
如果你也在景点或展览中这样向豆包提问过,会发现豆包的讲解能力已经接近普通真人讲解员的水准。
留心观察,你会发现越来越多像豆包一样能看能听、能想能说的 Agent 正出现在不同的生活和工作场景中。
在它们身上,音视频不再只是被人单向消费的内容,而是支持其面向真实世界进行输入与输出的重要能力。
在人与 Agent 协同共存的趋势下,视频云的任务不再只是保障内容流转,还要支撑人与 Agent 之间的意图交互。
过去,音视频是被消费的内容,视频云的主要任务是让音视频以更清晰、更稳定、更低延迟、更低成本的方式服务用户,为人带来更好的观看和互动体验。
现在,Agent 成为了视频云的“超级用户”,需要依靠视频云去感知世界、理解世界、执行任务、交付结果,只做好采集、传输、存储、转码、分发和播放已经远远不够了。
视频云需要具备更多智能。
火山引擎视频与边缘负责人王悦在 2026 火山引擎 FORCE 原动力大会智能视频云论坛上指出,Agent 时代的视频云既是人与 AI 协同的交互底座,也是 Agent 在多模态场景下进行感知、处理、表达与执行的重要能力层,更是智能应用连接真实世界的关键基础设施之一。
这意味着,视频云需要面向 Agent 时代完成一次自我重构:在继续服务好人的同时,也要满足好 Agent 提出的新需求。
从 VCloud 到 Agentic VCloud 在过去相当长的一段时间内,音视频都是人们获取信息的媒介,主要服务于传播场景。
从广播、电视到后来的长视频、短视频、直播、播客,承载音视频的产品形态在随着技术发生变化,但服务的对象始终是人,服务的价值始终是满足人的感官体验和内容获取需求。
随之诞生的视频云,实际上是在解决如何兼顾极致的体验和成本的问题。
服务于这个目标,视频云形成了比较稳定的发展逻辑:更高画质、更低延迟、更强并发、更优成本。
这也是火山引擎视频云业务过去 10 年一直在积累的“抖音同款能力”——为数亿用户提供流畅稳定的视听体验。
到 2023 年大模型兴起之后,音视频内容不再只是制作出来供人观看的内容,还成为了 AI 感知世界、理解需求的重要媒介。
再到 2026 年上半年,行业跑步进入 Agent 时代,音视频又从 AI 感知的媒介,进化成为了 AI 与人实现意图对齐、输出任务成果的媒介。
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜