走到一个陌生景点,举着手机让豆包带你逛,它看到路牌标识主动提醒方向,看到建筑开口介绍典故;旁边路人聊天、街边叫卖,豆包不会被带偏,依然只跟你对话。
豆包视频通话功能升级后,AI 可以在连续变化的真实场景中实现更自然的连续交互,这为用户带来了三个最直观的感受: 能边看边听边说。
用户不用等 AI 说完才能开口,AI 能同时接收和处理音频、视频、文本三路输入。
指着航班牌问 “这个怎么走”,它看懂你指的是行李转盘;多人聊天时,它结合口型和画面判断是谁在对话,不被旁边闲聊带偏。
AI 会主动开口。
持续感知环境变化,看到关键标识会主动提醒,处理任务时主动调用工具查信息、整理结果。
交互模式从 “一问一答” 升级成了 “双向协作”,用户不用每次都先开口。
对话节奏自然。
不打断也不冷场,该说时说,该听时听。
自然接话、合理停顿,精准分辨旁人闲聊和背景噪声。
官方评测显示,对比传统级联方案,对话节奏违和问题减少了约 50%—— 用户几乎不会遇到 “AI 说完话突然停住” 或 “我还没说完 AI 就抢答” 的尴尬。
这背后是一次双线升级:模型层接入原生音视频全双工大模型 SeedRealtime,在业界率先实现音视频全双工技术的规模化落地。
而支撑这一切的底层传输架构,也已悄然完成从实时通信技术 (RTC)到火山引擎多模态传输系统(MMT)的代际跃迁。
SeedRealtime 定义了 “AI 能做什么”,而火山引擎 MMT 决定了 “用户能不能真正感受到这些能力”。
MMT 在三个核心环节完成了提升。
秒接通,秒应答 传统 RTC 架构下,音视频通道与信令通道分离,用户发起视频通话时需要经历多轮协商 —— 媒体通道建联、模型会话建立、状态同步各自为政,叠加下来往往需要数秒才能真正进入可用状态。
用户看到的是 “连接中…” 的转圈等待,体验大打折扣。
MMT 通过统一的多模态会话架构,将媒体传输与模型会话深度整合:
- 客户端底层基于 QUIC 库,复用连接、多路复用,一次建联即可承载音视频、信令、模型状态等多路数据;
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜