← 返回新闻列表
量子位 🗓️ 2026-07-15

深度解读:又快又聪明,阿里发布Qwen-Audio-3.0-Realtime:实时语音大模型四项功能升级

⚡ 一句话看懂:又快又聪明,阿里发布Qwen-Audio-3.0-Realtime:实时语音大模型四项功能升级

又快又聪明,阿里发布Qwen-Audio-3.0-Realtime:实时语音大模型四项功能升级 量子位的朋友们 2026-07-15 11:48:46 来源: 量子位 7月15日,阿里巴巴发布实时语音交互对话模型Qwen-Audio-3.0-Realtime,在智商、Agent工具调用、共情对话和双工交互流畅度四条主线上同步升级,力求“又快又聪明”。

模型包括推理更强的Plus版本和速度更快的Flash版本,适用于智能客服、教育培训、娱乐互动与情感陪伴等场景。

今年5月,模型的Preview版本曾在全球权威第三方评测平台Artificial Analysis榜单斩获了两项冠军,超越GPT-Realtime-2。

为压低时延,实时语音模型往往牺牲推理深度,智商衰减。

Qwen-Audio-3.0-Realtime针对日常对话、简单问答等对时延敏感的场景,可直接生成回复,毫秒级响应。

在考验“AI会不会答”的语音问答基准VoiceBench上,以书面化的标准prompt和口语化的prompt提问,Plus版本得分分别为92.5和90.5,仅下降2.0——意味着模型能扛住真人说话的随意性。

在更难的多轮音频对话挑战AudioMultiChallenge基准测试中,Flash版本标准和口语化prompt得分分别为43.6和38.1,仅下降5.5。

今年5月,模型的Preview版本Fun-Realtime-Audiochat在“语音推理能力”指标上曾以97.6%登顶Artificial Analysis。

文本大模型的Agent能力已相当成熟,但语音模型往往是“能聊天不能办事”,模型要边听边判断何时该调工具,往往需要用户明显说出“帮我打开XX””才能触发工具,且切回闲聊后,容易出现上下文断裂。

Qwen-Audio-3.0-Realtime无需明确的指令,即可自行调用外部工具,调用结果还会自动融入对话记忆,一次调用的结果会被记住,后面几轮追问都能接着用。

例如用户先问“附近有什么川菜馆”,再追问“评分4.5以上的哪家最近”,模型会自动衔接地图工具的上一次返回结果继续检索。

模型基于FunctionCall标准协议,可以完成MCP、API、知识库的引入。

共情对话是本版本最能改变用户主观体验的部分。

Qwen-Audio-3.0-Realtime摆脱了传统语音助手的机械感,可根据对话语境动态调整语气、节奏、音调与情感,比如在辩论场景中,模型能准确抓取对方论点并快速组织反驳,并保持恰当的语气强度。

在情感陪伴中,则通过语调、节奏与笑声、叹息、犹豫等副语言信号进行共情回应。

在专门考“AI说得像不像人”的S2S语音指令遵循公开基准VStyle上,模型取得SOTA成绩。

🔗 原始来源

如果你要核对细节,可以再看原文: 量子位原文链接