AI

阿里发布Qwen-Audio-3.0-Realtime,实时语音大模型实现四项升级

7月15日,阿里巴巴发布实时语音交互对话模型Qwen-Audio-3.0-Realtime。该模型在智商、Agent工具调用、共情对话和双工交互流畅度四条主线上同步升级,提供推理更强的Plus版本和速度更快的Flash版本。模型采用在线策略蒸馏框架,将文本大模型的推理能力蒸馏至语音模型,适用于智能客服、教育培训、娱乐互动与情感陪伴等场景。

来源:量子位

7月15日,阿里巴巴发布实时语音交互对话模型Qwen-Audio-3.0-Realtime,在智商、Agent工具调用、共情对话和双工交互流畅度四条主线上同步升级,力求“又快又聪明”。模型包括推理更强的Plus版本和速度更快的Flash版本,适用于智能客服、教育培训、娱乐互动与情感陪伴等场景。

核心升级亮点

1. 智商与推理能力
为压低时延,实时语音模型往往牺牲推理深度。Qwen-Audio-3.0-Realtime针对日常对话等场景可直接生成回复,实现毫秒级响应。在VoiceBench基准测试中,Plus版本得分仅下降2.0,能扛住真人说话的随意性。在AudioMultiChallenge基准测试中,Flash版本得分仅下降5.5。

2. Agent工具调用
模型无需明确指令即可自行调用外部工具,调用结果会自动融入对话记忆。例如用户先问“附近有什么川菜馆”,再追问“评分4.5以上的哪家最近”,模型会自动衔接地图工具的上一次返回结果继续检索。模型基于FunctionCall标准协议,可完成MCP、API、知识库的引入。

3. 共情对话
模型可根据对话语境动态调整语气、节奏、音调与情感。在辩论场景中能准确抓取论点并组织反驳;在情感陪伴中,通过语调、节奏与笑声、叹息等副语言信号进行共情回应。在VStyle语音指令遵循公开基准上取得SOTA成绩。

4. 双工交互流畅度
模型能边说边听,像真人一样随时打断、插话。内置“多模态感知的双工控制”子模型,通过分析音频信号、语义内容与说话人声纹特征来判断如何交谈。在嘈杂环境中不会被背景噪声误打断,在多人讨论中能锁定主对话对象。API还预留了audio_prompt字段,支持上传音频样本锁定声纹。

技术架构

上述能力提升源于模型采用的On-Policy Distillation(在线策略蒸馏)框架。研究团队将文本大模型的完整推理能力蒸馏至语音模型,同时引入多教师蒸馏策略,包括口语多轮偏好教师、通用教师、Agentic教师和音频理解教师,确保模型在四条主线上均不偏科。

原始来源: 量子位

本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。

更多「AI」资讯

让品牌在 AI 中生长

免费诊断你的品牌 AI 可见度