阿里一口气上新5款千问模型,价格最高降95%
9月23日,千问正式发布Qwen-Audio-3.1系列语音大模型,一次性推出5款模型,对语音识别(ASR)、语音合成(TTS)和实时语音交互(Realtime)三大核心模型进行升级,并发布基于下一代架构的音频理解模型ASR-Next与音频创作模型TTS-Next。全线语音模型价格大幅下调,其中TTS降价约70%、Realtime降幅约85%、ASR降幅达95%。
三大核心模型升级
- Qwen-Audio-3.1-ASR:采用端到端方案,支持30种语言和16种中文方言。在公开方言测试中平均字错误率仅为4.55%。首字响应约160毫秒,自带润色与说话人区分功能。
- Qwen-Audio-3.1-TTS:升级跨语言音色合成能力,同一音色可跨语种自然迁移。支持通过指令控制情绪、语速和表达方式。
- Qwen-Audio-3.1-Realtime:强化全双工实时交互,能根据对话进程适时等待、插入和回应。支持多语言实时切换与工具调用,背景语音干扰响应率大幅降低。
两款Next新模型
- Qwen-Audio-3.1-ASR-Next:将声音处理范围扩展至完整音频信息,能理解人物情绪、环境声与机械声,完成声音描述、事件定位与音频问答。
- Qwen-Audio-3.1-TTS-Next:从语音合成拓展至音频创作,可统一生成人声、音效和环境音。支持细粒度时间戳控制、声音复刻和48kHz输出,覆盖播客、影视、游戏等场景。
智能硬件发布
千问办公同步发布两款智能硬件:首款Agent硬件QwenNote A2(磁吸手机背面的AI助理,支持独立录音转写、翻译与AI对话)和桌面机器人Eva(支持实时语音交互与多端联动)。Qwen-Audio-3.1-Realtime将逐步接入这些硬件及AI眼镜等终端。
原始来源: 智东西 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。