AI

阿里一口气上新5款千问模型,价格最高降95%

9月23日,阿里千问发布Qwen-Audio-3.1系列语音大模型,一次性推出5款模型,涵盖语音识别、合成和实时交互,并发布下一代音频理解与创作模型。新一代语音识别大模型在方言测试中表现优异。同时,全线语音模型价格大幅下调,最高降幅达95%。此外,千问办公还发布首款Agent硬件QwenNote A2和桌面机器人Eva,新模型将逐步接入这些硬件。

来源:智东西 ↗

阿里一口气上新5款千问模型,价格最高降95%

9月23日,千问正式发布Qwen-Audio-3.1系列语音大模型,一次性推出5款模型,对语音识别(ASR)、语音合成(TTS)和实时语音交互(Realtime)三大核心模型进行升级,并发布基于下一代架构的音频理解模型ASR-Next与音频创作模型TTS-Next。全线语音模型价格大幅下调,其中TTS降价约70%、Realtime降幅约85%、ASR降幅达95%。

三大核心模型升级

  • Qwen-Audio-3.1-ASR:采用端到端方案,支持30种语言和16种中文方言。在公开方言测试中平均字错误率仅为4.55%。首字响应约160毫秒,自带润色与说话人区分功能。
  • Qwen-Audio-3.1-TTS:升级跨语言音色合成能力,同一音色可跨语种自然迁移。支持通过指令控制情绪、语速和表达方式。
  • Qwen-Audio-3.1-Realtime:强化全双工实时交互,能根据对话进程适时等待、插入和回应。支持多语言实时切换与工具调用,背景语音干扰响应率大幅降低。

两款Next新模型

  • Qwen-Audio-3.1-ASR-Next:将声音处理范围扩展至完整音频信息,能理解人物情绪、环境声与机械声,完成声音描述、事件定位与音频问答。
  • Qwen-Audio-3.1-TTS-Next:从语音合成拓展至音频创作,可统一生成人声、音效和环境音。支持细粒度时间戳控制、声音复刻和48kHz输出,覆盖播客、影视、游戏等场景。

智能硬件发布

千问办公同步发布两款智能硬件:首款Agent硬件QwenNote A2(磁吸手机背面的AI助理,支持独立录音转写、翻译与AI对话)和桌面机器人Eva(支持实时语音交互与多端联动)。Qwen-Audio-3.1-Realtime将逐步接入这些硬件及AI眼镜等终端。

原始来源: 智东西 ↗

本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。

更多「AI」资讯

让品牌在 AI 中生长

免费诊断你的品牌 AI 可见度