AI

科大讯飞发布最新一代语音识别大模型Spark-ASR-2.0

9月23日,科大讯飞正式发布最新一代语音识别大模型Spark-ASR-2.0。该模型基于Spark-Audio-1.0-Preview语音基座大模型,采用非自回归与LLM增强自回归协同等技术,大幅提升语音识别效果,且推理成本仅增加10%。该模型将于9月24日起逐步上线讯飞输入法,并通过开放平台提供API服务,后续将应用于讯飞AI眼镜、智能办公本等产品。

来源:36氪 ↗

科大讯飞发布最新一代语音识别大模型Spark-ASR-2.0

9月23日,科大讯飞正式发布了最新一代语音识别大模型 Spark-ASR-2.0。此次发布标志着科大讯飞在语音识别领域的又一次重要技术迭代。

核心技术升级

据了解,Spark-ASR-2.0 延续并深化了此前发布的 Spark-Audio-1.0-Preview 语音基座大模型的技术能力。在技术架构上,该模型引入了多项关键创新:

  • 非自回归与LLM增强自回归协同:通过结合两种生成方式的优势,在保障识别速度的同时,利用大语言模型(LLM)的纠错和增强能力,显著提升了复杂场景下的识别准确率。
  • 中英文混合文本与声学联合增强:针对日常交流中常见的中英混说场景,模型在文本和声学特征层面进行了联合优化,大幅改善了跨语言识别的流畅度和准确性。
  • 动态上下文注入:使模型能够根据对话的上下文语境进行动态调整,进一步提升了长语音和复杂语境下的语义理解与识别效果。

性能与成本优化

在实现整体语音识别效果大幅提升的同时,Spark-ASR-2.0 在成本控制方面也表现出色。官方数据显示,新一代模型的推理成本相对前一代模型仅增加了 10%,实现了性能与成本的良好平衡,为大规模商业化落地提供了有力支撑。

商业化落地与应用

在应用落地方面,Spark-ASR-2.0 将于 9月24日开始逐步上线讯飞输入法,为广大C端用户带来更精准的语音输入体验。同时,该模型也将通过讯飞开放平台提供 API 服务,赋能广大开发者和企业客户。

此外,后续 Spark-ASR-2.0 将陆续应用在科大讯飞旗下的多款智能硬件产品中,包括讯飞 AI 眼镜、讯飞智能办公本、讯飞听见等,全面覆盖移动办公、智能穿戴、会议记录等多元化场景,推动语音识别技术在更多真实场景中的深度应用。

原始来源: 36氪 ↗

本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。

更多「AI」资讯

让品牌在 AI 中生长

免费诊断你的品牌 AI 可见度