科大讯飞发布最新一代语音识别大模型Spark-ASR-2.0
9月23日,科大讯飞正式发布了最新一代语音识别大模型 Spark-ASR-2.0。此次发布标志着科大讯飞在语音识别领域的又一次重要技术迭代。
核心技术升级
据了解,Spark-ASR-2.0 延续并深化了此前发布的 Spark-Audio-1.0-Preview 语音基座大模型的技术能力。在技术架构上,该模型引入了多项关键创新:
- 非自回归与LLM增强自回归协同:通过结合两种生成方式的优势,在保障识别速度的同时,利用大语言模型(LLM)的纠错和增强能力,显著提升了复杂场景下的识别准确率。
- 中英文混合文本与声学联合增强:针对日常交流中常见的中英混说场景,模型在文本和声学特征层面进行了联合优化,大幅改善了跨语言识别的流畅度和准确性。
- 动态上下文注入:使模型能够根据对话的上下文语境进行动态调整,进一步提升了长语音和复杂语境下的语义理解与识别效果。
性能与成本优化
在实现整体语音识别效果大幅提升的同时,Spark-ASR-2.0 在成本控制方面也表现出色。官方数据显示,新一代模型的推理成本相对前一代模型仅增加了 10%,实现了性能与成本的良好平衡,为大规模商业化落地提供了有力支撑。
商业化落地与应用
在应用落地方面,Spark-ASR-2.0 将于 9月24日开始逐步上线讯飞输入法,为广大C端用户带来更精准的语音输入体验。同时,该模型也将通过讯飞开放平台提供 API 服务,赋能广大开发者和企业客户。
此外,后续 Spark-ASR-2.0 将陆续应用在科大讯飞旗下的多款智能硬件产品中,包括讯飞 AI 眼镜、讯飞智能办公本、讯飞听见等,全面覆盖移动办公、智能穿戴、会议记录等多元化场景,推动语音识别技术在更多真实场景中的深度应用。
原始来源: 36氪 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。