2026-09-23 · 来源:{'name': '36氪快讯·中继', 'url': 'https://www.36kr.com/newsflashes/3995823126892418'}
讯飞发布新一代语音识别大模型,整体识别效果大幅提升,推理成本较前代仅增10%。
9月23日,科大讯飞正式发布最新一代语音识别大模型Spark-ASR-2.0。该模型延续并深化了Spark-Audio-1.0-Preview语音基座大模型的技术能力,整体语音识别效果实现大幅提升。
从技术设计看,Spark-ASR-2.0的识别增益主要来自三项关键能力:非自回归与LLM增强自回归的协同机制、面向中英文混合场景的文本与声学联合增强,以及动态上下文注入。成本端的数据同样关键——相较前一代模型,该模型的推理成本仅增加10%。对需要大规模调用语音识别能力的企业而言,识别效果提升而推理成本近乎持平,直接关系到单位调用成本与商用部署节奏。
落地安排上,Spark-ASR-2.0将从9月24日起逐步上线讯飞输入法,并通过讯飞开放平台对外提供API服务;后续还将陆续应用在讯飞AI眼镜、讯飞智能办公本、讯飞听见等产品上。
值得注意的是,该模型在发布次日即开始进入讯飞输入法,API服务也将经由讯飞开放平台提供,从发布到面向用户可用的间隔很短。在此过程中,10%的推理成本增幅为业界观察语音大模型“效果升级是否伴随成本大幅攀升”提供了一个具体参照。
萬安算交所 AIXX · 算力硬件实名会员制交易平台 · 进入货源大厅