- 类型
- 模型
- 来源
- AIHOT · X / 公众号精选
- 发布
- 2026年8月4日 08:12
- 状态
- 单一信源
01
发生了什么
腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 与 MoE 架构,融合高精度识别与语义理解。该模型在开源评测集中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,支持上下文纠错、热词注入及高噪耳语等场景,已上线腾讯云 API,元宝 App 首发并免费开放。
02
为什么重要
腾讯混元推出 Hy ASR 3.0 preview,将语音识别与语义理解结合,支持上下文纠错和热词注入,相比传统 ASR 在准确性和场景适应性上有实质提升,尤其在粤语和高噪环境下表现突出,已落地腾讯云和元宝 App。
03
底层逻辑
该模型基于大语言模型 Hy3 与 MoE 架构,利用大规模语言模型的理解能力提升语音识别准确性,并通过上下文纠错和热词注入机制动态调整识别结果,以适应特定场景。MoE 架构可能有助于在保持性能的同时控制推理成本。
04
产品与商业机会
对腾讯云 API 用户和元宝 App 用户,该模型提供了更准确的语音识别能力,支持粤语和高噪场景,可降低下游业务中人工纠错成本,提升语音交互体验。开发者可集成 API 实现上下文感知的语音功能,但具体定价和配额尚未公布。
- 在客服或语音助手产品中集成 Hy ASR 3.0,利用上下文纠错提升用户指令理解的准确性。
- 面向粤语用户开发语音输入或转写工具,利用低 WER 和热词注入功能,满足方言场景需求。
- 针对嘈杂环境(如工厂、车内)的语音控制应用,利用高噪耳语支持增强产品可靠性。
- 基于热词注入能力,为垂直行业(如医疗、金融)定制专业术语识别模板。
05
仍待确认
- Hy ASR 3.0 的上下文纠错能力具体支持多长的上下文窗口?
- 该模型在腾讯云 API 上的定价和并发限制是多少?
- 元宝 App 中该模型是否有限流或功能限制?
- 与其他主流 ASR 模型(如 Whisper)在相同评测集上的对比数据如何?