当前位置:首页>AI资讯>腾讯混元发布 Hy ASR 3.0 preview:引入上下文理解,支持方言、术语与复杂环境识别

腾讯混元发布 Hy ASR 3.0 preview:引入上下文理解,支持方言、术语与复杂环境识别

2026年8月4日,腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview。该模型基于 Hy3 大语言模型的语言理解能力,将高精度语音识别与上下文语义理解结合,重点提升方言、中英文混说、同音词、专业术语及复杂声学环境下的转写效果。

与传统语音识别主要依赖声学信号进行逐字转写不同,Hy ASR 3.0 preview 会结合前后文判断用户语境和表达意图,再生成对应文字。例如面对“期中考试”和“期终考试”、“致癌物质”和“治癌物质”等同音或近音表达时,模型可以通过上下文语义进行消歧和纠错。

在方言和多语言识别方面,Hy ASR 3.0 preview 覆盖粤语、吴语等十大方言片区及二十余个二级小片区,同时支持普通话、英语和中英文混说。公开评测数据显示,其中文普通话词错误率 WER 为 3.34%,英语为 2.62%,粤语为 3.12%。

模型还加强了行业术语识别能力,可处理金融、科研、游戏等领域的专业表达,并支持热词注入。企业可通过加入品牌名称、产品名称、人名和业务术语,进一步提高特定场景下的识别准确率。

针对真实使用环境,Hy ASR 3.0 preview 对高噪声、耳语、低音量等场景进行了专项优化,可用于地铁站、街道、工厂、KTV、咖啡厅和办公室等不同环境中的语音识别。

技术方面,Hy ASR 3.0 preview 采用 MoE 混合专家架构,基座模型升级至 Hy3。语音侧使用腾讯混元自研的无监督语音 Encoder,并通过数千万小时级、多来源语音数据进行联合训练。后训练阶段则围绕通用转写、上下文理解、专业词汇和复杂长尾场景进行了 SFT 与多阶段强化学习优化。

目前,Hy ASR 3.0 preview 已首发接入腾讯元宝。用户可在元宝中通过语音输入体验方言、专业术语、同音词纠错及复杂环境识别能力,WorkBuddy 等腾讯产品也在陆续接入。

与此同时,该模型已通过腾讯云提供 API 服务,面向智能客服、会议转写、音视频字幕、内容理解、语音搜索和企业知识库等场景开放。企业还可以结合热词注入,对特定品牌、产品及行业术语进行定制增强。

Hy ASR 3.0 preview 的核心升级,是让语音识别从“听清楚用户说了什么”,进一步转向“结合上下文理解用户想表达什么”。对于会议纪要、访谈转写、客服分析和方言语音输入等场景,这种语义感知能力有望减少同音词误判和复杂环境下的识别错误。

豆包AI助手
©版权声明:如无特殊说明,本站所有内容均为AIHub.cn原创发布和所有。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。否则,我站将依法保留追究相关法律责任的权利。