准确率高达96.04%!阿里开源自研语音识别模型 DFSMN
2019-06-10 14:23:18爱云资讯790
近日,阿里巴巴达摩院机器智能实验室开源了新一代语音识别模型DFSMN,将全球语音识别准确率纪录提高至96.04%(这一数据测试基于世界最大的免费语音识别数据库LibriSpeech)。

对比目前业界使用最为广泛的LSTM模型,DFSMN模型训练速度更快、识别准确率更高。采用全新DFSMN模型的智能音响或智能家居设备,相比前代技术深度学习训练速度提到了3倍,语音识别速度提高了2倍。
语音识别模型 DFSMN
授权协议:MIT
开发语言:C/C++
操作系统:跨平台
GitHub地址:
https://github.com/tramphero/kaldi
语音识别技术一直都是人机交互技术的重要组成部分。有了语音识别技术,机器就可以像人类一样听懂说话,进而能够思考、理解和反馈。近几年随着深度学习技术的使用,基于深度神经网络的语音识别系统性能获得了极大的提升,开始走向实用化。基于语音识别的语音输入、语音转写、语音检索和语音翻译等技术得到了广泛的应用。

目前主流的语音识别系统普遍采用基于深度神经网络和隐马尔可夫(Deep Neural Networks-Hidden Markov Model,DNN-HMM)的声学模型,其模型结构如图所示。声学模型的输入是传统的语音波形经过加窗、分帧,然后提取出来的频谱特征,如 PLP, MFCC 和 FBK等。
而模型的输出一般采用不同粒度的声学建模单元,例如单音素 (mono-phone)、单音素状态、绑定的音素状态 (tri-phonestate) 等。从输入到输出之间可以采用不同的神经网络结构,将输入的声学特征映射得到不同输出建模单元的后验概率,然后再结合HMM进行解码得到最终的识别结果。
据了解,DFSMN模型就是在国际声学会议 ICASSP 2018 上做oral报告的 DFSMN(深度前馈序列记忆网络)。DFSMN使用基于BLSTM的统计参数语音合成系统作为基线系统,采用广泛使用的跳跃连接技术,在执行反向传播算法时,梯度可以绕过非线性变换。
著名语音识别专家,西北工业大学教授谢磊表示:“阿里此次开源的DFSMN模型,在语音识别准确率上的稳定提升是突破性的,是近年来深度学习在语音识别领域最具代表性的成果之一,对全球学术界和AI技术应用都有巨大影响。”
相关文章
- Meta开源大模型Llama 4震撼发布,阿里巴巴/微美全息聚焦加速垂直领域AI应用布局
- 全球最大线上批发商城与线下商城战略合作,阿里云赋能全球贸易AI时代新篇章
- 亚信科技+阿里云 | 大模型协作新突破,让百行千业用上普惠AI !
- 构建创新生态,阿里云“MARS创业者计划”助力企业决胜AI时代
- 阿里巴巴AI智能眼镜年底登场,微美全息以“AI+AR”领航开启人机交互视界新篇
- 聚力出海,共赢增长|阿里云 x Meta 出海沙龙回顾
- 阿里云与南京大学签署校企合作协议,以“云工开物”支持人工智能人才培养与科研创新
- 中国移动与阿里巴巴签署战略合作协议
- 手机也能跑的模型来了!阿里宣布开源Qwen2.5-Omni-7B
- 阿里云升级Premier级别WhatsApp官方商业解决方案提供商,赋能全球企业高效连接20+亿用户
- 叫叫亮相阿里云AI势能TECH DAY:AI为教育插上想象的翅膀
- 重磅发布!亚信科技、阿里云大模型一体机,让百行千业用上普惠AI
- 接入 DeepSeek、联合阿里云,传音AI战略玩出新高度!
- 阿里云 Chat App 打通模型服务, 0代码接入智能体应用
- AI耳机AIxFU来了!基于阿里云通义大模型深度打磨,性能、智能、价格重新定义行业标准
- 变革通话体验,中国移动携手阿里云通义、华为打造“交互通话”新时代