开源在现代计算机和软件生态中发挥着越来越重要的作用,在语音识别行业,国内也涌现出... 展开 >




WeNet 开源社区(https://wenet.org.cn/)发起人,先后主导了行业最流行的端到端语音识别项目 WeNet 和多领域大规模中文语音识别开源数据集 WenetSpeech 的开发。2017 年硕士毕业于西北工业大学,现任地平线语音算法专家,先后在微软、出门问问等公司从事语音识别算法和产品研发。
开源在现代计算机和软件生态中发挥着越来越重要的作用,在语音识别行业,国内也涌现出越来越多的开源工作,极大地促进了行业的发展、落地和繁荣。如面向语音全领域的 PaddleSpeech;面向语音识别的 wenet、k2、athena;面向歌唱合成领域的 opencpop 开源数据集;面向声纹识别的 wespeaker;面向语音唤醒的 wekws 等。百花齐放,百舸争流,这些项目各自有哪些特点,背后又有哪些对行业、对技术的思考? 本次专题将邀请其中的一些典型项目负责人,带你一探究竟。
随着人工智能时代的到来,语音产业得到了快速发展,尤其是随着网络会议的兴起,人们对语音识别速度和准确性的要求越来越高。在这样的背景下,WeNet 社区推出了开源的端到端语音识别工具包,包括致力于端到端语音识别模型的训练,以及端到端模型在工业级产品中的落地与部署。本次分享将从实践落地的角度来阐述端到端语音识别工具包 WeNet 的技术演进之路。
演讲提纲:
你将获得:
近年来,随着深度学习在语音合成任务上带来的突破性进展,歌声合成逐渐迈向实用化阶段。在虚拟偶像、音乐创作、游戏配乐等场景中崭露出巨大的应用潜力。为了汇集更多的智慧、推进 AI 音乐技术的普及与发展,首个高质量中文歌声合成数据集 Opencpop 应运而生。本次分享将为大家揭晓 Opencpop 背后的故事,共同探讨 AI 音乐的发展方向。
演讲提纲:
你将获得:
过去十几年 Kaldi 开源语音识别软件风靡全球,为语音识别的产业化落地做出了杰出贡献。然而,随着深度学习框架的普及和端到端模型的兴起,Kaldi 逐渐显得跟不上技术发展的趋势,于是新一代 Kaldi 应运而生。那么新一代 Kaldi 项目要解决什么问题?它目前的研发现状是什么样的?未来又有哪些开发计划?它里面提出的可微分加权有限状态转换器又是怎么工作的呢?本次分享将为你一一揭晓。
演讲提纲:
你将获得:



微信咨询

电话咨询
微信联系我们
