开源语音

会议室:待定
出品人:张彬彬

开源在现代计算机和软件生态中发挥着越来越重要的作用,在语音识别行业,国内也涌现出... 展开 >

专题出品人:张彬彬

地平线机器人算法专家

WeNet 开源社区(https://wenet.org.cn/)发起人,先后主导了行业最流行的端到端语音识别项目 WeNet 和多领域大规模中文语音识别开源数据集 WenetSpeech 的开发。2017 年硕士毕业于西北工业大学,现任地平线语音算法专家,先后在微软、出门问问等公司从事语音识别算法和产品研发。

个人主页:https://robin1001.github.io/

专题:开源语音

开源在现代计算机和软件生态中发挥着越来越重要的作用,在语音识别行业,国内也涌现出越来越多的开源工作,极大地促进了行业的发展、落地和繁荣。如面向语音全领域的 PaddleSpeech;面向语音识别的 wenet、k2、athena;面向歌唱合成领域的 opencpop 开源数据集;面向声纹识别的 wespeaker;面向语音唤醒的 wekws 等。百花齐放,百舸争流,这些项目各自有哪些特点,背后又有哪些对行业、对技术的思考? 本次专题将邀请其中的一些典型项目负责人,带你一探究竟。

by 彭震东

地平线信息科技有限公司
语音研发部 语音识别算法工程师

随着人工智能时代的到来,语音产业得到了快速发展,尤其是随着网络会议的兴起,人们对语音识别速度和准确性的要求越来越高。在这样的背景下,WeNet 社区推出了开源的端到端语音识别工具包,包括致力于端到端语音识别模型的训练,以及端到端模型在工业级产品中的落地与部署。本次分享将从实践落地的角度来阐述端到端语音识别工具包 WeNet 的技术演进之路。

演讲提纲:

  1. 语音产业发展背景及行业诉求
  2. 语音识别框架:传统 vs. 端到端语
  3. 开源端到端语音识别工具包 —— WeNet 技术演进之路
  4. WeNet 产品级方案
  5. 未来与展望

你将获得:

  • 了解语音识别的发展历程
  • 了解端到端语音识别的发展现状
  • 了解端到端语音识别工具包 WeNet 的落地与部署

by 朱鹏程

网易
伏羲实验室 语音算法研究员

近年来,随着深度学习在语音合成任务上带来的突破性进展,歌声合成逐渐迈向实用化阶段。在虚拟偶像、音乐创作、游戏配乐等场景中崭露出巨大的应用潜力。为了汇集更多的智慧、推进 AI 音乐技术的普及与发展,首个高质量中文歌声合成数据集 Opencpop 应运而生。本次分享将为大家揭晓 Opencpop 背后的故事,共同探讨 AI 音乐的发展方向。

演讲提纲:

  1. 背景介绍
    • 歌声合成介绍
    • 为什么开源?
  2. 数据构建
    • 音色挑选
    • 曲库设计
    • 录制环境
    • 标注体系
  3. 实验论证
    • 实验设计
    • 主客观结果
  4. 未来展望

你将获得:

  • 了解歌声合成技术历史与现状
  • 了解歌声合成数据库设计与建设方法
  • 了解歌声合成技术的难点与发展趋势

by 康魏

小米
AI 实验室 高级算法工程师

过去十几年 Kaldi 开源语音识别软件风靡全球,为语音识别的产业化落地做出了杰出贡献。然而,随着深度学习框架的普及和端到端模型的兴起,Kaldi 逐渐显得跟不上技术发展的趋势,于是新一代 Kaldi 应运而生。那么新一代 Kaldi 项目要解决什么问题?它目前的研发现状是什么样的?未来又有哪些开发计划?它里面提出的可微分加权有限状态转换器又是怎么工作的呢?本次分享将为你一一揭晓。

演讲提纲:

  1. 什么是新一代 Kaldi
  2. 可微分加权有限状态自动机
    • k2 中的 FSA
    • 如何实现 FSA 的可微分
    • 使用可微分加权有限状态自动机训练模型
  3. 新一代 Kaldi 在端到端模型上的探索

你将获得:

  • 了解新一代 Kaldi 项目的基本目标和概念
  • 了解可微分加权有限状态自动机的工作原理
  • 了解新一代 Kaldi 在端到端模型上的探索

交通指南

来广营·朝来科技园

Laiguangying Beijing
地址: 北京市朝阳区来广营朝来科技园
  • 微信咨询

  • 电话咨询

    联系电话:+86 13167596032

微信联系我们