LibriHeavy: 50,000小时的开源自动语音识别语料库

RayRay
Libriheavy语音识别数据集标点符号上下文Github开源项目

LibriHeavy:50,000小时的开源自动语音识别语料库

LibriHeavy是一个革命性的大规模开源自动语音识别(ASR)语料库,包含50,000小时的英语语音数据。这个语料库不仅规模庞大,还包含了丰富的语言信息,如标点、大小写和上下文,为ASR研究和应用提供了前所未有的资源。

语料库概况

LibriHeavy是基于LibriVox项目的公开有声书籍音频构建而成的。它是目前最大的带有监督信息的开源语音语料库之一。与其他只提供规范化文本的开源数据集不同,LibriHeavy包含更丰富的信息:

  • 标点符号
  • 大小写信息
  • 上下文文本

这些额外的信息为ASR系统的构建提供了更大的灵活性。研究人员可以利用这些信息训练出更加智能和自然的语音识别模型。

数据集构建

LibriHeavy的构建过程充分利用了先进的音频对齐和分割技术。研究团队提出了一种通用高效的流水线来定位、对齐和分割LibriLight中的音频到相应的文本。具体步骤包括:

  1. 下载原始文本
  2. 第一阶段对齐:使用自动识别结果定位音频在原书中的大致位置
  3. 第二阶段对齐:使用Levenshtein对齐算法精确定位
  4. 音频分割:将长音频切分为2-30秒的短片段

这种方法不仅高效,而且具有很强的通用性,可以应用于其他音频对齐任务。

LibriHeavy pipeline

数据集规模与统计

LibriHeavy保持了LibriLight的原始数据集划分,包含三个训练子集:

  • small: 500小时
  • medium: 5,000小时
  • large: 50,000小时

此外,还提取了开发集和测试集用于验证和测试。

数据集的一些重要统计信息如下:

子集小时数书籍数每位说话人平均小时数说话人总数平均时长(秒)
small5091731.2241714.9
medium5,0429603.291,53114.8
large50,7948,5927.546,73614.8
dev22.31800.1614115.0
test-clean10.5870.157014.7
test-other11.51120.167214.6

这些统计数据显示,LibriHeavy不仅规模庞大,而且具有很好的多样性,包含了大量的说话人和书籍。

数据格式与下载

LibriHeavy的音频文件与LibriLight相同,可以从LibriLight项目下载。清单文件托管在Hugging FaceModelScope(面向中国大陆用户)上。

清单文件采用JSON格式,包含丰富的元数据信息,如音频片段的ID、开始时间、持续时间、文本内容等。研究人员可以根据需要选择使用带标点和大小写的完整格式版本,或者规范化的版本(全大写无标点)。

基准模型与性能

为了展示LibriHeavy的实用性,研究团队基于两种主流的端到端ASR模型架构训练了基准系统:

  1. CTC-Attention模型
  2. 神经转录器(Transducer)模型

这些模型在LibriHeavy的不同子集上进行了训练,并在LibriSpeech和LibriHeavy的测试集上进行了评估。结果显示,随着训练数据量的增加,模型性能显著提升。

以下是在large子集(50,000小时)上训练的Transducer模型的部分结果:

  • LibriSpeech测试集WER: clean 1.62%, other 3.36%
  • LibriHeavy测试集WER: clean 2.20%, other 5.57%

这些结果证明了LibriHeavy数据集的高质量和有效性。

开源与影响

LibriHeavy项目不仅开放了数据集,还开源了数据集构建流水线的代码。这为语音识别研究社区提供了宝贵的资源,可以促进更多创新性的研究。

LibriHeavy的出现有望在以下方面产生重要影响:

  1. 推动大规模端到端ASR模型的研究与发展
  2. 促进带有标点和大小写的ASR系统的研究
  3. 为上下文感知的ASR提供数据支持
  4. 为语音合成、说话人识别等相关任务提供资源

结语

LibriHeavy作为一个包含丰富语言信息的大规模开源ASR语料库,为语音识别技术的进步提供了强大的推动力。它不仅规模庞大,而且包含了标点、大小写和上下文等关键信息,为研究人员提供了前所未有的资源。随着这一语料库的广泛应用,我们有理由期待在语音识别精度、自然度以及智能程度上都能取得新的突破。LibriHeavy的开放性也体现了开源精神,将推动整个语音识别社区的共同进步。

编辑推荐精选

堆友

堆友

多风格AI绘画神器

堆友平台由阿里巴巴设计团队创建,作为一款AI驱动的设计工具,专为设计师提供一站式增长服务。功能覆盖海量3D素材、AI绘画、实时渲染以及专业抠图,显著提升设计品质和效率。平台不仅提供工具,还是一个促进创意交流和个人发展的空间,界面友好,适合所有级别的设计师和创意工作者。

图像生成热门AI工具AI图像AI反应堆AI工具箱AI绘画GOAI艺术字堆友相机
码上飞

码上飞

零代码AI应用开发平台

零代码AI应用开发平台,用户只需一句话简单描述需求,AI能自动生成小程序、APP或H5网页应用,无需编写代码。

Vora

Vora

免费创建高清无水印Sora视频

Vora是一个免费创建高清无水印Sora视频的AI工具

Refly.AI

Refly.AI

最适合小白的AI自动化工作流平台

无需编码,轻松生成可复用、可变现的AI自动化工作流

酷表ChatExcel

酷表ChatExcel

大模型驱动的Excel数据处理工具

基于大模型交互的表格处理系统,允许用户通过对话方式完成数据整理和可视化分析。系统采用机器学习算法解析用户指令,自动执行排序、公式计算和数据透视等操作,支持多种文件格式导入导出。数据处理响应速度保持在0.8秒以内,支持超过100万行数据的即时分析。

AI工具使用教程AI营销产品酷表ChatExcelAI智能客服
TRAE编程

TRAE编程

AI辅助编程,代码自动修复

Trae是一种自适应的集成开发环境(IDE),通过自动化和多元协作改变开发流程。利用Trae,团队能够更快速、精确地编写和部署代码,从而提高编程效率和项目交付速度。Trae具备上下文感知和代码自动完成功能,是提升开发效率的理想工具。

热门AI工具生产力协作转型TraeAI IDE
AIWritePaper论文写作

AIWritePaper论文写作

AI论文写作指导平台

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

数据安全AI助手热门AI工具AI辅助写作AI论文工具论文写作智能生成大纲
博思AIPPT

博思AIPPT

AI一键生成PPT,就用博思AIPPT!

博思AIPPT,新一代的AI生成PPT平台,支持智能生成PPT、AI美化PPT、文本&链接生成PPT、导入Word/PDF/Markdown文档生成PPT等,内置海量精美PPT模板,涵盖商务、教育、科技等不同风格,同时针对每个页面提供多种版式,一键自适应切换,完美适配各种办公场景。

热门AI工具AI办公办公工具智能排版AI生成PPT博思AIPPT海量精品模板AI创作
潮际好麦

潮际好麦

AI赋能电商视觉革命,一站式智能商拍平台

潮际好麦深耕服装行业,是国内AI试衣效果最好的软件。使用先进AIGC能力为电商卖家批量提供优质的、低成本的商拍图。合作品牌有Shein、Lazada、安踏、百丽等65个国内外头部品牌,以及国内10万+淘宝、天猫、京东等主流平台的品牌商家,为卖家节省将近85%的出图成本,提升约3倍出图效率,让品牌能够快速上架。

iTerms

iTerms

企业专属的AI法律顾问

iTerms是法大大集团旗下法律子品牌,基于最先进的大语言模型(LLM)、专业的法律知识库和强大的智能体架构,帮助企业扫清合规障碍,筑牢风控防线,成为您企业专属的AI法律顾问。

下拉加载更多