stt_en_conformer_transducer_xlarge

stt_en_conformer_transducer_xlarge

Conformer-Transducer模型的超大规模语音识别能力

Conformer-Transducer超大模型拥有600M参数,专为英语自动语音识别设计,以较低的字错误率(WER)脱颖而出。通过NVIDIA NeMo工具包训练,涵盖LibriSpeech、Mozilla Common Voice等多个数据集。模型支持Python调用,具备细化调优和批量处理功能,适合多种语音识别应用。虽然暂未兼容NVIDIA Riva,但其在英语语音处理方面表现卓越。

模型训练NVIDIA ConformerNVIDIA Riva自动语音识别模型Github开源项目语音转录Huggingface

stt_en_conformer_transducer_xlarge项目介绍

项目背景

stt_en_conformer_transducer_xlarge是一个以自动语音识别(ASR)为核心的项目,基于Conformer-Transducer模型架构。该模型专为英语语音转录优化,能够将音频转为由小写字母、空格和撇号组成的文本。

模型架构

这个模型属于Conformer-Transducer系列中的特大版本,拥有约6亿个参数。Conformer-Transducer是一种自回归模型,与常见的CTC损失不同,它采用了Transducer损失/解码策略。在语音识别任务中,其表现优异。

训练工具

为了训练、微调或试用此模型,用户需要安装NVIDIA的NeMo工具包,该工具包与Pytorch兼容。NeMo为用户提供了多种语音识别模型的训练脚本和配置文件。

数据集

stt_en_conformer_transducer_xlarge模型在多种公共数据集上进行了训练,包括但不限于:

  • Librispeech
  • Fisher Corpus
  • Switchboard-1
  • WSJ-0和WSJ-1
  • National Singapore Corpus
  • Mozilla Common Voice
  • Multilingual LibriSpeech
  • VCTK
  • VoxPopuli
  • People's Speech

这些多样化的数据集帮助模型在处理不同语音来源时表现稳定。

性能表现

该项目发布的模型在多个测试集上的表现如下,使用了贪婪解码进行评估:

  • LS test-other:WER为3.01
  • LS test-clean:WER为1.62
  • WSJ Eval92:WER为1.17
  • WSJ Dev93:WER为2.05
  • National Singapore Corpus Part 1:WER为5.70
  • Multilingual LibriSpeech Test:WER为5.32
  • Mozilla Common Voice Test 8.0:WER为6.46

WER(词错误率)是ASR模型的一项重要性能指标,值越低表示性能越好。

使用方法

用户可以在NeMo工具包中使用此模型作为预训练检测点,用于推理或微调。用户可以通过简单的Python代码立即调用该模型并进行音频转录。

输入与输出

模型接受16000 Hz单声道音频文件作为输入,输出为转录后的字符串文本。

项目限制

由于模型是基于公开语音数据集训练的,在处理特殊的技术术语或未曾训练过的方言时,性能可能会下降。口音重的语音数据也可能影响识别准确性。

部署选项

虽然目前该模型尚未被NVIDIA Riva支持,但其提供的情况下,Riva将允许用户将此类语音识别模型应用于各种应用场景中,如本地化部署、云服务或嵌入式设备中。

参考文献

该项目引用了多份技术文献和工具,如:

  1. Conformer: Convolution-augmented Transformer for Speech Recognition
  2. Google Sentencepiece Tokenizer
  3. NVIDIA NeMo Toolkit

使用许可

此模型的使用受到CC-BY-4.0许可协议的约束,下载或使用模型即视为接受此协议的条款。

编辑推荐精选

iTerms

iTerms

企业专属的AI法律顾问

iTerms是法大大集团旗下法律子品牌,基于最先进的大语言模型(LLM)、专业的法律知识库和强大的智能体架构,帮助企业扫清合规障碍,筑牢风控防线,成为您企业专属的AI法律顾问。

SimilarWeb流量提升

SimilarWeb流量提升

稳定高效的流量提升解决方案,助力品牌曝光

稳定高效的流量提升解决方案,助力品牌曝光

Sora2视频免费生成

Sora2视频免费生成

最新版Sora2模型免费使用,一键生成无水印视频

最新版Sora2模型免费使用,一键生成无水印视频

Transly

Transly

实时语音翻译/同声传译工具

Transly是一个多场景的AI大语言模型驱动的同声传译、专业翻译助手,它拥有超精准的音频识别翻译能力,几乎零延迟的使用体验和支持多国语言可以让你带它走遍全球,无论你是留学生、商务人士、韩剧美剧爱好者,还是出国游玩、多国会议、跨国追星等等,都可以满足你所有需要同传的场景需求,线上线下通用,扫除语言障碍,让全世界的语言交流不再有国界。

讯飞绘文

讯飞绘文

选题、配图、成文,一站式创作,让内容运营更高效

讯飞绘文,一个AI集成平台,支持写作、选题、配图、排版和发布。高效生成适用于各类媒体的定制内容,加速品牌传播,提升内容营销效果。

热门AI辅助写作AI工具讯飞绘文内容运营AI创作个性化文章多平台分发AI助手
TRAE编程

TRAE编程

AI辅助编程,代码自动修复

Trae是一种自适应的集成开发环境(IDE),通过自动化和多元协作改变开发流程。利用Trae,团队能够更快速、精确地编写和部署代码,从而提高编程效率和项目交付速度。Trae具备上下文感知和代码自动完成功能,是提升开发效率的理想工具。

AI工具TraeAI IDE协作生产力转型热门
商汤小浣熊

商汤小浣熊

最强AI数据分析助手

小浣熊家族Raccoon,您的AI智能助手,致力于通过先进的人工智能技术,为用户提供高效、便捷的智能服务。无论是日常咨询还是专业问题解答,小浣熊都能以快速、准确的响应满足您的需求,让您的生活更加智能便捷。

imini AI

imini AI

像人一样思考的AI智能体

imini 是一款超级AI智能体,能根据人类指令,自主思考、自主完成、并且交付结果的AI智能体。

Keevx

Keevx

AI数字人视频创作平台

Keevx 一款开箱即用的AI数字人视频创作平台,广泛适用于电商广告、企业培训与社媒宣传,让全球企业与个人创作者无需拍摄剪辑,就能快速生成多语言、高质量的专业视频。

即梦AI

即梦AI

一站式AI创作平台

提供 AI 驱动的图片、视频生成及数字人等功能,助力创意创作

下拉加载更多