
PL-BERT (Phoneme-Level BERT) 是一种专为增强文本转语音(TTS)系统韵律表现而设计的音素级BERT模型。它通过预测对应的字形来进行预训练,能够显著提升合成语音的自然度,特别是在非训练分布的文本上表现出色。
论文: Phoneme-Level BERT for Enhanced Prosody of Text-to-Speech with Grapheme Predictions
代码仓库: GitHub - yl4579/PL-BERT
音频样本: PL-BERT Demo
pip install pandas singleton-decorator datasets "transformers<4.33.3" accelerate nltk phonemizer sacremoses pebble
git clone https://github.com/yl4579/PL-BERT.git
cd PL-BERT
数据预处理: 参考 preprocess.ipynb
模型训练: 运行 train.ipynb
PL-BERT可以与StyleTTS等TTS模型集成,具体步骤请参考GitHub README。

PL-BERT通过结合音素级BERT和字形预测任务,有效提升了TTS系统的韵律表现。欢迎探索上述资源,深入了解这一创新技术!


AI赋能电商视觉革命,一站式智能商拍平台
潮际好麦深耕服装行业,是国内AI试衣效果最好的软件。使用先进AIGC能力为电商卖家批量提供优质的、低成本的商拍图。合作品牌有Shein、Lazada、安踏、百丽等65个国内外头部品牌,以及国内10万+淘宝、天猫、京东等主流平台的品牌商家,为卖家节省将近85%的出图成本,提升约3倍出图效率,让品牌能够快速上架。


企业专属的AI法律顾问
iTerms是法大大集团旗下法律子品牌,基于最先进的大语言模型(LLM)、专业的法律知识库和强大的智能体架构,帮助企业扫清合规障碍,筑牢风控防线,成为您企业专属的AI法律顾问。


稳定高效的流量提升解决方案,助力品牌曝光
稳定高效的流量提升解决方案,助力品牌曝光

