Vocos: 革新神经语音合成的高效率声码器

vocos

Vocos:突破时域与频域神经声码器之间的鸿沟

Vocos是一款创新的神经声码器,旨在从声学特征快速高效地合成高质量音频波形。作为语音合成领域的一项重要突破,Vocos通过巧妙结合时域和频域方法,成功弥合了两类神经声码器之间的差距,为高质量语音合成提供了新的可能性。

Vocos的创新之处

传统的神经声码器主要分为两类:基于时域的模型和基于频域的模型。时域模型直接生成音频样本,能够产生高质量的音频,但计算效率较低。频域模型则在频谱域上工作,计算效率更高,但往往面临相位恢复的难题,导致音质下降。Vocos巧妙地融合了这两种方法的优点,开创性地提出了一种新的声码器架构。

Vocos的核心创新在于:它并不直接建模时域的音频样本,而是生成谱系数。这种方法既保留了频域模型的高效率,又通过逆傅里叶变换实现了快速的音频重建,有效解决了相位恢复的问题。这一突破性设计使Vocos能够在保证高音质的同时,大幅提升合成速度。

Vocos的工作原理

Vocos采用生成对抗网络(GAN)的训练目标。在训练过程中,生成器学习从声学特征(如mel频谱图或EnCodec令牌)生成谱系数,而判别器则负责区分真实音频和生成音频的谱系数。这种对抗性训练使得Vocos能够生成更加逼真的音频。

在推理阶段,Vocos只需要一次前向传播就能生成高质量的音频波形。这种高效的推理过程使得Vocos特别适合实时语音合成应用。

Vocos的应用场景

Vocos的应用范围十分广泛,包括但不限于:

文本转语音(TTS)系统
语音转换
语音增强
音乐生成

特别值得一提的是,Vocos可以无缝集成到现有的语音合成管道中。例如,它可以与🐶 Bark文本到音频模型结合使用,进一步提升合成音频的质量和效率。

Vocos and Bark integration

Vocos的安装与使用

Vocos的安装非常简单,可以通过pip直接安装:

pip install vocos

如果需要训练模型,则可以安装带有额外依赖的版本:

pip install vocos[train]

Vocos提供了简洁明了的API,使用起来非常方便。以下是一个从mel频谱图重建音频的简单示例:

import torch
from vocos import Vocos

vocos = Vocos.from_pretrained("charactr/vocos-mel-24khz")

mel = torch.randn(1, 100, 256)  # B, C, T
audio = vocos.decode(mel)

Vocos还支持从EnCodec令牌重建音频,这使得它能够与最新的TTS管道无缝集成:

vocos = Vocos.from_pretrained("charactr/vocos-encodec-24khz")

audio_tokens = torch.randint(low=0, high=1024, size=(8, 200))  # 8 codebooks, 200 frames
features = vocos.codes_to_features(audio_tokens)
bandwidth_id = torch.tensor([2])  # 6 kbps

audio = vocos.decode(features, bandwidth_id=bandwidth_id)