
高效低比特率音频压缩的神经编解码器
SNAC是一种先进的多尺度神经音频编解码器,以0.98 kbps的超低比特率压缩24 kHz音频。它采用分层令牌方法,创新地降低了粗糙令牌的采样频率,扩大时间覆盖范围。该模型主要用于语音合成,但也提供适用于音乐和音效的高采样率版本。SNAC支持单声道音频处理,提供多个预训练模型以满足不同需求,是音频压缩和处理领域的重要工具。
SNAC(Multi-Scale Neural Audio Codec)是一个创新的音频压缩项目,旨在以低比特率将音频压缩为离散代码。该项目主要针对语音数据进行训练,推荐用于语音合成领域。
SNAC采用了类似于SoundStream、EnCodec和DAC的分层令牌编码方式来处理音频。然而,SNAC引入了一个简单而巧妙的改变:粗糙的令牌以较低的频率采样,从而覆盖更广泛的时间跨度。这种方法使得SNAC能够在保持音频质量的同时实现更高效的压缩。
SNAC项目提供了多个预训练模型,以适应不同的应用场景:
所有模型目前仅支持单声道音频处理。
SNAC的使用非常简单,用户可以通过pip安装该库:
pip install snac
然后,可以使用Python代码轻松地进行音频编码和解码:
import torch from snac import SNAC model = SNAC.from_pretrained("hubertsiuzdak/snac_24khz").eval().cuda() audio = torch.randn(1, 1, 24000).cuda() # B, 1, T with torch.inference_mode(): codes = model.encode(audio) audio_hat = model.decode(codes)
通过这些特性,SNAC项目为音频压缩和处理领域带来了新的可能性,有望在语音合成、音频传输等多个领域发挥重要作用。


AI一键生成PPT,就用博思AIPPT!
博思AIPPT,新一代的AI生成PPT平台,支持智能生成PPT、AI美化PPT、文本&链接生成PPT、导入Word/PDF/Markdown文档生成PPT等,内置海量精美PPT模板,涵盖商务、教育、科技等不同风格,同时针对每个页面提供多种版式,一键自适应切换,完美适配各种办公场景。


AI赋能电商视觉革命,一站式智能商拍平台
潮际好麦深耕服装行业,是国内AI试衣效果最好的软件。使用先进AIGC能力为电商卖家批量提供优质的、低成本的商拍图。合作品牌有Shein、Lazada、安踏、百丽等65个国内外头部品牌,以及国内10万+淘宝、天猫、京东等主流平台的品牌商家,为卖家节省将近85%的出图成本,提升约3倍出图效率,让品牌能够快速上架。


企业专属的AI法律顾问
iTerms是法大大集团旗下法律子品牌,基于最先进的大语言模型(LLM)、专业的法律知识库和强大的智能体架构,帮助企业扫清合规障碍,筑牢风控防线,成为您企业专属的AI法律顾问。

