多功能扩散模型引擎 支持长视频合成与图像生成
DiffSynth Studio是一款开源的扩散模型引擎,整合了ExVideo、Stable Diffusion 3和Kolors等多种AI模型。该引擎支持长视频合成、高分辨率图像生成、卡通渲染和视频风格化等功能。项目持续更新,重点探索扩散模型在视频合成领域的应用潜力。
DiffSynth Studio是一个扩散引擎。我们重构了包括文本编码器、UNet、VAE等在内的架构,保持与开源社区模型的兼容性,同时提高了计算性能。我们提供了许多有趣的功能。尽情享受扩散模型的魔力吧!
目前,DiffSynth Studio已支持以下模型:
2024年6月21日 🔥🔥🔥 我们提出了ExVideo,这是一种旨在增强视频生成模型能力的后期微调技术。我们已将Stable Video Diffusion扩展至能够生成长达128帧的视频。
examples/ExVideo
。2024年6月13日 DiffSynth Studio已转移至ModelScope。开发者已从"我"转变为"我们"。当然,我仍将参与开发和维护。
2024年1月29日 我们提出了Diffutoon,这是一个卡通着色的绝佳解决方案。