
全面音频处理工具集成语音识别与智能交互
WhisperPlus是一个集成多项功能的开源音频处理工具库。它支持语音转文字、文本摘要和说话人分离等核心功能,并提供YouTube音频下载、多种模型选择以及基于RAG技术的视频内容智能对话能力。此外,WhisperPlus还包含文本转语音和自动字幕生成功能,为开发者提供全面的音频处理解决方案。该项目安装简便,接口灵活,适用于广泛的语音处理应用场景。
pip install whisperplus git+https://github.com/huggingface/transformers pip install flash-attn --no-build-isolation
你可以在HuggingFace模型中心找到这些模型
要使用whisperplus库,请按照以下步骤进行不同的任务:
from whisperplus import SpeechToTextPipeline, download_youtube_to_mp3 from transformers import BitsAndBytesConfig, HqqConfig import torch url = "https://www.youtube.com/watch?v=di3rHkEZuUw" audio_path = download_youtube_to_mp3(url, output_dir="downloads", filename="test") hqq_config = HqqConfig( nbits=4, group_size=64, quant_zero=False, quant_scale=False, axis=0, offload_meta=False, ) # 默认使用axis=0 bnb_config = BitsAndBytesConfig( load_in_4bit=True, bnb_4bit_quant_type="nf4", bnb_4bit_compute_dtype=torch.bfloat16, bnb_4bit_use_double_quant=True, ) pipeline = SpeechToTextPipeline( model_id="distil-whisper/distil-large-v3", quant_config=hqq_config, flash_attention_2=True, ) transcript = pipeline( audio_path=audio_path, chunk_length_s=30, stride_length_s=5, max_new_tokens=128, batch_size=100, language="english", return_timestamps=False, ) print(transcript)
from whisperplus.pipelines import mlx_whisper from whisperplus import download_youtube_to_mp3 url = "https://www.youtube.com/watch?v=1__CAdTJ5JU" audio_path = download_youtube_to_mp3(url) text = mlx_whisper.transcribe( audio_path, path_or_hf_repo="mlx-community/whisper-large-v3-mlx" )["text"] print(text)
from whisperplus.pipelines.lightning_whisper_mlx import LightningWhisperMLX from whisperplus import download_youtube_to_mp3 url = "https://www.youtube.com/watch?v=1__CAdTJ5JU" audio_path = download_youtube_to_mp3(url) whisper = LightningWhisperMLX(model="distil-large-v3", batch_size=12, quant=None) output = whisper.transcribe(audio_path=audio_path)["text"]
from whisperplus.pipelines.summarization import TextSummarizationPipeline summarizer = TextSummarizationPipeline(model_id="facebook/bart-large-cnn") summary = summarizer.summarize(transcript) print(summary[0]["summary_text"])
from whisperplus.pipelines.long_text_summarization import LongTextSummarizationPipeline summarizer = LongTextSummarizationPipeline(model_id="facebook/bart-large-cnn") summary_text = summarizer.summarize(transcript) print(summary_text)
你必须确认以下两个模型的许可权限。
pip install -r requirements/speaker_diarization.txt pip install -U "huggingface_hub[cli]" huggingface-cli login
from whisperplus.pipelines.whisper_diarize import ASRDiarizationPipeline from whisperplus import download_youtube_to_mp3, format_speech_to_dialogue audio_path = download_youtube_to_mp3("https://www.youtube.com/watch?v=mRB14sFHw2E") device = "cuda" # cpu 或 mps pipeline = ASRDiarizationPipeline.from_pretrained( asr_model="openai/whisper-large-v3", diarizer_model="pyannote/speaker-diarization-3.1", use_auth_token=False, chunk_length_s=30, device=device, ) output_text = pipeline(audio_path, num_speakers=2, min_speaker=1, max_speaker=2) dialogue = format_speech_to_dialogue(output_text) print(dialogue)
pip install sentence-transformers ctransformers langchain
from whisperplus.pipelines.chatbot import ChatWithVideo chat = ChatWithVideo( input_file="trascript.txt", llm_model_name="TheBloke/Mistral-7B-v0.1-GGUF", llm_model_file="mistral-7b-v0.1.Q4_K_M.gguf", llm_model_type="mistral", embedding_model_name="sentence-transformers/all-MiniLM-L6-v2", ) query = "这个视频讲的是什么?" response = chat.run_query(query) print(response)
pip install autollm>=0.1.9
from whisperplus.pipelines.autollm_chatbot import AutoLLMChatWithVideo # service_context_params system_prompt = """ 你是一个友好的AI助手,帮助用户根据你能访问的文档找到与他们问题最相关和准确的答案。 回答问题时,主要依赖文档中的信息。 """ query_wrapper_prompt = """ 以下是文档信息。 --------------------- {context_str} --------------------- 使用文档信息并主要依赖它来回答查询。 查询:{query_str} 回答: """ chat = AutoLLMChatWithVideo( input_file="input_dir", # mp3文件路径 openai_key="YOUR_OPENAI_KEY", # 可选 huggingface_key="YOUR_HUGGINGFACE_KEY", # 可选 llm_model="gpt-3.5-turbo", llm_max_tokens="256", llm_temperature="0.1", system_prompt=system_prompt, query_wrapper_prompt=query_wrapper_prompt, embed_model="huggingface/BAAI/bge-large-zh", # "text-embedding-ada-002" ) query = "这个视频讲的是什么?" response = chat.run_query(query) print(response)
from whisperplus.pipelines.text2speech import TextToSpeechPipeline tts = TextToSpeechPipeline(model_id="suno/bark") audio = tts(text="你好,世界", voice_preset="v2/en_speaker_6")
pip install moviepy apt install imagemagick libmagick++-dev cat /etc/ImageMagick-6/policy.xml | sed 's/none/read,write/g'> /etc/ImageMagick-6/policy.xml
from whisperplus.pipelines.whisper_autocaption import WhisperAutoCaptionPipeline from whisperplus import download_youtube_to_mp4 video_path = download_youtube_to_mp4( "https://www.youtube.com/watch?v=di3rHkEZuUw", output_dir="downloads", filename="test", ) # 可选 caption = WhisperAutoCaptionPipeline(model_id="openai/whisper-large-v3") caption(video_path=video_path, output_path="output.mp4", language="chinese")
pip install pre-commit pre-commit install pre-commit run --all-files
本项目根据Apache License 2.0的条款进行许可。
@misc{radford2022whisper, doi = {10.48550/ARXIV.2212.04356}, url = {https://arxiv.org/abs/2212.04356}, author = {Radford, Alec and Kim, Jong Wook and Xu, Tao and Brockman, Greg and McLeavey, Christine and Sutskever, Ilya}, title = {Robust Speech Recognition via Large-Scale Weak Supervision}, publisher = {arXiv}, year = {2022}, copyright = {arXiv.org perpetual, non-exclusive license} }


全球首个AI音乐社区
音述AI是全球首个AI音乐社区,致力让每个人都能用音乐表达自我。音述AI提供零门槛AI创作工具,独创GETI法则帮助用户精准定义音乐风格,AI润色功能支持自动优化作品质感。音述AI支持交流讨论、二次创作与价值变现。针对中文用户的语言习惯与文化背景进行专门优化,支持国风融合、C-pop等本土音乐标签,让技术更好地承载人文表达。


一站式搞定所有学习需求
不再被海量信息淹没,开始真正理解知识。Lynote 可摘要 YouTube 视频、PDF、文章等内容。即时创建笔记,检测 AI 内容并下载资料,将您的学习效率提升 10 倍。


为AI短剧协作而生
专为AI短剧协作而生的AniShort正式发布,深度重构AI短剧全流程生产模式,整合创意策划、制作执行、实时协作、在线审片、资产复用等全链路功能,独创无限画布、双轨并行工业化工作流与Ani智能体助手,集成多款主流AI大模型,破解素材零散、版本混乱、沟通低效等行业痛点,助力3人团队效率提升800%,打造标准化、可追溯的AI短剧量产体系,是AI短剧团队协同创作、提升制作效率的核心工具。


能听懂你表达的视频模型
Seedance two是基于seedance2.0的中国大模型,支持图像、视频、音频、文本四种模态输入,表达方式更丰富,生成也更可控。


国内直接访问,限时3折
输入简单文字,生成想要的图片,纳米香蕉中文站基于 Google 模型的 AI 图片生成网站,支持文字生图、图生图。官网价格限时3折活动


职场AI,就用扣子
AI办公助手,复杂任务高效处理。办公效率低?扣子空间AI助手支持播客生成、PPT制作、网页开发及报告写作,覆盖科研、商业、舆情等领域的专家Agent 7x24小时响应,生活工作无缝切换,提升50%效率!


多风格AI绘画神器
堆友平台由阿里巴巴设计团队创建,作为一款AI驱动的设计工具,专为设计师提供一站式增长服务。功能覆盖海量3D素材、AI绘画、实时渲染以及专业抠图,显著提升设计品质和效率。平台不仅提供工具,还是一个促进创意交流和个人发展的空间,界面友好,适合所有级别的设计师和创意工作者。


零代码AI应用开发平台
零代码AI应用开发平台,用户只需一句 话简单描述需求,AI能自动生成小程序、APP或H5网页应用,无需编写代码。


免费创建高清无水印Sora视频
Vora是一个免费创建高清无水印Sora视频的AI工具


最适合小白的AI自动化工作流平台
无需编码,轻松生成可复用、可变现的AI自动化工作流
最新AI工具、AI资讯
独家AI资源、AI项目落地

微信扫一扫关注公众号