
全面音频处理工具集成语音识别与智能交互
WhisperPlus是一个集成多项功能的开源音频处理工具库。它支持语音转文字、文本摘要和说话人分离等核心功能,并提供YouTube音频下载、多种模型选择以及基于RAG技术的视频内容智能对话能力。此外,WhisperPlus还包含文本转语音和自动字幕生成功能,为开发者提供全面的音频处理解决方案。该项目安装简便,接口灵活,适用于广泛的语音处理应用场景。
pip install whisperplus git+https://github.com/huggingface/transformers pip install flash-attn --no-build-isolation
你可以在HuggingFace模型中心找到这些模型
要使用whisperplus库,请按照以下步骤进行不同的任务:
from whisperplus import SpeechToTextPipeline, download_youtube_to_mp3 from transformers import BitsAndBytesConfig, HqqConfig import torch url = "https://www.youtube.com/watch?v=di3rHkEZuUw" audio_path = download_youtube_to_mp3(url, output_dir="downloads", filename="test") hqq_config = HqqConfig( nbits=4, group_size=64, quant_zero=False, quant_scale=False, axis=0, offload_meta=False, ) # 默认使用axis=0 bnb_config = BitsAndBytesConfig( load_in_4bit=True, bnb_4bit_quant_type="nf4", bnb_4bit_compute_dtype=torch.bfloat16, bnb_4bit_use_double_quant=True, ) pipeline = SpeechToTextPipeline( model_id="distil-whisper/distil-large-v3", quant_config=hqq_config, flash_attention_2=True, ) transcript = pipeline( audio_path=audio_path, chunk_length_s=30, stride_length_s=5, max_new_tokens=128, batch_size=100, language="english", return_timestamps=False, ) print(transcript)
from whisperplus.pipelines import mlx_whisper from whisperplus import download_youtube_to_mp3 url = "https://www.youtube.com/watch?v=1__CAdTJ5JU" audio_path = download_youtube_to_mp3(url) text = mlx_whisper.transcribe( audio_path, path_or_hf_repo="mlx-community/whisper-large-v3-mlx" )["text"] print(text)
from whisperplus.pipelines.lightning_whisper_mlx import LightningWhisperMLX from whisperplus import download_youtube_to_mp3 url = "https://www.youtube.com/watch?v=1__CAdTJ5JU" audio_path = download_youtube_to_mp3(url) whisper = LightningWhisperMLX(model="distil-large-v3", batch_size=12, quant=None) output = whisper.transcribe(audio_path=audio_path)["text"]
from whisperplus.pipelines.summarization import TextSummarizationPipeline summarizer = TextSummarizationPipeline(model_id="facebook/bart-large-cnn") summary = summarizer.summarize(transcript) print(summary[0]["summary_text"])
from whisperplus.pipelines.long_text_summarization import LongTextSummarizationPipeline summarizer = LongTextSummarizationPipeline(model_id="facebook/bart-large-cnn") summary_text = summarizer.summarize(transcript) print(summary_text)
你必须确认以下两个模型的许可权限。
pip install -r requirements/speaker_diarization.txt pip install -U "huggingface_hub[cli]" huggingface-cli login
from whisperplus.pipelines.whisper_diarize import ASRDiarizationPipeline from whisperplus import download_youtube_to_mp3, format_speech_to_dialogue audio_path = download_youtube_to_mp3("https://www.youtube.com/watch?v=mRB14sFHw2E") device = "cuda" # cpu 或 mps pipeline = ASRDiarizationPipeline.from_pretrained( asr_model="openai/whisper-large-v3", diarizer_model="pyannote/speaker-diarization-3.1", use_auth_token=False, chunk_length_s=30, device=device, ) output_text = pipeline(audio_path, num_speakers=2, min_speaker=1, max_speaker=2) dialogue = format_speech_to_dialogue(output_text) print(dialogue)
pip install sentence-transformers ctransformers langchain
from whisperplus.pipelines.chatbot import ChatWithVideo chat = ChatWithVideo( input_file="trascript.txt", llm_model_name="TheBloke/Mistral-7B-v0.1-GGUF", llm_model_file="mistral-7b-v0.1.Q4_K_M.gguf", llm_model_type="mistral", embedding_model_name="sentence-transformers/all-MiniLM-L6-v2", ) query = "这个视频讲的是什么?" response = chat.run_query(query) print(response)
pip install autollm>=0.1.9
from whisperplus.pipelines.autollm_chatbot import AutoLLMChatWithVideo # service_context_params system_prompt = """ 你是一个友好的AI助手,帮助用户根据你能访问的文档找到与他们问题最相关和准确的答案。 回答问题时,主要依赖文档中的信息。 """ query_wrapper_prompt = """ 以下是文档信息。 --------------------- {context_str} --------------------- 使用文档信息并主要依赖它来回答查询。 查询:{query_str} 回答: """ chat = AutoLLMChatWithVideo( input_file="input_dir", # mp3文件路径 openai_key="YOUR_OPENAI_KEY", # 可选 huggingface_key="YOUR_HUGGINGFACE_KEY", # 可选 llm_model="gpt-3.5-turbo", llm_max_tokens="256", llm_temperature="0.1", system_prompt=system_prompt, query_wrapper_prompt=query_wrapper_prompt, embed_model="huggingface/BAAI/bge-large-zh", # "text-embedding-ada-002" ) query = "这个视频讲的是什么?" response = chat.run_query(query) print(response)
from whisperplus.pipelines.text2speech import TextToSpeechPipeline tts = TextToSpeechPipeline(model_id="suno/bark") audio = tts(text="你好,世界", voice_preset="v2/en_speaker_6")
pip install moviepy apt install imagemagick libmagick++-dev cat /etc/ImageMagick-6/policy.xml | sed 's/none/read,write/g'> /etc/ImageMagick-6/policy.xml
from whisperplus.pipelines.whisper_autocaption import WhisperAutoCaptionPipeline from whisperplus import download_youtube_to_mp4 video_path = download_youtube_to_mp4( "https://www.youtube.com/watch?v=di3rHkEZuUw", output_dir="downloads", filename="test", ) # 可选 caption = WhisperAutoCaptionPipeline(model_id="openai/whisper-large-v3") caption(video_path=video_path, output_path="output.mp4", language="chinese")
pip install pre-commit pre-commit install pre-commit run --all-files
本项目根据Apache License 2.0的条款进行许可。
@misc{radford2022whisper, doi = {10.48550/ARXIV.2212.04356}, url = {https://arxiv.org/abs/2212.04356}, author = {Radford, Alec and Kim, Jong Wook and Xu, Tao and Brockman, Greg and McLeavey, Christine and Sutskever, Ilya}, title = {Robust Speech Recognition via Large-Scale Weak Supervision}, publisher = {arXiv}, year = {2022}, copyright = {arXiv.org perpetual, non-exclusive license} }


AI一键生成PPT,就用博思AIPPT!
博思AIPPT,新一代的AI生成PPT平台,支持智能生成PPT、AI美化PPT、文本&链接生成PPT、导入Word/PDF/Markdown文档生成PPT等,内置海量精美PPT模板,涵盖商务、教育、科技等不同风格,同时针对每个页面提供多种版式,一键自适应切换,完美适配各种办公场景。


AI赋能电商视觉革命,一站式智能商拍平台
潮际好麦深耕服装行业,是国内AI试衣效果最好的软件。使用先进AIGC能力为电商卖家批量提供优质的、低成本的商拍图。合作品牌有Shein、Lazada、安踏、百丽等65个国内外头部品牌,以及国内10万+淘宝、天猫、京东等主流平台的品牌商家,为卖家节省将近85%的出图成本,提升约3倍出图效率,让品牌能够快速上架。


企业专属的AI法律顾问
iTerms是法大大集团旗下法律子品牌,基于最先进的大语言模型(LLM)、专业的法律知识库和强大的智能体架构,帮助企业扫清合规障碍,筑牢风控防线,成为您企业专属的AI法律顾问。


稳定高效的流量提升解决方案,助力品牌曝光
稳定高效的流量提升解决方案,助力品牌曝光


最新版Sora2模型免费使用,一键生成无水印视频
最新版Sora2模型免费使用,一键生成无水印视频


实时语音翻译/同声传译工具
Transly是一个多场景的AI大语言模型驱动的同声传译、专业翻译助手,它拥有超精准的音频识别翻译能力,几乎零延迟的使用体验和支持多国语言可以让你带它走遍全球,无论你是留学生、商务人士、韩剧美剧爱好者,还是出国游玩、多国会议、跨国追星等等,都可以满足你所有需要同传的场景需求,线上线下通用,扫除语言障碍,让全世界的语言交流不再有国界。


选题、配图、成文,一站式创作,让内容运营更高效
讯飞绘文,一个AI集成平台,支持写作、选题、配图、排版和发布。高效生成适用于各类媒体的定制内容,加速品牌传播,提升内容营销效果。


AI辅助编程,代码自动修复
Trae是一种自适应的集成开发环境(IDE),通过自动化和多元协作改变开发流程。利用Trae,团队能够更快速、精确地编写和部署代码,从而提高编程效率和项目交付速度。Trae具备上下文感知和代码自动完成功能,是提升开发效率的理想工具。


最强AI数据分析助手
小浣熊家族Raccoon,您的AI智能助手,致力于通过先进的人工智能技术,为用户提供高效、便捷的智能服务。无论是日常咨询还是专业问题解答,小浣熊都能以快速、准确的响应满足您的需求,让您的生活更加智能便捷。


像人一样思考的AI智能体
imini 是一款超级AI智能体,能根据人类指令,自主思考、自主完成、并且交付结果的AI智能体。
最新AI工具、AI资讯
独家AI资源、AI项目落地

微信扫一扫关注公众号