video_features

video_features

多模态视频特征提取框架 支持多种深度学习模型

video_features是一个开源的视频特征提取框架,支持视觉、音频和光流等多种模态。该框架集成了S3D、R(2+1)d、I3D-Net等动作识别模型,VGGish声音识别模型,以及RAFT光流提取模型。它支持多GPU和多节点并行处理,可通过命令行或Colab快速使用。输出格式灵活,适用于视频分析相关的研究和应用。

视频特征提取深度学习模型多模态分析GitHub项目计算机视觉Github开源项目
<div align="center">

视频特征

<img src="https://yellow-cdn.veclightyear.com/835a84d5/0220648c-4a82-42f4-839f-3ff6977fdf5e.gif" width="300" />

video_features 允许您从视频片段中提取特征。 它支持各种提取器和模态, 即视觉外观、光流和音频。 更多详情请参阅文档

</div>

支持的模型

动作识别

声音识别

光流

逐帧特征

快速开始

在 Colab 中打开

或在本地使用 conda 运行:

# 克隆仓库并更改工作目录 git clone https://github.com/v-iashin/video_features.git cd video_features # 安装环境 conda env create -f conda_env.yml # 加载环境 conda activate video_features # 为示例视频提取 r(2+1)d 特征 python main.py \ feature_type=r21d \ device="cuda:0" \ video_paths="[./sample/v_ZNVhz7ctTq0.mp4, ./sample/v_GGSY1Qvo990.mp4]" # 如果您有多个 GPU,只需从另一个终端使用另一个设备运行此命令 # device 也可以是 "cpu"

如果您更喜欢使用 Docker,我们提供了一个预安装环境的 Docker 镜像,支持所有模型。 查看 Docker 支持 文档页面。

多 GPU 和多节点设置

使用 video_features,可以轻松地在多个 GPU 之间并行提取特征。 只需在另一个终端中使用另一个 GPU(甚至是同一个)启动脚本, 指向相同的输出文件夹和输入视频路径即可。 脚本将检查特征是否已存在并跳过它们。 它还会尝试加载特征文件以检查是否损坏(即无法打开)。 这种方法允许您在上一个脚本因某种原因失败时继续提取特征。

如果您可以访问具有共享磁盘空间的 GPU 集群,您可以通过创建多个单 GPU 作业来扩展提取,使用相同的命令。

由于每次运行脚本时输入文件列表都会被打乱,因此您无需担心工作进程会处理相同的视频。 在罕见的冲突情况下,脚本将重写先前提取的特征。

输入

输入是视频文件的路径。 路径可以作为视频路径列表传递,也可以作为每行一个路径的文本文件传递。

输出

输出由 on_extraction 参数定义;默认情况下,它将特征打印到命令行。 可能的输出值为 ['print', 'save_numpy', 'save_pickle']save_* 选项将特征保存在 output_path 文件夹中,文件名与输入视频文件相同,但扩展名为 .npy.pkl

使用于

如果您发现这个仓库对您的项目或论文有用,请告诉我。

致谢

  • @Kamino666:添加了 CLIP 模型以及 Windows 和 CPU 支持(还有许多其他有用的功能)。
  • @ohjho:添加了对 37 层 R(2+1)d 的支持。
  • @borijang:解决了文件名的错误,改进了 I3D 检查点加载,并改进了代码风格。
  • @bjuncek:帮助处理 timm 模型并进行离线讨论。

引用

如果您发现这个项目对您的研究有用,请考虑引用:

@misc{videofeatures2020, title = {Video Features}, author = {Vladimir Iashin and other contributors}, year = {2020}, howpublished = {\url{https://github.com/v-iashin/video_features}}, }

编辑推荐精选

TRAE编程

TRAE编程

AI辅助编程,代码自动修复

Trae是一种自适应的集成开发环境(IDE),通过自动化和多元协作改变开发流程。利用Trae,团队能够更快速、精确地编写和部署代码,从而提高编程效率和项目交付速度。Trae具备上下文感知和代码自动完成功能,是提升开发效率的理想工具。

AI工具TraeAI IDE协作生产力转型热门
博思AIPPT

博思AIPPT

AI一键生成PPT,就用博思AIPPT!

博思AIPPT,新一代的AI生成PPT平台,支持智能生成PPT、AI美化PPT、文本&链接生成PPT、导入Word/PDF/Markdown文档生成PPT等,内置海量精美PPT模板,涵盖商务、教育、科技等不同风格,同时针对每个页面提供多种版式,一键自适应切换,完美适配各种办公场景。

AI办公办公工具AI工具博思AIPPTAI生成PPT智能排版海量精品模板AI创作热门
潮际好麦

潮际好麦

AI赋能电商视觉革命,一站式智能商拍平台

潮际好麦深耕服装行业,是国内AI试衣效果最好的软件。使用先进AIGC能力为电商卖家批量提供优质的、低成本的商拍图。合作品牌有Shein、Lazada、安踏、百丽等65个国内外头部品牌,以及国内10万+淘宝、天猫、京东等主流平台的品牌商家,为卖家节省将近85%的出图成本,提升约3倍出图效率,让品牌能够快速上架。

iTerms

iTerms

企业专属的AI法律顾问

iTerms是法大大集团旗下法律子品牌,基于最先进的大语言模型(LLM)、专业的法律知识库和强大的智能体架构,帮助企业扫清合规障碍,筑牢风控防线,成为您企业专属的AI法律顾问。

SimilarWeb流量提升

SimilarWeb流量提升

稳定高效的流量提升解决方案,助力品牌曝光

稳定高效的流量提升解决方案,助力品牌曝光

Sora2视频免费生成

Sora2视频免费生成

最新版Sora2模型免费使用,一键生成无水印视频

最新版Sora2模型免费使用,一键生成无水印视频

Transly

Transly

实时语音翻译/同声传译工具

Transly是一个多场景的AI大语言模型驱动的同声传译、专业翻译助手,它拥有超精准的音频识别翻译能力,几乎零延迟的使用体验和支持多国语言可以让你带它走遍全球,无论你是留学生、商务人士、韩剧美剧爱好者,还是出国游玩、多国会议、跨国追星等等,都可以满足你所有需要同传的场景需求,线上线下通用,扫除语言障碍,让全世界的语言交流不再有国界。

讯飞绘文

讯飞绘文

选题、配图、成文,一站式创作,让内容运营更高效

讯飞绘文,一个AI集成平台,支持写作、选题、配图、排版和发布。高效生成适用于各类媒体的定制内容,加速品牌传播,提升内容营销效果。

热门AI辅助写作AI工具讯飞绘文内容运营AI创作个性化文章多平台分发AI助手
商汤小浣熊

商汤小浣熊

最强AI数据分析助手

小浣熊家族Raccoon,您的AI智能助手,致力于通过先进的人工智能技术,为用户提供高效、便捷的智能服务。无论是日常咨询还是专业问题解答,小浣熊都能以快速、准确的响应满足您的需求,让您的生活更加智能便捷。

imini AI

imini AI

像人一样思考的AI智能体

imini 是一款超级AI智能体,能根据人类指令,自主思考、自主完成、并且交付结果的AI智能体。

下拉加载更多