video_features

video_features

多模态视频特征提取框架 支持多种深度学习模型

video_features是一个开源的视频特征提取框架,支持视觉、音频和光流等多种模态。该框架集成了S3D、R(2+1)d、I3D-Net等动作识别模型,VGGish声音识别模型,以及RAFT光流提取模型。它支持多GPU和多节点并行处理,可通过命令行或Colab快速使用。输出格式灵活,适用于视频分析相关的研究和应用。

视频特征提取深度学习模型多模态分析GitHub项目计算机视觉Github开源项目
<div align="center">

视频特征

<img src="https://yellow-cdn.veclightyear.com/835a84d5/0220648c-4a82-42f4-839f-3ff6977fdf5e.gif" width="300" />

video_features 允许您从视频片段中提取特征。 它支持各种提取器和模态, 即视觉外观、光流和音频。 更多详情请参阅文档

</div>

支持的模型

动作识别

声音识别

光流

逐帧特征

快速开始

在 Colab 中打开

或在本地使用 conda 运行:

# 克隆仓库并更改工作目录 git clone https://github.com/v-iashin/video_features.git cd video_features # 安装环境 conda env create -f conda_env.yml # 加载环境 conda activate video_features # 为示例视频提取 r(2+1)d 特征 python main.py \ feature_type=r21d \ device="cuda:0" \ video_paths="[./sample/v_ZNVhz7ctTq0.mp4, ./sample/v_GGSY1Qvo990.mp4]" # 如果您有多个 GPU,只需从另一个终端使用另一个设备运行此命令 # device 也可以是 "cpu"

如果您更喜欢使用 Docker,我们提供了一个预安装环境的 Docker 镜像,支持所有模型。 查看 Docker 支持 文档页面。

多 GPU 和多节点设置

使用 video_features,可以轻松地在多个 GPU 之间并行提取特征。 只需在另一个终端中使用另一个 GPU(甚至是同一个)启动脚本, 指向相同的输出文件夹和输入视频路径即可。 脚本将检查特征是否已存在并跳过它们。 它还会尝试加载特征文件以检查是否损坏(即无法打开)。 这种方法允许您在上一个脚本因某种原因失败时继续提取特征。

如果您可以访问具有共享磁盘空间的 GPU 集群,您可以通过创建多个单 GPU 作业来扩展提取,使用相同的命令。

由于每次运行脚本时输入文件列表都会被打乱,因此您无需担心工作进程会处理相同的视频。 在罕见的冲突情况下,脚本将重写先前提取的特征。

输入

输入是视频文件的路径。 路径可以作为视频路径列表传递,也可以作为每行一个路径的文本文件传递。

输出

输出由 on_extraction 参数定义;默认情况下,它将特征打印到命令行。 可能的输出值为 ['print', 'save_numpy', 'save_pickle']save_* 选项将特征保存在 output_path 文件夹中,文件名与输入视频文件相同,但扩展名为 .npy.pkl

使用于

如果您发现这个仓库对您的项目或论文有用,请告诉我。

致谢

  • @Kamino666:添加了 CLIP 模型以及 Windows 和 CPU 支持(还有许多其他有用的功能)。
  • @ohjho:添加了对 37 层 R(2+1)d 的支持。
  • @borijang:解决了文件名的错误,改进了 I3D 检查点加载,并改进了代码风格。
  • @bjuncek:帮助处理 timm 模型并进行离线讨论。

引用

如果您发现这个项目对您的研究有用,请考虑引用:

@misc{videofeatures2020, title = {Video Features}, author = {Vladimir Iashin and other contributors}, year = {2020}, howpublished = {\url{https://github.com/v-iashin/video_features}}, }

编辑推荐精选

堆友

堆友

多风格AI绘画神器

堆友平台由阿里巴巴设计团队创建,作为一款AI驱动的设计工具,专为设计师提供一站式增长服务。功能覆盖海量3D素材、AI绘画、实时渲染以及专业抠图,显著提升设计品质和效率。平台不仅提供工具,还是一个促进创意交流和个人发展的空间,界面友好,适合所有级别的设计师和创意工作者。

图像生成AI工具AI反应堆AI工具箱AI绘画GOAI艺术字堆友相机AI图像热门
码上飞

码上飞

零代码AI应用开发平台

零代码AI应用开发平台,用户只需一句话简单描述需求,AI能自动生成小程序、APP或H5网页应用,无需编写代码。

Vora

Vora

免费创建高清无水印Sora视频

Vora是一个免费创建高清无水印Sora视频的AI工具

Refly.AI

Refly.AI

最适合小白的AI自动化工作流平台

无需编码,轻松生成可复用、可变现的AI自动化工作流

酷表ChatExcel

酷表ChatExcel

大模型驱动的Excel数据处理工具

基于大模型交互的表格处理系统,允许用户通过对话方式完成数据整理和可视化分析。系统采用机器学习算法解析用户指令,自动执行排序、公式计算和数据透视等操作,支持多种文件格式导入导出。数据处理响应速度保持在0.8秒以内,支持超过100万行数据的即时分析。

AI工具酷表ChatExcelAI智能客服AI营销产品使用教程
TRAE编程

TRAE编程

AI辅助编程,代码自动修复

Trae是一种自适应的集成开发环境(IDE),通过自动化和多元协作改变开发流程。利用Trae,团队能够更快速、精确地编写和部署代码,从而提高编程效率和项目交付速度。Trae具备上下文感知和代码自动完成功能,是提升开发效率的理想工具。

AI工具TraeAI IDE协作生产力转型热门
AIWritePaper论文写作

AIWritePaper论文写作

AI论文写作指导平台

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

AI辅助写作AI工具AI论文工具论文写作智能生成大纲数据安全AI助手热门
博思AIPPT

博思AIPPT

AI一键生成PPT,就用博思AIPPT!

博思AIPPT,新一代的AI生成PPT平台,支持智能生成PPT、AI美化PPT、文本&链接生成PPT、导入Word/PDF/Markdown文档生成PPT等,内置海量精美PPT模板,涵盖商务、教育、科技等不同风格,同时针对每个页面提供多种版式,一键自适应切换,完美适配各种办公场景。

AI办公办公工具AI工具博思AIPPTAI生成PPT智能排版海量精品模板AI创作热门
潮际好麦

潮际好麦

AI赋能电商视觉革命,一站式智能商拍平台

潮际好麦深耕服装行业,是国内AI试衣效果最好的软件。使用先进AIGC能力为电商卖家批量提供优质的、低成本的商拍图。合作品牌有Shein、Lazada、安踏、百丽等65个国内外头部品牌,以及国内10万+淘宝、天猫、京东等主流平台的品牌商家,为卖家节省将近85%的出图成本,提升约3倍出图效率,让品牌能够快速上架。

iTerms

iTerms

企业专属的AI法律顾问

iTerms是法大大集团旗下法律子品牌,基于最先进的大语言模型(LLM)、专业的法律知识库和强大的智能体架构,帮助企业扫清合规障碍,筑牢风控防线,成为您企业专属的AI法律顾问。

下拉加载更多