all-seeing

all-seeing

全景视觉识别与关系理解的开放世界AI系统

All-Seeing项目开发了全面的视觉识别和理解系统。该项目推出AS-1B大规模数据集和ASM视觉语言模型,实现开放世界的全景视觉识别。其第二版引入关系对话任务,构建AS-V2数据集和ASMv2模型,增强关系理解能力。此外,项目提出CRPE基准测试,为评估关系理解提供系统平台。

All-Seeing Project视觉识别关系理解大规模数据集多模态模型Github开源项目

全视计划 <img width="60" alt="image" src="https://github.com/OpenGVLab/all-seeing/assets/8529570/54c8d328-aa67-4d28-99de-90d019e8e7d0">

这是以下论文的官方实现:

"全视"一词源自"全知之眼",意味着对存在的所有方面有完整的知识、意识或洞察力。标志是千年积木,来自漫画《游戏王》中的神器。

新闻与更新 🚀🚀🚀

  • 2024年7月1日:全视计划 v2 被 ECCV 2024 接收!请注意,模型数据已在 huggingface 上发布。
  • 2024年2月28日:全视计划 v2 发布!我们的 ASMv2 在多种图像级和区域级任务中达到了最先进的性能!更多详情请参见这里
  • 2024年2月21日ASMAS-CoreAS-10MAS-100M 已发布!
  • 2024年1月16日:全视计划被 ICLR 2024 接收!
  • 2023年8月29日全视模型演示现已在 OpenXLab 上可用!

计划

  • 发布 ASMv2 模型。
  • 发布 AS-V2 数据集。
  • 发布 ASM 模型。
  • 发布 AS-1B 的完整版本。
  • 发布 AS-Core,这是 AS-1B 的人工验证子集。
  • 发布 AS-100M,这是 AS-1B 的 1 亿子集。
  • 发布 AS-10M,这是 AS-1B 的 1000 万子集。
  • 在线演示,包括数据集浏览器和 ASM 在线演示。

简介

全视计划 [论文][模型][数据集][代码][知乎][Medium]

全视 1B (AS-1B) 数据集:我们提出了一个新的大规模数据集(AS-1B),用于开放世界全景视觉识别和理解,使用了一种经济的半自动数据引擎,结合了现成视觉/语言模型的力量和人工反馈。

全视模型 (ASM):我们开发了一个统一的视觉-语言基础模型(ASM),用于开放世界全景视觉识别和理解。与大语言模型对齐,我们的 ASM 支持多样化的图像-文本检索和生成任务,展示了令人印象深刻的零样本能力。

全视计划 V2 [论文][模型][数据集][代码][知乎][Medium]

全视数据集 V2 (AS-V2) 数据集:我们提出了一个新的任务,称为关系对话(ReC),它统一了文本生成、对象定位和关系理解的形式。基于这种统一的形式,我们构建了 AS-V2 数据集,其中包含 12.7 万个高质量的关系对话样本,以解锁多模态大语言模型(MLLMs)的 ReC 能力。

全视模型 v2 (ASMv2):我们开发了 ASMv2,它整合了关系对话能力,同时保持强大的通用能力。它具备定位和指代能力,在区域级任务上表现出最先进的性能。此外,该模型可以自然地以开放式方式适应场景图生成任务。

基于循环的关系探测评估 (CRPE) 基准:我们构建了一个名为基于循环的关系探测评估(CRPE)的基准,这是第一个涵盖关系三元组 (主体, 谓词, 客体) 所有元素的基准,为关系理解能力的评估提供了一个系统的平台。

许可证

本项目基于 Apache 2.0 许可证 发布。

🖊️ 引用

如果您在研究中发现本项目有用,请考虑引用:

@article{wang2023allseeing, title={The All-Seeing Project: Towards Panoptic Visual Recognition and Understanding of the Open World}, author={Wang, Weiyun and Shi, Min and Li, Qingyun and Wang, Wenhai and Huang, Zhenhang and Xing, Linjie and Chen, Zhe and Li, Hao and Zhu, Xizhou and Cao, Zhiguo and others}, journal={arXiv preprint arXiv:2308.01907}, year={2023} } @article{wang2024allseeing_v2, title={The All-Seeing Project V2: Towards General Relation Comprehension of the Open World}, author={Wang, Weiyun and Ren, Yiming and Luo, Haowen and Li, Tiantong and Yan, Chenxiang and Chen, Zhe and Wang, Wenhai and Li, Qingyun and Lu, Lewei and Zhu, Xizhou and others}, journal={arXiv preprint arXiv:2402.19474}, year={2024} }

编辑推荐精选

讯飞绘文

讯飞绘文

选题、配图、成文,一站式创作,让内容运营更高效

讯飞绘文,一个AI集成平台,支持写作、选题、配图、排版和发布。高效生成适用于各类媒体的定制内容,加速品牌传播,提升内容营销效果。

热门AI辅助写作AI工具讯飞绘文内容运营AI创作个性化文章多平台分发AI助手
TRAE编程

TRAE编程

AI辅助编程,代码自动修复

Trae是一种自适应的集成开发环境(IDE),通过自动化和多元协作改变开发流程。利用Trae,团队能够更快速、精确地编写和部署代码,从而提高编程效率和项目交付速度。Trae具备上下文感知和代码自动完成功能,是提升开发效率的理想工具。

AI工具TraeAI IDE协作生产力转型热门
商汤小浣熊

商汤小浣熊

最强AI数据分析助手

小浣熊家族Raccoon,您的AI智能助手,致力于通过先进的人工智能技术,为用户提供高效、便捷的智能服务。无论是日常咨询还是专业问题解答,小浣熊都能以快速、准确的响应满足您的需求,让您的生活更加智能便捷。

imini AI

imini AI

像人一样思考的AI智能体

imini 是一款超级AI智能体,能根据人类指令,自主思考、自主完成、并且交付结果的AI智能体。

Keevx

Keevx

AI数字人视频创作平台

Keevx 一款开箱即用的AI数字人视频创作平台,广泛适用于电商广告、企业培训与社媒宣传,让全球企业与个人创作者无需拍摄剪辑,就能快速生成多语言、高质量的专业视频。

即梦AI

即梦AI

一站式AI创作平台

提供 AI 驱动的图片、视频生成及数字人等功能,助力创意创作

扣子-AI办公

扣子-AI办公

AI办公助手,复杂任务高效处理

AI办公助手,复杂任务高效处理。办公效率低?扣子空间AI助手支持播客生成、PPT制作、网页开发及报告写作,覆盖科研、商业、舆情等领域的专家Agent 7x24小时响应,生活工作无缝切换,提升50%效率!

蛙蛙写作

蛙蛙写作

AI小说写作助手,一站式润色、改写、扩写

蛙蛙写作—国内先进的AI写作平台,涵盖小说、学术、社交媒体等多场景。提供续写、改写、润色等功能,助力创作者高效优化写作流程。界面简洁,功能全面,适合各类写作者提升内容品质和工作效率。

AI辅助写作AI工具蛙蛙写作AI写作工具学术助手办公助手营销助手AI助手
问小白

问小白

全能AI智能助手,随时解答生活与工作的多样问题

问小白,由元石科技研发的AI智能助手,快速准确地解答各种生活和工作问题,包括但不限于搜索、规划和社交互动,帮助用户在日常生活中提高效率,轻松管理个人事务。

热门AI助手AI对话AI工具聊天机器人
Transly

Transly

实时语音翻译/同声传译工具

Transly是一个多场景的AI大语言模型驱动的同声传译、专业翻译助手,它拥有超精准的音频识别翻译能力,几乎零延迟的使用体验和支持多国语言可以让你带它走遍全球,无论你是留学生、商务人士、韩剧美剧爱好者,还是出国游玩、多国会议、跨国追星等等,都可以满足你所有需要同传的场景需求,线上线下通用,扫除语言障碍,让全世界的语言交流不再有国界。

下拉加载更多