gta

gta

几何感知注意力机制增强多视图Transformer性能

GTA是一种创新的几何感知注意力机制,旨在提升多视图Transformer的表达能力。这项技术不仅适用于新视角合成和3D场景重建等多视图任务,还可应用于图像生成等2D任务。项目提供了GTA在CLEVR-TR和MSN-Hard数据集上的官方实现代码,并展示了其在ImageNet图像生成中的应用。通过整合几何信息,GTA使Transformer更有效地处理3D空间关系,从而显著提高多视图任务的性能表现。

GTA多视图Transformer几何感知注意力神经渲染计算机视觉Github开源项目
<p align="center"> <h1 align="center">几何变换注意力机制</h1> <p align="center"> <a href="https://takerum.github.io/">Takeru Miyato</a> · <a href="https://kait0.github.io/">Bernhard Jaeger</a> · <a href="https://staff.fnwi.uva.nl/m.welling/">Max Welling</a> · <a href="https://www.cvlibs.net/">Andreas Geiger</a> </p> <h3 align="center"><a href="https://openreview.net/forum?id=uJVHygNeSZ">OpenReview</a> | <a href="https://arxiv.org/abs/2310.10375">arXiv</a> | <a href="https://takerum.github.io/gta/">项目主页</a> </h3> <p align="center"> <img width="180" alt="gta_mech" src="https://github.com/autonomousvision/gta/assets/11573649/939bc44b-3fde-48b8-96ce-4f68c6c55ccd"> </p> </p>

我们ICLR2024工作的官方复现代码:"GTA: 多视角Transformer的几何感知注意力机制",一种简单的方法来让您的多视角Transformer更具表现力!

(2024年3月15日):GTA机制对于图像生成这一纯2D任务也很有效。您可以在我们的准备就绪论文中找到实验细节,并在此分支中找到实现。

内容

本仓库包含以下不同的代码库,可以通过切换到相应的分支来访问:

  • CLEVR-TR和MSN-Hard上的新视角合成实验(本分支)
  • ACID和RealEstate上的新视角合成实验(链接
  • 使用扩散Transformer (DiT) 进行ImageNet生成(链接

您可以在这里找到多视角ViT的GTA代码,在这里找到图像ViT的GTA代码。

如果您有任何问题,请随时与我们联系!

设置

1. 创建环境并安装Python库

conda create -n gta python=3.9
conda activate gta
pip3 install -r requirements.txt

2. 下载数据集

export DATADIR=<path_to_datadir>
mkdir -p $DATADIR

CLEVR-TR

从此链接下载数据集并将其放在$DATADIR

<p align="center"> <img width="400" alt="clevr1" src="https://github.com/autonomousvision/gta/assets/11573649/0952c2f7-47e4-41c1-93a4-bad57a8df12e"> <img width="400" alt="clevr2" src="https://github.com/autonomousvision/gta/assets/11573649/1aca1f94-8b7e-42c8-9703-13f2dd60de38"> </p>

MultiShapeNet Hard (MSN-Hard)

gsutil -m cp -r gs://kubric-public/tfds/kubric_frames/multi_shapenet_conditional/2.8.0/ ${DATADIR}/multi_shapenet_frames/
<p align="center"> <img width="800" alt="gta_mech" src="https://github.com/autonomousvision/gta/assets/11573649/de09e2d9-1eb1-4833-981b-3ef11c1c5fa3"> </p>

*预训练模型(MSN-Hard预训练模型即将上传)

训练

CLEVR-TR

torchrun --standalone --nnodes 1 --nproc_per_node 4 train.py runs/clevrtr/GTA/gta/config.yaml  ${DATADIR}/clevrtr --seed=0 

MSN-Hard

torchrun --standalone --nnodes 1 --nproc_per_node 4 train.py runs/msn/GTA/gta_so3/config.yaml  ${DATADIR} --seed=0 

PSNR、SSIM和LPIPS的评估

python evaluate.py runs/clevrtr/GTA/gta/config.yaml ${DATADIR}/clevrtr $PATH_TO_CHECKPOINT # CLEVR-TR
python evaluate.py runs/msn/GTA/gta_so3/config.yaml ${DATADIR} $PATH_TO_CHECKPOINT # MSN-Hard

致谢

本仓库建立在@stelzner创建的SRTOSRT之上。我们要感谢他为SRT模型的开源贡献。 我们还要感谢@lucidrains提供J矩阵的值,这些值对于高效计算SO(3)的不可约表示是必需的。

引用

@inproceedings{Miyato2024GTA, title={GTA: A Geometry-Aware Attention Mechanism for Multi-View Transformers}, author={Miyato,Takeru and Jaeger, Bernhard and Welling, Max and Geiger, Andreas}, booktitle={International Conference on Learning Representations (ICLR)}, year={2024} }

编辑推荐精选

博思AIPPT

博思AIPPT

AI一键生成PPT,就用博思AIPPT!

博思AIPPT,新一代的AI生成PPT平台,支持智能生成PPT、AI美化PPT、文本&链接生成PPT、导入Word/PDF/Markdown文档生成PPT等,内置海量精美PPT模板,涵盖商务、教育、科技等不同风格,同时针对每个页面提供多种版式,一键自适应切换,完美适配各种办公场景。

AI办公办公工具AI工具博思AIPPTAI生成PPT智能排版海量精品模板AI创作热门
潮际好麦

潮际好麦

AI赋能电商视觉革命,一站式智能商拍平台

潮际好麦深耕服装行业,是国内AI试衣效果最好的软件。使用先进AIGC能力为电商卖家批量提供优质的、低成本的商拍图。合作品牌有Shein、Lazada、安踏、百丽等65个国内外头部品牌,以及国内10万+淘宝、天猫、京东等主流平台的品牌商家,为卖家节省将近85%的出图成本,提升约3倍出图效率,让品牌能够快速上架。

iTerms

iTerms

企业专属的AI法律顾问

iTerms是法大大集团旗下法律子品牌,基于最先进的大语言模型(LLM)、专业的法律知识库和强大的智能体架构,帮助企业扫清合规障碍,筑牢风控防线,成为您企业专属的AI法律顾问。

SimilarWeb流量提升

SimilarWeb流量提升

稳定高效的流量提升解决方案,助力品牌曝光

稳定高效的流量提升解决方案,助力品牌曝光

Sora2视频免费生成

Sora2视频免费生成

最新版Sora2模型免费使用,一键生成无水印视频

最新版Sora2模型免费使用,一键生成无水印视频

Transly

Transly

实时语音翻译/同声传译工具

Transly是一个多场景的AI大语言模型驱动的同声传译、专业翻译助手,它拥有超精准的音频识别翻译能力,几乎零延迟的使用体验和支持多国语言可以让你带它走遍全球,无论你是留学生、商务人士、韩剧美剧爱好者,还是出国游玩、多国会议、跨国追星等等,都可以满足你所有需要同传的场景需求,线上线下通用,扫除语言障碍,让全世界的语言交流不再有国界。

讯飞绘文

讯飞绘文

选题、配图、成文,一站式创作,让内容运营更高效

讯飞绘文,一个AI集成平台,支持写作、选题、配图、排版和发布。高效生成适用于各类媒体的定制内容,加速品牌传播,提升内容营销效果。

热门AI辅助写作AI工具讯飞绘文内容运营AI创作个性化文章多平台分发AI助手
TRAE编程

TRAE编程

AI辅助编程,代码自动修复

Trae是一种自适应的集成开发环境(IDE),通过自动化和多元协作改变开发流程。利用Trae,团队能够更快速、精确地编写和部署代码,从而提高编程效率和项目交付速度。Trae具备上下文感知和代码自动完成功能,是提升开发效率的理想工具。

AI工具TraeAI IDE协作生产力转型热门
商汤小浣熊

商汤小浣熊

最强AI数据分析助手

小浣熊家族Raccoon,您的AI智能助手,致力于通过先进的人工智能技术,为用户提供高效、便捷的智能服务。无论是日常咨询还是专业问题解答,小浣熊都能以快速、准确的响应满足您的需求,让您的生活更加智能便捷。

imini AI

imini AI

像人一样思考的AI智能体

imini 是一款超级AI智能体,能根据人类指令,自主思考、自主完成、并且交付结果的AI智能体。

下拉加载更多