MultiPLY是一个<strong>多感官具身</strong>大语言模型,能够主动与3D环境中的物体交互并动态收集其多感官信息。它能够将多感官交互数据(包括视觉、听觉、触觉和热感信息)整合到大语言模型中,从而建立单词、动作和感知之间的关联。
我们首先将场景编码为抽象的以物体为中心的表示,而物体的多感官细节只有在代理执行动作并与之交互时才会揭示。我们设计了一组动作标记,表示代理与环境交互的动作。交互结果通过状态标记被附加回大语言模型。
待完成
我们使用FSDP训练。在不同的集群上可能会有所不同。以下是在训练集群上的一个示例:
RANDOM=$$
DIV=1000
OFFSET=24000
MASTER_PORT=$(($RANDOM%$DIV+$OFFSET))
export OMP_NUM_THREADS=1
export TOKENIZERS_PARALLELISM=true
NODE_RANK=${SLURM_PROCID}
SLURM=${SLURM_NODELIST:0:3}
ip=${SLURM}${SLURM_NODELIST:4:2}
# 运行训练脚本
NUM_GPUS_PER_NODE=${1:-8}
echo $NUM_GPUS_PER_NODE
NUM_NODES=${2:-1}
CMD="torchrun --nnodes=$NUM_NODES --nproc_per_node=$NUM_GPUS_PER_NODE --master_addr=$ip --node_rank=$NODE_RANK"
$CMD \
fsdp_train.py --folder retrieval_attention3 --num_epochs=1000
待完成
@article{multiply,
author = {Hong, Yining and Zheng, Zishuo and Chen, Peihao and Wang, Yian and Li, Junyan and Chen, Zhenfang and Gan, Chuang},
title = {MultiPLY: A Multisensory Object-Centric Embodied Large Language Model in 3D World},
journal = {arXiv},
year = {2024},
}


AI辅助编程,代码自动修复
Trae是一种自适应的集成开发环境(IDE),通过自动化和多元协作改变开发流程。利用Trae,团队能够更快速、精确地编写和部署代码,从而提高编程效率和项目交付速度。Trae具备上下文感知和代码自动完成功能,是提升开发效率的理想工具。


AI一键生成PPT,就用博思AIPPT!
博思AIPPT,新一代的AI生成PPT平台,支持智能生成PPT、AI美化PPT、文本&链接生成PPT、导入Word/PDF/Markdown文档生成PPT等,内置海量精美PPT模板,涵盖商务、教育、科技等不同风格,同时针对每个页面提供多种版式,一键自 适应切换,完美适配各种办公场景。


AI赋能电商视觉革命,一 站式智能商拍平台
潮际好麦深耕服装行业,是国内AI试衣效果最好的软件。使用先进AIGC能力为电商卖家批量提供优质的、低成本的商拍图。合作品牌有Shein、Lazada、安踏、百丽等65个国内外头部品牌,以及国内10万+淘宝、天猫、京东等主流平台的品牌商家,为卖家节省将近85%的出图成本,提升约3倍出图效率,让品牌能够快速上架。


企业专属的AI法律顾问
iTerms是法大大集团旗下法律子品牌,基于最先进的大语言模型(LLM)、专业的法律知识库和强大的智能体架构,帮助企业扫清合规障碍,筑牢风控防线,成为您企业专属的AI法律顾问。


稳定高效的流量提升解决方案,助力品牌曝光
稳定高效的流量提升解决方案,助力品牌曝光

