AcmeTrace

AcmeTrace

大规模语言模型工作负载数据集

AcmeTrace是一个来自上海人工智能实验室的大规模语言模型工作负载数据集,涵盖2023年3月至8月期间的数据。该数据集包含880,740个作业记录,其中470,497个为GPU作业,来自两个独立的GPU集群。这些数据为研究人员提供了分析大规模语言模型在数据中心开发特征的宝贵资源,支持相关学术研究。

Acme TraceAI实验室工作负载数据集资源利用Github开源项目

Acme 追踪数据集

本仓库托管了上海人工智能实验室的 Acme 公开追踪数据集,涵盖了 2023 年 3 月至 2023 年 8 月的工作负载。我们鼓励任何人出于学术目的使用这些追踪数据。如果您有任何问题,请随时给我们发送电子邮件或在 Github 上提出问题。

此外,我们对 Acme 工作负载进行了深入分析,详细内容请参阅我们发表在 NSDI '24 上的论文《数据中心大型语言模型开发的特征分析》。

注意:由于 GitHub 空间限制,我们的集群利用率文件并未在此托管。如果您有兴趣访问这些文件,它们可在 HuggingFace 上获取(约 80GB)。

<span style="font-size:20px;font-weight:bold;">链接:</span> <img src="https://yellow-cdn.veclightyear.com/835a84d5/3c624918-f47a-438e-ba34-3aa16d7fc1df.svg">

Acme 数据集

主要追踪特征、数据集结构和模式如下:

主要特征:

  • 完整数据集大小:80GB(在 HuggingFace 上)
  • 数据集大小:109MB
  • 持续时间:6 个月
  • 独立 GPU 集群数量:2
  • 总作业数:880,740
  • GPU 作业总数:470,497

数据集结构

📦AcmeTrace
 ┣ 📂data
 ┃ ┣ 📂job_trace 
 ┃ ┃ ┣ 📂trace_previous_work              (用于比较的先前作业追踪)
 ┃ ┃ ┃ ┣ 📜helios_trace.csv
 ┃ ┃ ┃ ┣ 📜xxx.csv
 ┃ ┃ ┣ 📜trace_kalos.csv                  (作业追踪文件,从调度器收集)
 ┃ ┃ ┗ 📜trace_seren.csv
 ┃ ┣ 📂utilization
 ┃ ┃ ┣ 📂ipmi                             (Seren 中不同服务器型号的功耗,从 IPMI 收集)
 ┃ ┃ ┃ ┣ 📜CPU_D_Power.csv
 ┃ ┃ ┃ ┣ 📜GPU_AB_Power.csv
 ┃ ┃ ┃ ┗ 📜GPU_C_Power.csv
 ┃ ┃ ┣ 📂kalos                            (资源利用率日志,从 DCGM 和 Prometheus 收集)
 ┃ ┃ ┃ ┣ 📜DRAM_ACTIVE.csv
 ┃ ┃ ┃ ┣ 📜xxx.csv
 ┃ ┃ ┣ 📂seren
 ┃ ┃ ┃ ┣ 📜DRAM_ACTIVE.csv
 ┃ ┃ ┃ ┣ 📜xxx.csv
 ┃ ┃ ┣ 📂util_pkl                         (用于绘图的处理后 pickle 文件)
 ┃ ┃ ┃ ┣ 📜gpu_power_kalos.pkl
 ┃ ┃ ┃ ┣ 📜xxx.pkl
 ┃ ┣ 📜cluster_summary.csv
 ┃ ┣ 📜generate_utilization_pkl.ipynb     (解析利用率文件并生成 pickle 文件)
 ┃ ┗ 📜utils.py
 ┣ 📂figure                               (追踪数据可视化示例)
 ┃ ┣ 📜bar_job_state.pdf
 ┃ ┣ 📜xxx.pdf
 ┣ 📜LICENSE.txt
 ┣ 📜README.md
 ┗ 📜analysis.ipynb                       (绘图脚本)

模式和描述

1. 作业追踪

描述

提供每个集群中提交给调度器的所有作业的详细信息。

  • trace_seren.csv 示例
job_idusernode_numgpu_numcpu_numtypestatesubmit_timestart_timeend_timedurationqueuegpu_time
5778432u590718128OtherFAILED2023-03-01 00:18:22+08:002023-03-01 00:18:54+08:002023-03-01 00:20:51+08:0011732936.0
5778469u590718128OtherCOMPLETED2023-03-01 00:23:58+08:002023-03-01 00:24:11+08:002023-03-01 01:09:04+08:0026931321544.0
  • trace_kalos.csv 示例
job_idusernode_numgpu_numcpu_nummem_per_pod_GBshared_mem_per_podtypestatesubmit_timestart_timeend_timefail_timestop_timedurationqueuegpu_time
dlctk696s0jbvitvuf7948649601000100.0OtherFAILED2023-05-17 11:00:58+00:002023-05-17 11:01:08+00:002023-05-17 11:01:16+00:002023-05-17 11:01:16+00:001810.01152.0
dlc1t2ypl09b8qtpuf7948649601000100.0OtherCANCELLED2023-05-17 11:28:42+00:002023-05-17 11:28:54+00:002023-05-17 11:30:04+00:002023-05-17 11:30:04+00:008212.05248.0

模式

字段描述
job_id作业的唯一标识符
user用户的哈希ID,前缀为'u'
node_num作业所需节点数
gpu_num作业所需GPU数量
cpu_num作业所需CPU数量
typeLLM开发中的工作负载类型
state作业终止时的状态 <sup>1</sup>
submit_time作业提交时间
start_time作业开始执行时间
end_time作业终止时间
duration作业总执行时间 <sup>2</sup>
queue作业总排队时间 <sup>3</sup>
gpu_time作业消耗的总GPU资源 <sup>4</sup>

仅在Kalos中:

字段描述
mem_per_pod_GBPod内存资源配置
shared_mem_per_podPod共享内存资源配置
fail_time故障发生时间
stop_time作业停止时间

注释

  1. 作业可能以五种状态之一结束:(1) COMPLETED:成功完成;(2) CANCELLED:被用户终止;(3) FAILED:由于内部或外部错误而终止;(4) TIMEOUT:执行时间超出限制;(5) NODE_FAIL:由于节点崩溃而终止。在我们的数据中,TIMEOUTNODE_FAIL非常罕见,在分析中被视为失败。
  2. end_time减去start_time计算得出。(单位:秒)
  3. start_time减去submit_time计算得出。(单位:秒)
  4. duration乘以gpu_num计算得出。

2. 资源利用率

描述

集群资源利用率监控数据,从DCGM、IPMI和Prometheus收集。

  • NODE_CPU_UTILIZATION.csv 示例 | 时间 | 10.140.1.10 | 10.140.1.54 | 10.140.1.90 | 10.140.1.41 | 10.140.1.98 | 10.140.0.166 | 10.140.1.4 | 10.140.1.40 | 10.140.1.134 | 10.140.0.147 | 10.140.1.119 | 10.140.0.184 | 10.140.0.151 | 10.140.0.254 | 10.140.1.83 | 10.140.0.246 | 10.140.1.78 | 10.140.1.103 | 10.140.1.155 | 10.140.1.87 | 10.140.1.106 | 10.140.1.140 | 10.140.1.150 | 10.140.1.107 | 10.140.1.172 | 10.140.1.95 | 10.140.0.146 | 10.140.1.125 | 10.140.1.50 | 10.140.1.112 | 10.140.0.159 | 10.140.0.144 | 10.140.0.215 | 10.140.1.36 | 10.140.1.143 | 10.140.1.147 | 10.140.1.14 | 10.140.1.85 | 10.140.1.56 | 10.140.0.243 | 10.140.0.242 | 10.140.1.63 | 10.140.0.132 | 10.140.0.255 | 10.140.1.59 | 10.140.1.130 | 10.140.0.218 | 10.140.0.220 | 10.140.1.27 | 10.140.1.67 | 10.140.1.136 | 10.140.1.84 | 10.140.0.190 | 10.140.1.121 | 10.140.1.146 | 10.140.1.38 | 10.140.0.232 | 10.140.1.18 | 10.140.1.66 | 10.140.0.205 | 10.140.1.154 | 10.140.1.170 | 10.140.0.179 | 10.140.0.135 | 10.140.1.102 | 10.140.1.72 | 10.140.0.249 | 10.140.1.138 | 10.140.1.24 | 10.140.1.60 | 10.140.1.82 | 10.140.0.233 | 10.140.1.23 | 10.140.0.241 | 10.140.0.248 | 10.140.1.68 | 10.140.1.1 | 10.140.0.219 | 10.140.1.116 | 10.140.0.157 | 10.140.0.178 | 10.140.1.29 | 10.140.1.57 | 10.140.0.163 | 10.140.1.52 | 10.140.1.177 | 10.140.1.11 | 10.140.1.26 | 10.140.1.34 | 10.140.1.92 | 10.140.0.211 | 10.140.0.161 | 10.140.0.131 | 10.140.1.124 | 10.140.0.238 | 10.140.1.44 | 10.140.0.237 | 10.140.1.79 | 10.140.1.17 | 10.140.0.214 | 10.140.1.153 | 10.140.1.117 | 10.140.1.109 | 10.140.0.167 | 10.140.0.207 | 10.140.0.134 | 10.140.1.99 | 10.140.1.31 | 10.140.1.127 | 10.140.0.250 | 10.140.1.139 | 10.140.1.53 | 10.140.1.123 | 10.140.1.77 | 10.140.0.133 | 10.140.0.251 | 10.140.1.55 | 10.140.1.12 | 10.140.1.19 | 10.140.1.47 | 10.140.1.118 | 10.140.1.61 | 10.140.1.110 | 10.140.1.64 | 10.140.1.129 | 10.140.0.217 | 10.140.1.104 | 10.140.0.244 | 10.140.0.213 | 10.140.1.97 | 10.140.0.136 | 10.140.1.22 | 10.140.1.32 | 10.140.1.171 | 10.140.1.151 | 10.140.1.96 | 10.140.1.46 | 10.140.0.158 | 10.140.1.51 | 10.140.1.86 | 10.140.1.30 | 10.140.0.156 | 10.140.1.43 | 10.140.1.74 | 10.140.1.89 | 10.140.1.169 | 10.140.1.80 | 10.140.1.2 | 10.140.1.108 | 10.140.1.93 | 10.140.1.73 | 10.140.0.180 | 10.140.1.71 | 10.140.1.88 | 10.140.0.209 | 10.140.1.81 | 10.140.0.152 | 10.140.1.28 | 10.140.1.58 | 10.140.0.236 | 10.140.0.138 | 10.140.0.149 | 10.140.0.206 | 10.140.1.15 | 10.140.0.240 | 10.140.0.203 | 10.140.1.5 | 10.140.1.37 | 10.140.0.143 | 10.140.0.160 | 10.140.0.252 | 10.140.1.75 | 10.140.1.115 | 10.140.0.247 | 10.140.1.6 | 10.140.1.16 | 10.140.0.216 | 10.140.0.150 | 10.140.1.25 | 10.140.0.208 | 10.140.1.62 | 10.140.1.173 | 10.140.1.137 | 10.140.1.9 | 10.140.1.65 | 10.140.1.111 | 10.140.1.135 | 10.140.1.114 | 10.140.1.132 | 10.140.0.154 | 10.140.0.204 | 10.140.1.91 | 10.140.1.120 | 10.140.1.105 | 10.140.1.131 | 10.140.0.165 | 10.140.0.210 | 10.140.0.148 | 10.140.1.133 | 10.140.0.239 | 10.140.1.13 | 10.140.1.144 | 10.140.0.137 | 10.140.0.234 | 10.140.1.142 | 10.140.1.168 | 10.140.0.235 | 10.140.0.140 | 10.140.1.39 | 10.140.0.153 | 10.140.0.139 | 10.140.1.3 | 10.140.1.7 | 10.140.1.94 | 10.140.1.145 | 10.140.1.149 | 10.140.1.152 | 10.140.1.35 | 10.140.0.141 | 10.140.1.69 | 10.140.1.100 | 10.140.1.126 | 10.140.0.142 | 10.140.0.185 | 10.140.1.42 | 10.140.0.231 | 10.140.0.253 | 10.140.0.212 | 10.140.1.21 | 10.140.1.148 | 10.140.1.49 | 10.140.1.128 | 10.140.0.164 | 10.140.1.70 | 10.140.1.45 | 10.140.0.162 | 10.140.1.101 | 10.140.0.145 | 10.140.1.20 | 10.140.1.176 | 10.140.1.33 | 10.140.1.113 | 10.140.1.122 | 10.140.1.76 | 10.140.1.141 | 10.140.1.8 | 10.140.0.155 | 10.140.1.48 | |---------------------------|-------------|-------------|-------------|-------------|-------------|--------------|------------|-------------|--------------|--------------|--------------|--------------|--------------|--------------|-------------|--------------|-------------|--------------|--------------|-------------|--------------|--------------|--------------|--------------|--------------|-------------|--------------|--------------|-------------|--------------|--------------|--------------|--------------|-------------|--------------|--------------|-------------|-------------|-------------|--------------|--------------|-------------|--------------|--------------|-------------|--------------|--------------|--------------|-------------|-------------|--------------|-------------|--------------|--------------|--------------|-------------|--------------|-------------|-------------|--------------|--------------|--------------|--------------|--------------|--------------|-------------|--------------|--------------|-------------|-------------|-------------|--------------|-------------|--------------|--------------|-------------|------------|--------------|--------------|--------------|--------------|-------------|-------------|--------------|-------------|--------------|-------------|-------------|-------------|-------------|--------------|--------------|--------------|--------------|--------------|-------------|--------------|-------------|-------------|--------------|--------------|--------------|--------------|--------------|--------------|--------------|-------------|-------------|--------------|--------------|--------------|-------------|--------------|-------------|--------------|--------------|-------------|-------------|-------------|-------------|--------------|-------------|--------------|-------------|--------------|--------------|--------------|--------------|--------------|-------------|--------------|-------------|-------------|--------------|--------------|-------------|-------------|--------------|-------------|-------------|-------------|--------------|-------------|-------------|-------------|--------------|-------------|------------|--------------|-------------|-------------|--------------|-------------|-------------|--------------|-------------|--------------|-------------|-------------|--------------|--------------|--------------|--------------|-------------|--------------|--------------|------------|-------------|--------------|--------------|--------------|-------------|--------------|--------------|------------|-------------|--------------|--------------|-------------|--------------|-------------|--------------|--------------|------------|-------------|--------------|--------------|--------------|--------------|--------------|--------------|-------------|--------------|--------------|--------------|--------------|--------------|--------------|--------------|--------------|-------------|--------------|--------------|--------------|--------------|--------------|--------------|--------------|-------------|--------------|--------------|------------|------------|-------------|--------------|--------------|--------------|-------------|--------------|-------------|--------------|--------------|--------------|--------------|-------------|--------------|--------------|--------------|-------------|--------------|-------------|--------------|--------------|-------------|-------------|--------------|--------------|--------------|-------------|--------------|-------------|--------------|--------------|-------------|--------------|------------|--------------|-------------| | 2023年7月1日 08:00:00+08:00 | 8.101 | 7.809 | 8.034 | 0.437 | 0.672 | 8.988 | 8.395 | 8.205 | 8.763 | 2.037 | 6.661 | 9.177 | 9.017 | 8.096 | 14.423 | 8.04 | 0.354 | 0.34 | 0.843 | 8.66 | 0.657 | 8.104 | 0.902 | 7.006 | 0.107 | 8.298 | 8.546 | 6.413 | 8.1 | 6.633 | 8.167 | 9.246 | 9.055 | 2.963 | 7.995 | 0.707 | 8.119 | 10.531 | 6.654 | 7.707 | 4.626 | 0.848 | 25.274 | 7.95 | 8.014 | 7.908 | 9.313 | 9.184 | 7.877 | 0.484 | 8.451 | 6.137 | 0.124 | 6.163 | 0.316 | 8.343 | 9.024 | 7.922 | 8.427 | 0.455 | 67.47 | 0.395 | 7.487 | 9.142 | 7.898 | 8.071 | 7.717 | 0.755 | 7.869 | 8.193 | 8.368 | 8.911 | 8.108 | 7.934 | 8.269 | 8.161 | 8.349 | 9.252 | 6.933 | 4.823 | 7.527 | 8.42 | 7.243 | 9.166 | 8.04 | 0.092 | 7.921 | 8.28 | 8.027 | 0.365 | 8.71 | 9.302 | 0.88 | 8.055 | 8.817 | 8.07 | 9.316 | 8.064 | 8.061 | 9.319 | 7.101 | 5.221 | 7.086 | 7.701 | 9.259 | 8.857 | 5.079 | 7.944 | 8.02 | 8.244 | 8.038 | 8.269 | 5.108 | 6.971 | 1.787 | 8.095 | 8.055 | 8.275 | 8.396 | 7.787 | 6.898 | 8.224 | 16.323 | 0.671 | 8.071 | 9.125 | 8.004 | 7.888 | 8.785 | 5.412 | 0.621 | 8.004 | 7.91 | 6.727 | 10.327 | 0.413 | 8.499 | 7.735 | 8.255 | 8.087 | 8.001 | 5.908 | 8.239 | 8.279 | 7.272 | 0.14 | 8.186 | 0.526 | 6.771 | 6.386 | 6.763 | 7.308 | 6.741 | 8.047 | 8.883 | 7.059 | 8.79 | 7.864 | 8.065 | 9.474 | 0.481 | 9.179 | 9.579 | 8.157 | 9.063 | 7.339 | 8.295 | 6.81 | 9.029 | 9.037 | 8.042 | 0.717 | 6.675 | 7.838 | 8.192 | 8.038 | 9.004 | 8.621 | 8.117 | 8.177 | 22.467 | 0.198 | 3.4 | 8.086 | 7.86 | 6.891 | 4.376 | 7.144 | 5.331 | 8.924 | 7.668 | 0.332 | 7.961 | 7.958 | 8.164 | 5.741 | 8.938 | 8.969 | 6.372 | 8.816 | 8.361 | 12.62 | 9.149 | 9.151 | 8.374 | 8.831 | 9.332 | 9.181 | 8.142 | 8.653 | 1.449 | 8.268 | 8.481 | 8.568 | 0.468 | 59.942 | 66.076 | 8.191 | 8.96 | 8.223 | 0.478 | 8.023 | 9.129 | 9.6 | 8.164 | 9.518 | 8.172 | 9.551 | 8.012 | 14.544 | 8.154 | 8.069 | 9.344 | 0.357 | 8.09 | 0.463 | 8.082 | 7.657 | 8.139 | 0.164 | 8.143 | 6.56 | 6.632 | 8.018 | 8.065 | 8.288 | 8.667 | 8.078 |

模式

字段描述
Time采样时间戳,间隔为15秒
10.140.xx.xx服务器IP地址

编辑推荐精选

堆友

堆友

多风格AI绘画神器

堆友平台由阿里巴巴设计团队创建,作为一款AI驱动的设计工具,专为设计师提供一站式增长服务。功能覆盖海量3D素材、AI绘画、实时渲染以及专业抠图,显著提升设计品质和效率。平台不仅提供工具,还是一个促进创意交流和个人发展的空间,界面友好,适合所有级别的设计师和创意工作者。

图像生成AI工具AI反应堆AI工具箱AI绘画GOAI艺术字堆友相机AI图像热门
码上飞

码上飞

零代码AI应用开发平台

零代码AI应用开发平台,用户只需一句话简单描述需求,AI能自动生成小程序、APP或H5网页应用,无需编写代码。

Vora

Vora

免费创建高清无水印Sora视频

Vora是一个免费创建高清无水印Sora视频的AI工具

Refly.AI

Refly.AI

最适合小白的AI自动化工作流平台

无需编码,轻松生成可复用、可变现的AI自动化工作流

酷表ChatExcel

酷表ChatExcel

大模型驱动的Excel数据处理工具

基于大模型交互的表格处理系统,允许用户通过对话方式完成数据整理和可视化分析。系统采用机器学习算法解析用户指令,自动执行排序、公式计算和数据透视等操作,支持多种文件格式导入导出。数据处理响应速度保持在0.8秒以内,支持超过100万行数据的即时分析。

AI工具酷表ChatExcelAI智能客服AI营销产品使用教程
TRAE编程

TRAE编程

AI辅助编程,代码自动修复

Trae是一种自适应的集成开发环境(IDE),通过自动化和多元协作改变开发流程。利用Trae,团队能够更快速、精确地编写和部署代码,从而提高编程效率和项目交付速度。Trae具备上下文感知和代码自动完成功能,是提升开发效率的理想工具。

AI工具TraeAI IDE协作生产力转型热门
AIWritePaper论文写作

AIWritePaper论文写作

AI论文写作指导平台

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

AI辅助写作AI工具AI论文工具论文写作智能生成大纲数据安全AI助手热门
博思AIPPT

博思AIPPT

AI一键生成PPT,就用博思AIPPT!

博思AIPPT,新一代的AI生成PPT平台,支持智能生成PPT、AI美化PPT、文本&链接生成PPT、导入Word/PDF/Markdown文档生成PPT等,内置海量精美PPT模板,涵盖商务、教育、科技等不同风格,同时针对每个页面提供多种版式,一键自适应切换,完美适配各种办公场景。

AI办公办公工具AI工具博思AIPPTAI生成PPT智能排版海量精品模板AI创作热门
潮际好麦

潮际好麦

AI赋能电商视觉革命,一站式智能商拍平台

潮际好麦深耕服装行业,是国内AI试衣效果最好的软件。使用先进AIGC能力为电商卖家批量提供优质的、低成本的商拍图。合作品牌有Shein、Lazada、安踏、百丽等65个国内外头部品牌,以及国内10万+淘宝、天猫、京东等主流平台的品牌商家,为卖家节省将近85%的出图成本,提升约3倍出图效率,让品牌能够快速上架。

iTerms

iTerms

企业专属的AI法律顾问

iTerms是法大大集团旗下法律子品牌,基于最先进的大语言模型(LLM)、专业的法律知识库和强大的智能体架构,帮助企业扫清合规障碍,筑牢风控防线,成为您企业专属的AI法律顾问。

下拉加载更多