这是论文 https://arxiv.org/abs/2305.14342 中 Sophia-G 优化器的官方实现和 GPT-2 训练脚本。代码基于 nanoGPT 和 levanter。如果您发现 Sophia 有用,请引用该论文并为此仓库加星。谢谢!
@article{liu2023sophia, title={Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training}, author={Liu, Hong and Li, Zhiyuan and Hall, David and Liang, Percy and Ma, Tengyu}, journal={arXiv preprint arXiv:2305.14342}, year={2023} }
以下是使用 SophiaG 训练具有 NLL 损失的通用模型的示例代码片段。请参阅下一节以获取超参数调优指南。
import torch import torch.nn.functional as F from sophia import SophiaG # 初始化模型、损失函数和输入数据 model = Model() data_loader = ... # 初始化优化器 optimizer = SophiaG(model.parameters(), lr=2e-4, betas=(0.965, 0.99), rho=0.01, weight_decay=1e-1) total_bs = len(data_loader) bs = total_bs * block_size k = 10 iter_num = -1 # 训练循环 for epoch in range(epochs): for X, Y in data_loader: # 标准训练代码 logits, loss = model(X, Y) loss.backward() optimizer.step(bs=bs) optimizer.zero_grad(set_to_none=True) iter_num += 1 if iter_num % k != k - 1: continue else: # 更新 Hessian EMA logits, _ = model(X, None) samp_dist = torch.distributions.Categorical(logits=logits) y_sample = samp_dist.sample() loss_sampled = F.cross_entropy(logits.view(-1, logits.size(-1)), y_sample.view(-1), ignore_index=-1) loss_sampled.backward() optimizer.update_hessian() optimizer.zero_grad(set_to_none=True) model.zero_grad()
train/win_rate。train/win_rate 应该在开始时达到峰值,之后保持稳定。train/win_rate 应保持在 0.1 - 0.5 范围内。通常较大的 $\rho$ 会导致较大的 train/win_rate。下面提供了 T5 模型中典型的 win_rate 行为示例。如果损失爆炸,稍微降低学习率或增加 $\rho$。
始终使用比 AdamW 大约 2 倍的权重衰减。
选择与您为 AdamW 使用的学习率大致相同,或者是您为 Lion 使用的学习率的 5 - 10 倍。
调整 $\rho$ 使未裁剪更新的参数比例稳定并在适当范围内。这在 GPT-2 训练示例 中被追踪为 train/win_rate。train/win_rate 应该在开始时达到峰值,之后保持稳定。train/win_rate 应保持在 0.1 - 0.5 范围内。通常较大的 $\rho$ 会导致较大的 train/win_rate。
使用略大于 AdamW 的权重衰减,例如 0.2。
除学习率外,所有其他超参数都可以在不同模型大小之间迁移。
请参阅下表了解不同模型大小的超参数。 | 模型大小 | Adam 学习率 | Lion 学习率 | Sophia 学习率 | Sophia 的 $\rho$ 值 | Sophia 的权重衰减 | | -------- | ------- | ------- | ------- | ------- | ------- | | 125M | 6e-4 | 1e-4 | 6e-4 | 0.05 | 0.2 | | 355M | 3e-4 | 1e-4 | 7e-4 | 0.08 | 0.2 | | 770M | 2e-4 | 8e-5 | 3e-4 | 0.05 | 0.2 |
请随时让我们知道您在超参数调整过程中的发现。我们非常感谢您宝贵的反馈和评论!
按照 nanoGPT 的方法准备 OpenWebText 数据:
$ python data/openwebtext/prepare.py
开始预训练 GPT2 Small (125M):
如果您有一台配备 10 个 A5000 (24GB) GPU 的机器,
$ torchrun --standalone --nproc_per_node=10 \
train_sophiag.py \
config/train_gpt2_small_sophiag.py \
--batch_size=8 \
--gradient_accumulation_steps=6
如果您有一台配备 8 个 A100 (40GB) GPU 的机器,
$ torchrun --standalone --nproc_per_node=8 \
train_sophiag.py \
config/train_gpt2_small_sophiag.py \
--batch_size=12 \
--gradient_accumulation_steps=5
要复现 AdamW 基准,请按照 nanoGPT 的方法:
$ torchrun --standalone --nproc_per_node=10 \
train_adam.py \
config/train_gpt2_small_adam.py \
--batch_size=8 \
--gradient_accumulation_steps=6
这将得到下图所示的结果:
<p align="center" width="100%"> <img src="https://yellow-cdn.veclightyear.com/ab5030c0/dc3f002b-4d1d-4984-8953-0d51a3fde8a6.png" style="width: 60%; min-width: 200px; display: block; margin: auto;"> </p>开始预训练 GPT2 Medium (355M):
如果您有一台配备 8 个 A100 (40GB) GPU 的机器,
$ torchrun --standalone --nproc_per_node=8 \
train_sophiag.py \
config/train_gpt2_medium_sophiag.py \
--batch_size=6 \
--gradient_accumulation_steps=10
要复现 AdamW 基准:
$ torchrun --standalone --nproc_per_node=8 \
train_adam.py \
config/train_gpt2_medium_adam.py \
--batch_size=6 \
--gradient_accumulation_steps=10
如果您使用其他硬件设置,请相应调整 nproc_per_node、batch_size 和 gradient_accumulation_steps。确保它们的乘积等于 480。
这将得到下图所示的结果:
<p align="center" width="100%"> <img src="https://yellow-cdn.veclightyear.com/ab5030c0/097b99ad-e5c8-4f96-9f52-49348a96f5fb.png" style="width: 60%; min-width: 200px; display: block; margin: auto;"> </p>开始预训练 GPT2 1.5B:
我们使用 the Pile 和 GPT NeoX 分词器。首先按照 levanter 设置 TPU 实例和环境。然后在 optim.py 中将 GAMMA_SOPHIA_G 更改为 200。1.5B 模型的训练脚本如下:
gcloud compute tpus tpu-vm ssh <instance_name> \
--zone <zone_name> \
--worker=all \
--command 'WANDB_API_KEY=<wandb_api_key> levanter/infra/launch.sh python levanter/examples/gpt2_example.py --config_path levanter/config/gpt2_1536_pile.yaml --trainer.beta1 0.965 --trainer.beta2 0.99 --trainer.min_lr_ratio 0.020 --trainer.weight_decay 0.15 --trainer.learning_rate 2.5e-4 --trainer.warmup_ratio 0.01'
GPT-2 训练代码基于 nanoGPT,该代码优雅且效率极高。


全球首个AI音乐社区
音述AI是全球首个AI音乐社区,致力让每个人都能用音乐表达自我。音述AI提供零门槛AI创作工具,独创GETI法则帮助用户精准定义音乐风格,AI润色功能支持自动优化作品质感。音述AI支持交流讨论、二次创作与价值变现。针对中文用户的语言习惯与文化背景进行专门优化,支持国风融合、C-pop等本土音乐标签,让技术更好地承载人文表达。


阿里Qoder团队推出的桌面端AI智能体
QoderWork 是阿里推出的本地优先桌面 AI 智能体,适配 macOS14+/Windows10+,以自然语言交互实现文件管理、数据分析、AI 视觉生成、浏览器自动化等办公任务,自主拆解执行复杂工作流,数据本地运行零上传,技能市场可无限扩展,是高效的 Agentic 生产力办公助手。


一站式搞定所有学习需求
不再被海量信息淹没,开始真正理解知识。Lynote 可摘要 YouTube 视频、PDF、文章等内容。即时创建笔记,检测 AI 内容并下载资料,将您的学习效率提升 10 倍。


为AI短剧协作而生
专为AI短剧协作而生的AniShort正式发布,深度重构AI短剧全流程生产模式,整合创意策划、制作执行、实时协作、在线审 片、资产复用等全链路功能,独创无限画布、双轨并行工业化工作流与Ani智能体助手,集成多款主流AI大模型,破解素材零散、版本混乱、沟通低效等行业痛点,助力3人团队效率提升800%,打造标准化、可追溯的AI短剧量产体系,是AI短剧团队协同创作、提升制作效率的核心工具。


能听懂你表达的视频模型
Seedance two是基于seedance2.0的中国大模型,支持图像、视频、音频、文本四种模态输入,表达方式更丰富,生成也更可控。


国内直接访问,限时3折
输入简单文字,生成想要的图片,纳米香蕉中文站基于 Google 模型的 AI 图片生成网站,支持文字生图、图生图。官网价格限时3折活动


职场AI,就用扣子
AI办公助手,复杂任务高效处理。办公效率低?扣子空间AI助手支持播客生成、PPT制作、网页开发及报告写作,覆盖科研、商业、舆情等领域的专家Agent 7x24小时响应,生活工作无缝切换,提升50%效率!


多风格AI绘画神器
堆友平台由阿里巴巴设计团队创建,作为一款AI驱动的设计工具,专为设计师提供一站式增长服务。功能覆盖海量3D素材、AI绘画、实时渲染以及专业抠 图,显著提升设计品质和效率。平台不仅提供工具,还是一个促进创意交流和个人发展的空间,界面友好,适合所有级别的设计师和创意工作者。


零代码AI应用开发平台
零代码AI应用开发平台,用户只需一句话简单描述需求,AI能自动生成小程序、APP或H5网页应用,无需编写代码。


免费创建高清无水印Sora视频
Vora是一个免费创建高清无水印Sora视频的AI工具
最新AI 工具、AI资讯
独家AI资源、AI项目落地

微信扫一扫关注公众号