首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
slime:LLM 后训练强化学习训练框架完整使用指南
📅 2026/9/19 12:43:01
✍️ 爱科研究院
👁 阅读 3,247
slimeLLM 后训练强化学习训练框架完整使用指南【免费下载链接】slimeslime is an LLM post-training framework for RL Scaling.项目地址: https://gitcode.com/GitHub_Trending/slime12/slime如果你正在用强化学习GRPO、PPO做 LLM 后训练大概率被两件事卡住训练框架撑不起多机多卡的 MoE 规模以及推理引擎、奖励计算、权重同步散落在各条自写脚本里对不上账。slime 就是为解决这个问题而生的 LLM 后训练框架——它把 Megatron-LM训练和 SGLang数据生成/rollout接在同一条数据流上提供高性能训练和灵活的数据生成两大能力背后是 GLM-4.5 到 GLM-5.2 一系列模型的完整 RL 训练闭环。本文带你快速理解它的架构、跑通第一个训练任务并判断它是否适合你的场景。为什么 RL 后训练比 SFT 难搭SFT 只需要数据进、梯度出而 RL 是一个循环当前策略采样一批回复 → 计算奖励 → 更新参数 → 把新权重同步给推理引擎 → 再采样。这个循环里有几个容易翻车的点训推两张皮训练侧是 Megatron 的torch_dist权重推理侧是 SGLang 吃的 Hugging Face 格式两者之间的权重同步如果不对模型悄悄变笨而你察觉不到rollout 占大头时间在 agentic 多轮场景下生成阶段常占整轮训练 90% 以上的耗时采样慢、长尾请求多整轮就被最慢的样本拖住奖励逻辑五花八门数学题对答案、代码跑测试、搜索调工具每接一个任务就要改一遍训练代码。如果你是做 agent 训练、数学/代码 RL 或大规模 MoE 模型后训练的下面这套东西就是为你准备的。slime 一句话定位一条数据流串起训练、生成与奖励slime 的架构可以概括为三个模块围成的闭环训练侧Megatron-LM负责参数更新从数据缓冲区读取样本训练完把权重同步给 rollout 侧Rollout 侧SGLang router负责生成新数据含奖励/验证器输出并写回缓冲区你的自定义生成函数可以在这层叠上多轮循环、工具调用和沙箱交互数据缓冲区Data Buffer桥梁模块管理 prompt 初始化、自定义数据和生成方式包括 agentic workflow 产出的样本。关键设计取舍是单一推理后端 参数透传它不为兼容多家推理引擎做最小公分母式抽象而是深度绑定 SGLang让 PD 分离、会话亲和路由、KV cache 优化这些特性直接可用同时 Megatron 参数原样透传如--tensor-model-parallel-size 2SGLang 参数加--sglang-前缀透传如--sglang-mem-fraction-static 0.8引擎升级后新特性基本免费获得。参数体系详见 slime/utils/arguments.py。它是怎么工作的一个训练循环里的数据流一轮 slime 训练大致是这样转的数据缓冲区按--rollout-batch-size取一批 prompt每条 prompt 采样--n-samples-per-prompt次GRPO 类算法靠这个算组内优势SGLang 集群生成回复奖励函数内置数学 RM 或你的--custom-rm-path打分Megatron 侧算 logprob、优势执行optimizer.step()新权重同步回 SGLang进入下一轮共--num-rollout轮。两个部署形态可切换默认训推分离训练卡和推理卡分开分配卡数紧张时加--colocate让训练和推理共享同一组 GPUslime 会处理显存腾挪。几个让跑起来变成跑对的工程细节动态批处理--use-dynamic-batch-size--max-tokens-per-gpu把长短不一的样本打包官方强调这不影响 per-sample loss 正确性推荐常开低精度路径生产推荐BF16 训练 FP8 rollout训练保持稳定推理侧用 FP8 checkpoint 省显存提吞吐长上下文还能开 FP8 KV cache--sglang-kv-cache-dtype fp8_e4m3详见 低精度文档可观测性每条样本可挂执行 trace离线用时间线查看器逐条排查生成/奖励各阶段耗时配套的还有 可复现性、容错、Profiling 等文档以及 GPU 端到端 CI脚本能跑之外的正确性问题是这个项目的一等公民。快速上手 LLM 强化学习训练环境上强烈建议用官方 Docker 镜像内置 Megatron/SGLang 及补丁流程是拉镜像 → 下载模型和数据集 → 权重转换 → 跑脚本。# 拉取镜像并启动容器官方文档给出完整命令 docker pull slimerl/slime:latest不同框架间如何转换模型格式Megatron 不能直接读 Hugging Face 权重需要先把 HF 权重转成torch_dist格式tools/convert_hf_to_torch_dist.py训练完再用tools/convert_torch_dist_to_hf.py转回 HF。scripts/models/下提供了 GLM、Qwen3、DeepSeek 等数十种模型的现成配置source一下即可。准备就绪后以 GLM-4-9B 数学 RL 为例bash scripts/run-glm4-9B.sh这个脚本就是参数说明书本身MODEL_ARGS模型结构、CKPT_ARGS检查点路径、ROLLOUT_ARGS采样规模和奖励类型、GRPO_ARGS算法超参、PERF_ARGS并行与重计算、SGLANG_ARGS推理部署分区清晰。完整的从零到跑通指南见 快速开始文档参数逐项解释见 使用文档。如果你要训练多机 MoE 模型如 32×H100 训 700B 级 MoEexamples 和scripts/里有从 8 卡到 128 卡的端到端参考脚本例如 GLM-4.7-30B-A3B 示例 和 DeepSeek-R1 示例。适合谁用自定义数据生成与 Agentic RL 场景slime 的第二大能力是数据生成自由度——训练内核不用动只换生成函数和奖励函数你想做的事用哪个接口参考示例多轮工具调用、RAG、搜索增强--custom-generate-function-pathexamples/search-r1verifier/测试用例打分--custom-rm-pathexamples/coding_agent_rl多 agent、一条 prompt 拆多份训练样本同上的 fan-out 返回examples/multi_agent长尾耗时的全异步生成--rollout-function-pathexamples/fully_async以 coding_agent_rl 为例每条样本起一个独立沙箱agent 改代码产出git diff在干净沙箱里跑测试得到奖励——这是一整套端到端 SWE agent 训练而训练循环仍是默认的那套。多轮交互的关键技巧是用loss_mask区分模型生成的 token参与 loss和工具返回的 token不参与多轮适配文档有逐步说明。VLM 多轮场景也有现成例子训练曲线如下一句话判断如果你只是跑一次 1B 小模型的单轮数学 RL 实验轻量框架也许够如果你要上多机 MoE、多轮 agent、沙箱/工具交互、低精度 rollout且不想自己维护训推权重同步slime 就是为你准备的底座。结论与下一步slime 把 Megatron 的训练性能和 SGLang 的推理吞吐拧进同一条 RL 数据流用参数透传和函数级自定义接口换来扩展空间并且这套东西被 GLM 系列的正式发布级训练验证过。建议的下一步读 快速开始指南用官方镜像跑通 Qwen3-4B 或 GLM-4-9B 示例打开 examples找到最接近你任务形态的例子数学、搜索、多 agent、VLM、蒸馏需要定制时对照 自定义接口总览 选最细粒度的 hook而不是重写整个 rollout。git clone https://gitcode.com/GitHub_Trending/slime12/slime【免费下载链接】slimeslime is an LLM post-training framework for RL Scaling.项目地址: https://gitcode.com/GitHub_Trending/slime12/slime创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/9/19 12:43:01
Spring Boot实战:HPV疫苗预约系统设计与核心实现解析
2026/9/19 12:43:01
React-Select 完全指南:从安装、Props 到可控状态与深度定制
2026/9/19 12:43:01
彻底关闭Edge鼠标右键画线手势的三重方案
2026/9/19 13:38:05
Codex CLI报错“encrypted content could not be verified”排查与修复指南
2026/9/19 13:38:05
Windows 下 Node.js 安装配置全攻略:环境变量与 npm 避坑指南
2026/9/19 13:38:05
电子听诊器硬件设计全解析:传感器选型、信号调理与嵌入式实现
2026/9/19 13:38:05
示波法血压测量中的软件滤波算法与Android实现
2026/9/19 13:38:05
Centos7安装Mysql5.7(超详细版)
2026/9/19 13:33:05
让Django Admin面板变惊艳:Awesome Django中10个不可错过的Admin主题与实用插件
2026/9/19 0:02:13
PixiJS v8 遮罩(Masking)完全指南:AlphaMask、StencilMask、ScissorMask 与 ColorMask
2026/9/19 0:02:13
GLM 5.3 Flash 被 Artificial Analysis 收录:用 TaoToken 复现同一把 Key
2026/9/19 0:02:13
分布式雷达多维度干扰建模与抗干扰算法实现
2026/9/18 16:05:49
拯救者Y7000黑屏故障排查与维修实战指南
2026/9/18 3:56:12
AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验
2026/9/18 13:25:13
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化