slime 后训练框架拆解 Megatron SGLang 的 RL 数据闭环【免费下载链接】slimeslime is an LLM post-training framework for RL Scaling.项目地址: https://gitcode.com/GitHub_Trending/slime12/slime做 RL 训练的人大多卡在 rollout推理生成阶段推理太慢、参数跟不上训练、数据链路对不齐。你需要的不是一个推理服务而是把训练出参数、推理出数据放进同一个闭环的后训练框架。slime 后训练框架干的就是这件事。 数据流是怎么跑的slime 的核心就三个模块各管一段训练模块Megatron从数据缓冲区读样本做训练每步结束把新参数同步给推理端Rollout 模块SGLang 路由器拿最新参数生成新样本含奖励模型、验证器输出写回缓冲区数据缓冲区中间的桥管理提示词初始化、自定义数据与 rollout 生成方法数据流转成一个圈Megatron 训练 → 参数同步 → SGLang 推理 → 样本奖励 → 数据缓冲区 → 回到 Megatron入口是train.py先用 Ray 分配 GPU、创建 rollout 管理器把初始权重推给 SGLang再进主循环。每一轮先调generate()拿 rollout 数据再提交async_train()训练按间隔保存 checkpoint。想动手跑的话先git clone https://gitcode.com/GitHub_Trending/slime12/slime然后照着 Quick Start 指南 走。 支持哪些场景和模型规模前沿模型 RL 后训练GLM-4.5 到 GLM-5.3 系列的 RL 训练都由它承担。scripts/models/ 下覆盖 Qwen3-4B 到 GLM5.2-744B-A40B 各档规模的启动脚本。Agentic 工作流多智能体、搜索、编码 agent 都通过自定义生成函数接入同一个 rollout 循环不 fork 训练内核。examples/ 里有 multi-agent、search-r1、coding-agent 现成案例。跨框架迁移tools/提供 HF 与 Megatrontorch_dist格式互转模型在两个生态间来回搬。 几个值得留意的设计决定它直接透传 Megatron 和 SGLang 原生参数推理参数加--sglang-前缀所以上游引擎的新优化你能直接用上。它只选 SGLang 一个 rollout 后端所以 PD 分离、会话亲和路由、增量权重同步这些能力可以完整使用不做阉割。它提供 rollout-only 和 train-only 两条独立调试路径所以 RL 里那些静默 bug 能一步步定位。它把容错、可复现、trace 当成一等公民写进 docs/而不是事后补丁。如果你正在做 LLM RL 后训练且要同时管训练与推理两端的资源值得花一个下午跑通一个小模型案例。如果只做 SFT 或纯推理服务这个框架的收益就有限了。【免费下载链接】slimeslime is an LLM post-training framework for RL Scaling.项目地址: https://gitcode.com/GitHub_Trending/slime12/slime创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考