AxisRL 是一个面向大语言模型 Agentic RL 后训练的 Python 框架,底层结合 SGLang 做高吞吐 rollout、Megatron/Megatron Core 做大规模分布式训练,并围绕多轮智能体交互、工具调用、奖励采集、样本构造、权重同步、资源调度和可复现调试提供系统层能力。它支持 PPO、GRPO/GRPO2、GSPO、TOPR、TIS 等策略优化目标,适合从数学推理、检索增强问答到 OpenHands/E2B 这类黑盒 Agent harness 的强化学习训练场景。
适用领域
大语言模型后训练 / 强化学习 RLHF/RLAIF/Agentic RL / 分布式训练 / LLM 推理服务与 rollout / 智能体工作流 / 工具调用与多轮环境交互 / 检索增强生成 RAG / MoE 路由一致性与调试 / AI 基础设施
配置难度
高。该项目需要理解 LLM 强化学习、PPO/GRPO、分布式训练、SGLang 推理服务、Megatron 并行训练、Ray 调度、CUDA 环境和多轮 Agent 工作流。对于有大模型训练基础设施经验的团队可作为可扩展框架使用;对普通应用开发者或单卡用户不友好。
商业价值
对希望构建高性能 Agent 后训练平台的团队具有较高价值。AxisRL 解决的是多轮智能体强化学习从 rollout、奖励采集、样本构造、训练、权重同步到一致性调试的系统工程问题,适合用于代码 Agent、搜索 Agent、工具调用 Agent、企业自动化 Agent 等需要通过真实环境反馈持续优化的场景。Apache-2.0 许可降低了商业化集成障碍,但落地价值高度依赖团队算力、工程能力和是否具备高质量任务环境与奖励体系。
01
技术亮点
- 同时集成 SGLang 高吞吐 rollout 与 Megatron 大规模训练,定位明确:补齐二者之间的系统编排层。
- 面向真正的 Agentic RL,而不是只支持单轮问答;支持 300+ turn 的长轨迹和复杂工具调用。
- 支持 PPO、GRPO/GRPO2、GSPO、TOPR、TIS 等多种策略优化目标。
- 同时支持白盒环境和黑盒 harness capture,黑盒方式通过 OpenAI-compatible proxy 捕获模型输入输出、元数据和奖励。
- partial rollout 可减少长尾轨迹、工具延迟和 verifier 延迟导致的资源空闲。
- 采用轻量控制面和 handle-based 数据面,避免大 payload 经由中心 driver 传输。
- 提供 context packing、prefix-tree merge、MagiAttention 等上下文管理与加速能力。
- 强调 rollout-trainer consistency,提供 routing replay、mismatch analysis、spike replay 等可复现调试工具。
- Apache-2.0 许可证,商业使用友好。
- README 提供中文文档入口,对中文开发者较友好。
02
目标用户
- 从事 LLM 后训练和强化学习的算法工程师
- 需要训练多轮工具调用 Agent 的研究人员
- 拥有多 GPU/多节点训练资源的 AI Infra 团队
- 使用 SGLang、Megatron、Ray、CUDA 生态的工程团队
- 希望复现实验或扩展 PPO、GRPO 系列算法的开发者
- 构建 OpenHands、浏览器 Agent、代码 Agent 等复杂外部 harness 的团队
03
配置要求
- Python 3.12+
- 推荐使用项目 Docker 镜像,内含 SGLang、Megatron Core、MagiAttention、Ray、CUDA 依赖和当前 recipes 所需 Python 包
- 需要 NVIDIA GPU 和 CUDA 环境,默认 recipe 通常假设有较充足的显存和并行训练资源
- 训练配置可通过命令行覆盖,例如 --online_rl_train.max_global_updates=4 或 --path.to.field=value
- 需要配置模型路径、数据集路径、输出目录 AXRL_OUTPUT_DIR_NAME 等
- Search-R1 需要额外启动 retrieval server,并配置 AXRL_SEARCH_PORT
- Black-Box RL/OpenHands/E2B 需要 E2B_API_KEY、cloudflared,以及名为 axrl-openhands 的 E2B template
- 大规模模型训练可能需要正确配置 Megatron 并行策略、SGLang worker、Ray 资源组、checkpoint 和权重同步路径
04
适用场景
- 基于 GSM8K 等数据集进行 GRPO 或 PPO 数学推理后训练
- 训练带检索工具的 Search-R1 多轮搜索智能体
- 将现有黑盒 Agent harness 通过 OpenAI-compatible proxy 接入 RL 训练
- 对上百亿到数千亿参数模型进行 agentic post-training
- 降低长轨迹、多工具调用场景下 rollout 与 training 的空闲时间
- 分析 rollout 与 trainer 在 tokenization、chat template、logprob、routing、packing、weight sync 等方面的不一致
- 在 MoE 模型后训练中进行 routing replay 和 mismatch analysis,提升 KL 与 loss 稳定性
05
部署与配置
- 准备具备 CUDA 和足够 GPU 资源的机器,推荐直接使用项目提供的 Docker 环境。
- 拉取预构建镜像:docker pull leejunjie/sglang-mcore:cu130-sgl0.5.14-mcore0.18-magi
- 或根据 docker/cuda/cu130-sgl0.5.14-mcore0.18-magi.Dockerfile 自行构建镜像。
- 进入容器后,在仓库根目录执行:pip install -e .
- 如需运行默认 recipes 和测试,可执行:python axrl/example/download_data.py 下载常用模型与数据集;注意体积可能很大。
- 运行 GSM8K GRPO 示例:AXRL_OUTPUT_DIR_NAME=grpo_gsm8k bash axis_recipe/grpo_gsm8k/run_train.sh --online_rl_train.max_global_updates=4
- 运行 GSM8K PPO 示例:AXRL_OUTPUT_DIR_NAME=ppo_gsm8k bash axis_recipe/ppo_gsm8k/run_train.sh --online_rl_train.max_global_updates=4
- 运行 Search-R1 前先启动检索服务:export AXRL_SEARCH_PORT=18000 && bash axis_recipe/search_r1/start_retriever.sh,然后运行对应训练脚本。
- 如运行黑盒 RL/OpenHands/E2B recipe,需要配置 E2B_API_KEY、cloudflared,并先构建 E2B template。
06
风险与注意事项
- 项目偏前沿和基础设施型,安装、调试和运行门槛较高,不适合只想做简单 LoRA/SFT 的用户。
- 默认环境依赖较重,包括 SGLang、Megatron Core、MagiAttention、Ray、CUDA 和多 GPU 资源。
- 部分 recipe 会下载多十亿参数模型和大型数据集,对存储、网络和显存要求高。
- Black-Box RL with OpenHands/E2B 明确标注为 WIP,配置、启动脚本和 proxy 接口可能变化。
- 仓库 stars 约 309,生态和社区规模尚小于 TRL、verl、OpenRLHF 等成熟项目。
- 对 Megatron/SGLang/Ray/分布式训练不熟悉的团队,排障成本可能较高。
- 大规模 Agent RL 本身存在 reward 设计困难、训练不稳定、rollout-trainer mismatch、工具环境不可控等工程风险。
- README 中虽描述了百亿/千亿级实践能力,但实际复现需要大量算力和严格的基础设施配置。
2026-07-30
第10名
新收录 · github_search
2026-07-29
第15名
新收录 · github_search
2026-07-28
第19名
新收录 · github_search