Python · 项目报告

sunny-glow/Auto-BenchMax

该仓库暂未提供 GitHub 项目描述。

已完成 打开 GitHub
S
350星标
27Fork
3Issue
未知许可证

分析结果

项目分析

Auto-BenchMax 是一个面向大模型 Agent / Tool-use Benchmark 的自动化数据合成与训练复现项目。它提供了一套针对特定评测集构造同分布训练数据的 pipeline、基于 Axolotl 改造的训练代码、MCP-Atlas 评测环境适配,以及首轮生成的 1312 条 SFT 工具调用数据。项目目标是帮助开发者快速针对 MCP-Atlas 或自定义工具使用类 benchmark 合成训练数据,并通过微调显著提升基座模型在目标 benchmark 上的分数。README 宣称使用 Qwen3-Coder-30B 基座模型和首轮数据,可在 MCP-Atlas public set 上从 19.1 提升到 40.4,进一步迭代可超过 50。

适用领域 大模型微调 / Agent 评测 / Tool-use / Function Calling / Benchmark 数据合成 / SFT 数据构造 / MCP-Atlas 评测 / 自动化评测与训练流水线 / 模型对齐与能力增强
配置难度 高。该项目不是普通 Python 包,而是大模型训练与 Agent benchmark 工程流水线。使用者需要理解 SFT、Axolotl、DeepSpeed、torchrun、多 GPU 训练、长上下文训练、工具调用数据格式和 MCP-Atlas 评测流程。仅复现已有结果也需要高性能 GPU 资源;若要迁移到自定义 benchmark,还需要分析 evaluator、构建运行环境并调试数据合成过程。
商业价值 对大模型团队、Agent 平台团队和评测团队具有较高业务价值。它可以帮助团队快速针对内部或公开工具调用 benchmark 构造训练数据,定位模型在 Agent 任务中的短板,并在短周期内提升评测指标。对于需要展示模型能力、优化工具调用成功率、构建内部评测闭环的团队尤其有用。但其价值应被定位为研发和评测加速工具,而不是最终能力保证;在商业落地前必须结合真实业务任务、私有评测集、安全性评估和泛化测试进行验证。
01

技术亮点

  • 项目定位清晰,专注于 benchmark-targeted 数据合成和 Agent 工具调用能力提升
  • 提供完整链路:数据合成方法、训练代码、训练数据、评测环境适配
  • README 给出了具体可复现的 MCP-Atlas 分数提升结果,从 19.1 到 40.4
  • 内置 1312 条首轮 SFT 样本,开发者可以直接开始训练复现
  • 提出两类数据合成范式,分别适配 LLM-judged 和 rule-based benchmark
  • 适合研究工具调用轨迹生成、rollout、过滤、验证和同分布训练数据构造
  • 训练代码基于 Axolotl,工程上更容易与现有开源微调生态结合
  • 对 MCP-Atlas 做了环境适配,有助于端到端运行 rollout、evaluation 和 scoring
  • 对中文大模型社区有现实参考价值,直接回应了国内模型团队追 benchmark 的工程需求
02

目标用户

  • 从事大模型 Agent 能力训练的算法工程师
  • 负责 benchmark 提分和模型评测的研究员
  • 需要构建内部评测集和同分布训练数据的模型团队
  • 使用 Qwen、Claude Code、Axolotl、DeepSpeed 等工具链的开发者
  • 关注工具调用、MCP、函数调用、多轮轨迹训练的 AI 应用开发团队
  • 希望复现 MCP-Atlas 提分结果的研究人员
03

配置要求

  • Python 环境需满足 Axolotl 及其依赖要求
  • 需要安装 PyTorch、Transformers、DeepSpeed、Axolotl 相关训练依赖
  • 推荐具备多卡 GPU 环境,默认训练脚本使用单机 8 张 GPU
  • 训练配置使用 DeepSpeed ZeRO-3,对显存、CPU 内存和磁盘 IO 有较高要求
  • 默认 sequence_len 为 131072,属于超长上下文训练,硬件资源消耗很高
  • 需要本地可用的 Qwen3-Coder-30B 或兼容模型权重路径
  • 需要为 tokenizer_config 指定与 base_model 一致的 tokenizer 路径
  • 需要配置 dataset_prepared_path 作为 tokenized dataset 缓存路径
  • 需要确认 datas/benchmax_sft_iter1.jsonl 的相对路径对 codes/axolotl/ 训练目录可访问
  • 如使用自定义 benchmark 数据合成,需要提供评测入口命令和可被 skill 分析的 evaluator 逻辑
  • 如使用 Claude Code 等支持 skills 的 Agent 自动执行数据合成,需要该 Agent 能读取 skills/tool-use-data-synthesis/SKILL.md 并访问评测环境
04

适用场景

  • 复现作者在 MCP-Atlas public set 上的第一轮 SFT 提分结果
  • 为自定义 Agent / Tool-use benchmark 自动合成同分布训练数据
  • 根据评测器类型选择数据合成范式:LLM-judged 采用 Execute-then-Extract,rule-based 采用 Construct-then-Verify
  • 生成包含 messages 和 tools 字段的工具调用 SFT 样本
  • 对 Qwen3-Coder-30B 等代码或 Agent 模型进行长上下文工具调用微调
  • 搭建内部 benchmark 优化流水线,用于发现模型在工具使用任务上的短板
  • 研究 benchmark contamination、benchmark-targeted training、评测泛化性等问题
05

部署与配置

  • 克隆仓库:git clone https://github.com/sunny-glow/Auto-BenchMax.git
  • 进入仓库根目录:cd Auto-BenchMax
  • 进入训练代码目录 codes/axolotl,并按照 Axolotl 官方安装文档创建 Python 虚拟环境,推荐在 codes/axolotl/ 下创建 .venv
  • 准备本地基座模型权重,例如 Qwen3-Coder-30B,并确保训练机器可以访问该路径
  • 确认数据文件 datas/benchmax_sft_iter1.jsonl 存在,该文件包含 1312 条首轮工具调用 SFT 样本
  • 编辑 codes/axolotl/benchmax_configs/qwen3_exp0.yaml,将 base_model 和 tokenizer_config 修改为本地模型路径,将 dataset_prepared_path 修改为本地缓存目录
  • 根据 GPU 数量检查 codes/axolotl/benchmax_scripts/train.sh 中的 torchrun --nproc_per_node 参数,默认是单机 8 卡
  • 从仓库根目录启动训练:bash codes/axolotl/benchmax_scripts/train.sh
  • 如需指定自定义配置,可运行:bash codes/axolotl/benchmax_scripts/train.sh ./benchmax_configs/qwen3_exp0.yaml
  • 训练完成后检查 output/exp0/ 下的 checkpoint,并在 temp_log/<timestamp>/ 中查看训练配置和日志
  • 如需评估,在 codes/mcp-atlas/ 下按该目录 README 配置 MCP-Atlas 环境并运行 public set 评测
06

风险与注意事项

  • 项目目标偏向 benchmark 提分,可能带来过拟合 public benchmark、评测污染或泛化性不足的问题
  • README 未声明 license,商业使用和二次分发存在法律不确定性
  • 依赖 Qwen3-Coder-30B 和 131k sequence length 训练,硬件门槛很高,中小团队复现成本较大
  • stars 较少且项目较新,稳定性、长期维护和 issue 响应能力仍需观察
  • 仓库描述、topics、license 元数据缺失,不利于快速判断成熟度
  • MCP-Atlas 环境来自外部 benchmark 的适配版本,需要注意原始项目许可、数据使用条款和兼容性
  • 公开数据只有第一轮 1312 条,覆盖范围窄,难以保证对其他 Agent 场景的直接泛化
  • 如果用于生产模型训练,需要额外验证模型在真实业务任务上的收益,而不能只看 benchmark 分数
  • 自动合成数据质量高度依赖评测器可读性、环境可执行性以及过滤逻辑,复杂 benchmark 可能需要人工干预
  • 使用 LLM-judged benchmark 时,可能出现训练数据针对 judge 偏好而非真实任务能力优化的情况

历史记录

热榜历史快照

2026-07-30 第20名 新收录 · github_search
2026-07-29 第26名 新收录 · github_search
2026-07-28 第28名 新收录 · github_search