HTML · 项目报告

Accio-org/RealReplicaBench

RealReplicaBench: Benchmarking Long-Horizon Agents in High-Fidelity, Stateful, and Reproducible Replicas of Real Online Services

已完成 打开 GitHub
A
1,040星标
80Fork
3Issue
Apache-2.0许可证

分析结果

项目分析

RealReplicaBench 是阿里国际 Accio 团队维护的长周期智能体评测基准,用于测试 AI Agent 在高保真、可复现、具备状态变化的真实在线服务副本中完成业务流程的能力。它覆盖电商、物流、SaaS、文档、表格、浏览器操作、CLI、API/MCP 等场景,共 107 个任务,并通过容器隔离、确定性或 LLM 辅助验证器记录可审计结果。该项目适合用于评估通用大模型、浏览器 Agent、企业流程自动化 Agent 和多模态 Agent 的真实业务执行能力。

适用领域 AI Agent 评测 / 大模型基准测试 / 浏览器自动化 / 电商业务流程 / 跨境贸易 / 物流与供应链 / SaaS 模拟环境 / API/MCP 工作流 / 文档与表格生成 / 多模态智能体
配置难度 中高。单任务 smoke test 可以较快跑通,但完整理解和复现需要熟悉 Python 包安装、Docker amd64 镜像、模型 Provider 配置、OpenClaw harness、LLM judge、浏览器自动化和评测结果分析。对于有 Agent 评测经验的团队难度中等;对于普通应用开发者难度偏高。
商业价值 该项目的商业价值主要在于帮助模型厂商、Agent 平台和企业自动化团队评估 AI Agent 在真实商业流程中的可用性,而不仅是聊天或单步工具调用能力。对跨境电商、供应链、商品发布、物流预订、店铺运营和企业 SaaS 自动化场景尤其有参考意义。它可以作为模型选型、Agent 发布前质量门禁、内部 Benchmark、客户演示和竞品分析工具,帮助团队发现长周期任务规划、状态维护、网页交互、文件处理和 API 调用中的薄弱环节。
01

技术亮点

  • 任务贴近真实业务,而不是简单问答,重点评估 Agent 是否能完成状态改变。
  • 包含 107 个任务,覆盖 53 个 CLI、28 个浏览器、16 个文件、10 个 API/MCP 任务。
  • 任务按能力切片:65 个纯文本任务、20 个浏览器文本能力任务、22 个视觉必需任务。
  • 使用本地 mock 服务模拟 SaaS、电商、消息、文档和运营系统,不需要真实生产账号。
  • 每个任务在全新容器中运行,增强隔离性和可复现性。
  • 每次运行保留 resolved config、trajectory、verifier result、artifacts、logs 和 container metadata,方便审计。
  • 提供公开 leaderboard,可对比多个模型家族在 OpenClaw 和 Accio harness 下的表现。
  • 基准关注长周期任务规划、工具调用、浏览器操作、文件处理和 API 操作等综合能力。
  • Apache-2.0 许可证,便于研究和商业团队集成使用。
  • 由阿里国际 Accio 团队维护,面向跨境电商和商业智能体场景具有较强行业相关性。
02

目标用户

  • 大模型研发团队
  • AI Agent 框架开发者
  • 浏览器 Agent 或 RPA Agent 开发者
  • 企业自动化产品团队
  • 电商和跨境贸易 AI 应用团队
  • 模型评测与 Benchmark 团队
  • 研究长周期任务规划和工具调用能力的科研人员
  • 希望对比 Claude、GPT、Gemini、Qwen、DeepSeek、GLM 等模型 Agent 能力的开发者
03

配置要求

  • Docker,需要支持 Linux 容器,官方示例使用 linux/amd64 平台。
  • Python >= 3.11。
  • 需要模型 API Key,例如 Gemini、OpenAI、Anthropic 或其他配置文件支持的 Provider。
  • 需要 LLM Judge API Key,README 示例中使用 Gemini judge,模型为 gemini-3.1-pro-preview。
  • 需要拉取指定 OpenClaw runtime Docker 镜像,镜像包含 OpenClaw 2026.5.22、浏览器栈和隔离 mock 服务。
  • 需要选择 configs/ 目录下对应 Provider 路由配置文件,例如 realreplicabench_openclaw_native_google_direct.yaml。
  • 如果运行视觉任务,需要配置支持图像输入的模型参数,例如 --openclaw-image-model。
  • 完整评测成本较高,需要预留充足 API token、运行时间、磁盘空间和容器资源。
  • Apple Silicon 机器可通过 amd64 模拟运行,但性能可能下降。
04

适用场景

  • 评估模型在长周期、多步骤业务任务中的完成率
  • 测试浏览器操作型 Agent 是否能完成真实风格的电商后台、物流预订、商品发布等流程
  • 比较不同模型在 CLI、浏览器、文件、API/MCP 任务上的能力差异
  • 构建企业内部 Agent 发布前的回归测试集
  • 分析 Agent 的工具调用轨迹、日志、容器状态和验证器结果
  • 验证多模态模型在需要视觉理解的网页操作任务中的表现
  • 作为跨境电商、供应链、SaaS 自动化场景的研究基准
  • 为模型供应商提供私有模型或预发布模型的第三方评测依据
05

部署与配置

  • 确认本机支持 Docker Linux 容器,推荐 linux/amd64;Apple Silicon 可使用模拟运行。
  • 安装 Python 3.11 或更高版本。
  • 克隆仓库:git clone https://github.com/Accio-Lab/RealReplicaBench.git
  • 进入项目目录:cd RealReplicaBench
  • 创建虚拟环境:python3 -m venv .venv
  • 激活虚拟环境:source .venv/bin/activate
  • 以可编辑模式安装:python -m pip install -e .
  • 验证命令是否可用:real-replica-bench list
  • 拉取固定 digest 的 OpenClaw 运行镜像:docker pull --platform linux/amd64 acciolyk/accio_bench@sha256:1e9cf5c72a56794175b7d06ece036b92e296e6b7e9e9a7fa244026f6acea3859
  • 配置模型 API Key,例如 export GEMINI_API_KEY="..."。
  • 运行单个任务进行 smoke test,例如使用 real-replica-bench run api-amazon-margin-floor-audit 并指定 harness、镜像、模型、judge 模型和 run-id。
  • 运行完整集合时可使用 configs/realreplicabench_openclaw_native_google_direct.yaml,并建议先加 --limit 1 测试批处理路径。
06

风险与注意事项

  • README 明确说明原始 task-level result bundles 未存储在 Git 中,也尚无公开不可变 URL 或 checksum,因此 leaderboard 不是完整可独立复现包。
  • 完整运行 107 个任务会消耗大量模型 token,参考结果中单任务平均 token 可达百万级,成本可能较高。
  • 部分验证依赖 LLM-assisted verifier,结果可能受 judge 模型版本、提示词和 Provider 行为影响。
  • Docker 镜像依赖外部仓库和固定 digest,如果镜像不可访问会影响安装和复现。
  • 项目语言标记为 HTML,但实际运行依赖 Python、Docker、OpenClaw 和复杂配置,对新手不算轻量。
  • README 中部分模型名称和版本属于未来或预览风格命名,开发者应确认当前配置文件实际支持的 Provider 和模型。
  • Apple Silicon 通过 amd64 模拟可能带来性能损耗或兼容性问题。
  • 长周期浏览器任务可能受超时、网络、API 限流、模型输出不稳定影响。
  • 若企业内部使用,需要评估 API Key、日志、轨迹和任务数据的安全与合规问题。

历史记录

热榜历史快照

2026-08-09 第6名 新收录 · github_search
2026-08-08 第9名 新收录 · github_search
2026-08-07 第10名 新收录 · github_search
2026-08-06 第11名 新收录 · github_search