RealReplicaBench 是阿里国际 Accio 团队维护的长周期智能体评测基准,用于测试 AI Agent 在高保真、可复现、具备状态变化的真实在线服务副本中完成业务流程的能力。它覆盖电商、物流、SaaS、文档、表格、浏览器操作、CLI、API/MCP 等场景,共 107 个任务,并通过容器隔离、确定性或 LLM 辅助验证器记录可审计结果。该项目适合用于评估通用大模型、浏览器 Agent、企业流程自动化 Agent 和多模态 Agent 的真实业务执行能力。
适用领域
AI Agent 评测 / 大模型基准测试 / 浏览器自动化 / 电商业务流程 / 跨境贸易 / 物流与供应链 / SaaS 模拟环境 / API/MCP 工作流 / 文档与表格生成 / 多模态智能体
配置难度
中高。单任务 smoke test 可以较快跑通,但完整理解和复现需要熟悉 Python 包安装、Docker amd64 镜像、模型 Provider 配置、OpenClaw harness、LLM judge、浏览器自动化和评测结果分析。对于有 Agent 评测经验的团队难度中等;对于普通应用开发者难度偏高。
商业价值
该项目的商业价值主要在于帮助模型厂商、Agent 平台和企业自动化团队评估 AI Agent 在真实商业流程中的可用性,而不仅是聊天或单步工具调用能力。对跨境电商、供应链、商品发布、物流预订、店铺运营和企业 SaaS 自动化场景尤其有参考意义。它可以作为模型选型、Agent 发布前质量门禁、内部 Benchmark、客户演示和竞品分析工具,帮助团队发现长周期任务规划、状态维护、网页交互、文件处理和 API 调用中的薄弱环节。
01
技术亮点
- 任务贴近真实业务,而不是简单问答,重点评估 Agent 是否能完成状态改变。
- 包含 107 个任务,覆盖 53 个 CLI、28 个浏览器、16 个文件、10 个 API/MCP 任务。
- 任务按能力切片:65 个纯文本任务、20 个浏览器文本能力任务、22 个视觉必需任务。
- 使用本地 mock 服务模拟 SaaS、电商、消息、文档和运营系统,不需要真实生产账号。
- 每个任务在全新容器中运行,增强隔离性和可复现性。
- 每次运行保留 resolved config、trajectory、verifier result、artifacts、logs 和 container metadata,方便审计。
- 提供公开 leaderboard,可对比多个模型家族在 OpenClaw 和 Accio harness 下的表现。
- 基准关注长周期任务规划、工具调用、浏览器操作、文件处理和 API 操作等综合能力。
- Apache-2.0 许可证,便于研究和商业团队集成使用。
- 由阿里国际 Accio 团队维护,面向跨境电商和商业智能体场景具有较强行业相关性。
02
目标用户
- 大模型研发团队
- AI Agent 框架开发者
- 浏览器 Agent 或 RPA Agent 开发者
- 企业自动化产品团队
- 电商和跨境贸易 AI 应用团队
- 模型评测与 Benchmark 团队
- 研究长周期任务规划和工具调用能力的科研人员
- 希望对比 Claude、GPT、Gemini、Qwen、DeepSeek、GLM 等模型 Agent 能力的开发者
03
配置要求
- Docker,需要支持 Linux 容器,官方示例使用 linux/amd64 平台。
- Python >= 3.11。
- 需要模型 API Key,例如 Gemini、OpenAI、Anthropic 或其他配置文件支持的 Provider。
- 需要 LLM Judge API Key,README 示例中使用 Gemini judge,模型为 gemini-3.1-pro-preview。
- 需要拉取指定 OpenClaw runtime Docker 镜像,镜像包含 OpenClaw 2026.5.22、浏览器栈和隔离 mock 服务。
- 需要选择 configs/ 目录下对应 Provider 路由配置文件,例如 realreplicabench_openclaw_native_google_direct.yaml。
- 如果运行视觉任务,需要配置支持图像输入的模型参数,例如 --openclaw-image-model。
- 完整评测成本较高,需要预留充足 API token、运行时间、磁盘空间和容器资源。
- Apple Silicon 机器可通过 amd64 模拟运行,但性能可能下降。
04
适用场景
- 评估模型在长周期、多步骤业务任务中的完成率
- 测试浏览器操作型 Agent 是否能完成真实风格的电商后台、物流预订、商品发布等流程
- 比较不同模型在 CLI、浏览器、文件、API/MCP 任务上的能力差异
- 构建企业内部 Agent 发布前的回归测试集
- 分析 Agent 的工具调用轨迹、日志、容器状态和验证器结果
- 验证多模态模型在需要视觉理解的网页操作任务中的表现
- 作为跨境电商、供应链、SaaS 自动化场景的研究基准
- 为模型供应商提供私有模型或预发布模型的第三方评测依据
05
部署与配置
- 确认本机支持 Docker Linux 容器,推荐 linux/amd64;Apple Silicon 可使用模拟运行。
- 安装 Python 3.11 或更高版本。
- 克隆仓库:git clone https://github.com/Accio-Lab/RealReplicaBench.git
- 进入项目目录:cd RealReplicaBench
- 创建虚拟环境:python3 -m venv .venv
- 激活虚拟环境:source .venv/bin/activate
- 以可编辑模式安装:python -m pip install -e .
- 验证命令是否可用:real-replica-bench list
- 拉取固定 digest 的 OpenClaw 运行镜像:docker pull --platform linux/amd64 acciolyk/accio_bench@sha256:1e9cf5c72a56794175b7d06ece036b92e296e6b7e9e9a7fa244026f6acea3859
- 配置模型 API Key,例如 export GEMINI_API_KEY="..."。
- 运行单个任务进行 smoke test,例如使用 real-replica-bench run api-amazon-margin-floor-audit 并指定 harness、镜像、模型、judge 模型和 run-id。
- 运行完整集合时可使用 configs/realreplicabench_openclaw_native_google_direct.yaml,并建议先加 --limit 1 测试批处理路径。
06
风险与注意事项
- README 明确说明原始 task-level result bundles 未存储在 Git 中,也尚无公开不可变 URL 或 checksum,因此 leaderboard 不是完整可独立复现包。
- 完整运行 107 个任务会消耗大量模型 token,参考结果中单任务平均 token 可达百万级,成本可能较高。
- 部分验证依赖 LLM-assisted verifier,结果可能受 judge 模型版本、提示词和 Provider 行为影响。
- Docker 镜像依赖外部仓库和固定 digest,如果镜像不可访问会影响安装和复现。
- 项目语言标记为 HTML,但实际运行依赖 Python、Docker、OpenClaw 和复杂配置,对新手不算轻量。
- README 中部分模型名称和版本属于未来或预览风格命名,开发者应确认当前配置文件实际支持的 Provider 和模型。
- Apple Silicon 通过 amd64 模拟可能带来性能损耗或兼容性问题。
- 长周期浏览器任务可能受超时、网络、API 限流、模型输出不稳定影响。
- 若企业内部使用,需要评估 API Key、日志、轨迹和任务数据的安全与合规问题。
2026-08-09
第6名
新收录 · github_search
2026-08-08
第9名
新收录 · github_search
2026-08-07
第10名
新收录 · github_search
2026-08-06
第11名
新收录 · github_search