Python · 项目报告

AMAP-ML/LongHorizon-Harness

The long-horizon computer-use harness. Run AI agents across desktop apps and the CLI for extended periods while preserving task state and making reliable progress on complex workflows. Features fresh-context execution, durable verified state, independent auditing, recoverable progress, and native Claude Code / Codex / OpenClaw integration.

已完成 打开 GitHub
A
544星标
66Fork
9Issue
MIT许可证

分析结果

项目分析

LongHorizon-Harness 是一个面向“长周期电脑使用任务”的 AI Agent 执行与状态管理框架。它不训练新模型,也不替代 Claude Code、Codex 等现有 Agent,而是在其上层提供多轮执行、状态持久化、独立审计、失败恢复和进度验证能力,让 Agent 能在桌面 GUI 与命令行之间连续工作数小时甚至更久。项目采用 Manager、Executor、Auditor 三角色架构:Manager 维护目标与已验证状态,Executor 在新上下文中执行单步任务,Auditor 独立检查结果,只有通过验证的进展才写入持久状态。该项目适合研究和工程团队评估、构建更可靠的长任务自动化 Agent。

适用领域 AI Agent / Computer Use Agent / 长周期任务自动化 / 桌面 GUI 自动化 / CLI 自动化 / 代码生成与调试 / 数据分析与可视化 / 办公文档与演示文稿自动化 / DevOps 与系统诊断 / AI Agent Benchmark
配置难度 中高级。基础 CLI 任务的安装和使用相对简单,但如果要稳定运行 GUI 自动化、配置 Claude Code/Codex、处理 macOS 权限、混合多个模型后端或开发自定义 AgentAdapter,则需要较强的 Python、Agent 工具链、系统权限和自动化调试经验。
商业价值 未知
01

技术亮点

  • 将长周期任务拆分为 Manager、Executor、Auditor 三个角色,降低单一上下文漂移风险
  • Executor 每轮使用 fresh context,避免长上下文累积导致的错误传播
  • Auditor 独立验证文件、界面、日志、测试结果,只有验证通过的成果进入持久状态
  • 支持桌面 GUI 与 CLI 混合工作流,可跨浏览器、终端、办公软件、设计软件等场景执行任务
  • 与 Claude Code、Codex 原生集成,也支持自定义 AgentAdapter
  • 支持不同角色使用不同模型或后端,有利于在质量、速度和成本之间平衡
  • 提供 lh-harness doctor 进行环境诊断
  • MIT License,便于研究和商业项目二次开发
  • 官方宣称在 WeaveBench、OSWorld 2.0、Terminal-Bench 2.1 上相较基础 Claude Code 后端取得明显提升
  • 项目有中文 README 和微信群,对中文开发者较友好
02

目标用户

  • AI Agent 研究人员
  • 使用 Claude Code 或 Codex 的开发者
  • 希望让 AI 自动完成复杂桌面/命令行任务的工程团队
  • 自动化测试与基准评测研究者
  • 需要跨应用、跨工具链自动化流程的企业研发团队
  • 关注 Computer Use Agent、GUI Agent、Long-Horizon Agent 的开发者
03

配置要求

  • Python >= 3.10
  • 推荐 uv;也支持 pip 安装
  • 至少一个 Agent 后端:Claude Code 或 Codex CLI
  • 需要将 claude 或 codex 命令加入 PATH
  • GUI 任务需要安装 computer-use 插件
  • open-computer-use 插件需要 Node.js >= 20
  • macOS GUI 自动化需要手动授予系统权限
  • 当前主要在 macOS 上测试;Windows 支持存在但尚未充分验证
  • 不同角色 Manager、Executor、Auditor 可以配置为不同模型或不同 Agent 后端
  • 如接入自定义 Agent,需要实现 AgentAdapter;如接入自定义环境,需要实现 Environment 协议
04

适用场景

  • 让 AI Agent 连续完成复杂代码修改、运行测试、修复失败并产出最终结果
  • 在浏览器、终端、文件系统、办公软件之间切换完成端到端工作流
  • 执行长时间数据处理、图表生成、结果校验和报告整理
  • 自动诊断日志、网络、服务异常并尝试修复系统配置问题
  • 操作桌面软件完成文档、幻灯片、图片、设计稿或 3D 相关任务
  • 作为 Claude Code、Codex 等 Agent 后端的可靠性增强层
  • 复现实验论文中的 WeaveBench、OSWorld 2.0、Terminal-Bench 2.1 等长任务评测
  • 构建自定义 AgentAdapter 或 Environment,将内部 Agent 接入统一长任务执行框架
05

部署与配置

  • 安装 Python 3.10 或更高版本。
  • 推荐安装 uv;如果不使用 uv,也可以直接使用 pip。
  • 安装至少一个 Agent 运行时,并确保其在 PATH 中可用:codex 或 claude。
  • 安装 LongHorizon-Harness:uv tool install lh-harness;或使用 pip install lh-harness。
  • 如果需要 GUI 操作,根据 Agent 安装 computer-use 插件:Codex 使用 lh-harness plugin install codex-computer-use;Claude Code 或混合使用可安装 lh-harness plugin install open-computer-use。
  • 如果使用 npm 分发的 open-computer-use 插件,需要 Node.js 20 或更高版本。
  • 在 macOS 上手动授予插件所需的系统权限,例如辅助功能、屏幕录制等。
  • 运行 lh-harness doctor 检查 Python、Agent 后端、插件、系统权限等环境配置是否完整。
  • 在目标项目目录中启动任务,Harness 默认会作用于当前启动目录。
06

风险与注意事项

  • 项目仍处于快速迭代早期阶段,版本号较低,API 和配置方式可能变化
  • README 中说明当前主要在 macOS 测试,Windows 虽包含支持但尚未充分验证
  • GUI 自动化依赖系统权限和插件,安装与权限配置可能对新手不够友好
  • 长周期 Agent 自动操作真实电脑存在误操作、删除文件、泄露敏感信息或执行危险命令的风险
  • 依赖外部 Agent 后端和模型,例如 Claude Code、Codex、Qwen/GPT/Claude 等,实际效果受模型能力、额度、网络和费用影响
  • 独立审计并不能保证百分百正确,复杂视觉、业务合规或高风险场景仍需人工复核
  • 长任务可能消耗大量 token、运行时间和本地计算/网络资源
  • Benchmark 结果需要结合具体实验设置理解,不能直接等同于所有真实生产场景中的表现

历史记录

热榜历史快照

2026-08-11 第13名 新收录 · github_search
2026-08-10 第18名 新收录 · github_search
2026-08-09 第25名 新收录 · github_search
2026-08-08 第30名 新收录 · github_search