LongHorizon-Harness 是一个面向“长周期电脑使用任务”的 AI Agent 执行与状态管理框架。它不训练新模型,也不替代 Claude Code、Codex 等现有 Agent,而是在其上层提供多轮执行、状态持久化、独立审计、失败恢复和进度验证能力,让 Agent 能在桌面 GUI 与命令行之间连续工作数小时甚至更久。项目采用 Manager、Executor、Auditor 三角色架构:Manager 维护目标与已验证状态,Executor 在新上下文中执行单步任务,Auditor 独立检查结果,只有通过验证的进展才写入持久状态。该项目适合研究和工程团队评估、构建更可靠的长任务自动化 Agent。
适用领域
AI Agent / Computer Use Agent / 长周期任务自动化 / 桌面 GUI 自动化 / CLI 自动化 / 代码生成与调试 / 数据分析与可视化 / 办公文档与演示文稿自动化 / DevOps 与系统诊断 / AI Agent Benchmark
配置难度
中高级。基础 CLI 任务的安装和使用相对简单,但如果要稳定运行 GUI 自动化、配置 Claude Code/Codex、处理 macOS 权限、混合多个模型后端或开发自定义 AgentAdapter,则需要较强的 Python、Agent 工具链、系统权限和自动化调试经验。
商业价值
未知
01
技术亮点
- 将长周期任务拆分为 Manager、Executor、Auditor 三个角色,降低单一上下文漂移风险
- Executor 每轮使用 fresh context,避免长上下文累积导致的错误传播
- Auditor 独立验证文件、界面、日志、测试结果,只有验证通过的成果进入持久状态
- 支持桌面 GUI 与 CLI 混合工作流,可跨浏览器、终端、办公软件、设计软件等场景执行任务
- 与 Claude Code、Codex 原生集成,也支持自定义 AgentAdapter
- 支持不同角色使用不同模型或后端,有利于在质量、速度和成本之间平衡
- 提供 lh-harness doctor 进行环境诊断
- MIT License,便于研究和商业项目二次开发
- 官方宣称在 WeaveBench、OSWorld 2.0、Terminal-Bench 2.1 上相较基础 Claude Code 后端取得明显提升
- 项目有中文 README 和微信群,对中文开发者较友好
02
目标用户
- AI Agent 研究人员
- 使用 Claude Code 或 Codex 的开发者
- 希望让 AI 自动完成复杂桌面/命令行任务的工程团队
- 自动化测试与基准评测研究者
- 需要跨应用、跨工具链自动化流程的企业研发团队
- 关注 Computer Use Agent、GUI Agent、Long-Horizon Agent 的开发者
03
配置要求
- Python >= 3.10
- 推荐 uv;也支持 pip 安装
- 至少一个 Agent 后端:Claude Code 或 Codex CLI
- 需要将 claude 或 codex 命令加入 PATH
- GUI 任务需要安装 computer-use 插件
- open-computer-use 插件需要 Node.js >= 20
- macOS GUI 自动化需要手动授予系统权限
- 当前主要在 macOS 上测试;Windows 支持存在但尚未充分验证
- 不同角色 Manager、Executor、Auditor 可以配置为不同模型或不同 Agent 后端
- 如接入自定义 Agent,需要实现 AgentAdapter;如接入自定义环境,需要实现 Environment 协议
04
适用场景
- 让 AI Agent 连续完成复杂代码修改、运行测试、修复失败并产出最终结果
- 在浏览器、终端、文件系统、办公软件之间切换完成端到端工作流
- 执行长时间数据处理、图表生成、结果校验和报告整理
- 自动诊断日志、网络、服务异常并尝试修复系统配置问题
- 操作桌面软件完成文档、幻灯片、图片、设计稿或 3D 相关任务
- 作为 Claude Code、Codex 等 Agent 后端的可靠性增强层
- 复现实验论文中的 WeaveBench、OSWorld 2.0、Terminal-Bench 2.1 等长任务评测
- 构建自定义 AgentAdapter 或 Environment,将内部 Agent 接入统一长任务执行框架
05
部署与配置
- 安装 Python 3.10 或更高版本。
- 推荐安装 uv;如果不使用 uv,也可以直接使用 pip。
- 安装至少一个 Agent 运行时,并确保其在 PATH 中可用:codex 或 claude。
- 安装 LongHorizon-Harness:uv tool install lh-harness;或使用 pip install lh-harness。
- 如果需要 GUI 操作,根据 Agent 安装 computer-use 插件:Codex 使用 lh-harness plugin install codex-computer-use;Claude Code 或混合使用可安装 lh-harness plugin install open-computer-use。
- 如果使用 npm 分发的 open-computer-use 插件,需要 Node.js 20 或更高版本。
- 在 macOS 上手动授予插件所需的系统权限,例如辅助功能、屏幕录制等。
- 运行 lh-harness doctor 检查 Python、Agent 后端、插件、系统权限等环境配置是否完整。
- 在目标项目目录中启动任务,Harness 默认会作用于当前启动目录。
06
风险与注意事项
- 项目仍处于快速迭代早期阶段,版本号较低,API 和配置方式可能变化
- README 中说明当前主要在 macOS 测试,Windows 虽包含支持但尚未充分验证
- GUI 自动化依赖系统权限和插件,安装与权限配置可能对新手不够友好
- 长周期 Agent 自动操作真实电脑存在误操作、删除文件、泄露敏感信息或执行危险命令的风险
- 依赖外部 Agent 后端和模型,例如 Claude Code、Codex、Qwen/GPT/Claude 等,实际效果受模型能力、额度、网络和费用影响
- 独立审计并不能保证百分百正确,复杂视觉、业务合规或高风险场景仍需人工复核
- 长任务可能消耗大量 token、运行时间和本地计算/网络资源
- Benchmark 结果需要结合具体实验设置理解,不能直接等同于所有真实生产场景中的表现
2026-08-11
第13名
新收录 · github_search
2026-08-10
第18名
新收录 · github_search
2026-08-09
第25名
新收录 · github_search
2026-08-08
第30名
新收录 · github_search