Python · 项目报告

Human-Agent-Society/reef

Continual learning infra for self-improving agents

已完成 打开 GitHub
H
268星标
21Fork
47Issue
Apache-2.0许可证

分析结果

项目分析

Reef 是一个面向“可持续自我改进 AI Agent”的后端基础设施项目,核心能力是把在线推理、交互记录、反馈收集、训练更新、评估发布和版本管理串成闭环。它提供 OpenAI/Anthropic 兼容的 HTTP 推理接口,Agent 可以像调用模型服务一样把请求发给 Reef;同时,Reef 会记录交互、接收评分或反馈,并根据配置的 recipe 对模型权重或 Agent harness(规则、技能、提示词、配置、扩展等)进行持续优化。项目使用 Python 开发,Apache-2.0 许可,适合研究和搭建自进化 Agent 系统。

适用领域 大模型基础设施 / AI Agent / 持续学习 / 强化学习 / 在线推理服务 / LLM 训练 / Agent Harness 演化 / 模型版本管理 / 自动反馈闭环系统 / MLOps / LLMOps
配置难度 高。该项目不是简单的 SDK 或推理服务,而是一个持续学习后端基础设施,涉及 LLM 推理接口、反馈数据建模、训练任务、评估策略、artifact/版本管理、Agent harness 演化和 GPU 部署。具备 Python 后端、LLM 推理、训练框架和 MLOps 经验的团队更适合采用。
商业价值 未知
01

技术亮点

  • 兼容 OpenAI 和 Anthropic 风格接口,降低已有 Agent 接入成本。
  • 将在线推理、反馈收集、训练、评估、发布和版本管理整合为完整闭环。
  • 不仅支持模型权重演化,也支持 Agent harness 演化,包括规则、技能、提示词、配置和扩展。
  • 服务可以在运行过程中同步更新后的权重,无需重启即可让后续请求使用新版本。
  • 内置版本历史和 artifact 管理,便于追踪更新过程。
  • 提供 cookbook recipes,包括 SAO、OpenClawRL、TTTD、SkillClaw 等持续学习方案。
  • 支持基于评分、测试结果、结构化反馈或交互信号进行学习。
  • Apache-2.0 许可,适合商业和研究二次开发。
  • 设计目标比单纯推理框架或训练框架更完整,覆盖 live traffic、training、version management 和 harness evolution。
02

目标用户

  • 正在构建自改进 Agent 的 AI 工程师
  • 需要将在线推理与训练反馈闭环打通的 LLMOps 团队
  • 研究持续学习、强化学习、Agent 演化的科研人员
  • 希望基于真实用户反馈持续优化模型或 Agent 行为的创业团队
  • 需要管理模型权重、Agent 技能、提示词版本的后端开发者
  • 熟悉 Python、HTTP API、LLM 推理和训练部署的高级开发者
03

配置要求

  • Python 版本要求为 3.10+。
  • 需要 git-lfs 支持 artifact 和 checkpoint 管理。
  • 模型权重训练场景通常需要 GPU,具体显存和训练依赖需参考官方 Evolve your model 文档。
  • 需要配置 REEF_TOKEN 作为服务访问令牌。
  • 需要配置 MODEL_PATH,例如 Qwen/Qwen2.5-1.5B-Instruct。
  • 需要准备 recipe 配置文件,例如 recipes/sao/examples/sao/serve.yaml。
  • 客户端调用推理接口时通常需要携带 Authorization: Bearer <REEF_TOKEN>。
  • 多场景隔离或新建场景需要使用 x-reef-scenario 请求头。
  • 反馈上报需要保存 Reef 返回的 x-reef-agent-record-id,并通过 /reef/report 提交 score、feedback 和 references。
  • 不同 recipe 有不同输入数据、反馈格式、训练频率、评估和发布策略,需要单独配置。
04

适用场景

  • 将 Reef 作为 OpenAI/Anthropic 兼容的推理代理层,统一接收 Agent 请求并记录交互数据
  • 根据用户评分、测试结果、验证器结果等反馈,自动触发训练步骤以优化模型权重
  • 为代码 Agent、任务执行 Agent 或自动化工具演化 harness,例如提示词、规则、技能池和配置
  • 构建可在线更新的模型服务,在不重启服务的情况下同步新版本权重
  • 对候选模型或候选 harness 进行评估,只有新版本表现更好时才发布
  • 研究 SAO、OpenClawRL、TTTD、SkillClaw 等不同持续学习 recipe 的效果
  • 在企业内部搭建可审计、有版本历史的 Agent 改进系统
05

部署与配置

  • 安装 Python 3.10 或更高版本。
  • 安装 uv 包管理工具,项目 README 推荐使用 uv 管理虚拟环境和依赖。
  • 如需使用 artifact 和 checkpoint 功能,需要安装系统级 git-lfs,并执行 git lfs install。
  • 从 PyPI 安装:运行 uv venv && source .venv/bin/activate,然后执行 uv pip install reef-infra。
  • 验证安装:运行 python3 -c "import reef; print(reef.__version__)"。
  • 如需开发或运行训练示例,建议从源码安装:git clone https://github.com/Human-Agent-Society/reef.git,进入目录后运行 uv pip install -e .。
  • 运行 SAO 等训练示例时,需要根据文档安装额外依赖,例如 uv pip install -e ".[slime]" && uv pip install --no-deps --group runtime。
  • 配置 MODEL_PATH、REEF_TOKEN 等环境变量后,可使用 reef serve -c recipes/sao/examples/sao/serve.yaml 启动服务。
  • 通过 curl http://127.0.0.1:8900/healthz 检查服务是否正常启动。
06

风险与注意事项

  • 项目相对新,GitHub stars 为 268,生态成熟度和生产案例可能有限。
  • 持续学习和在线自我改进系统复杂度高,错误的反馈或评估机制可能导致模型或 Agent 行为退化。
  • 训练权重需要 GPU 和较复杂的运行环境,对中小团队有一定资源门槛。
  • recipe 配置、反馈 schema、版本发布策略需要深入理解,初学者上手难度较高。
  • 如果直接处理真实用户请求,需要额外考虑隐私、数据合规、日志脱敏和安全审计。
  • 在线更新模型或 harness 可能引入不可预期行为,生产环境应设置严格的评估、回滚和灰度机制。
  • 部分 cookbook recipes 不随 PyPI wheel 发布,开发或训练示例通常需要源码 checkout。
  • 依赖外部文档和 GPU 训练栈,部署稳定性取决于底层推理、训练框架和模型兼容性。

历史记录

热榜历史快照

2026-09-04 第29名 新收录 · github_search