Reef 是一个面向“可持续自我改进 AI Agent”的后端基础设施项目,核心能力是把在线推理、交互记录、反馈收集、训练更新、评估发布和版本管理串成闭环。它提供 OpenAI/Anthropic 兼容的 HTTP 推理接口,Agent 可以像调用模型服务一样把请求发给 Reef;同时,Reef 会记录交互、接收评分或反馈,并根据配置的 recipe 对模型权重或 Agent harness(规则、技能、提示词、配置、扩展等)进行持续优化。项目使用 Python 开发,Apache-2.0 许可,适合研究和搭建自进化 Agent 系统。
适用领域
大模型基础设施 / AI Agent / 持续学习 / 强化学习 / 在线推理服务 / LLM 训练 / Agent Harness 演化 / 模型版本管理 / 自动反馈闭环系统 / MLOps / LLMOps
配置难度
高。该项目不是简单的 SDK 或推理服务,而是一个持续学习后端基础设施,涉及 LLM 推理接口、反馈数据建模、训练任务、评估策略、artifact/版本管理、Agent harness 演化和 GPU 部署。具备 Python 后端、LLM 推理、训练框架和 MLOps 经验的团队更适合采用。
商业价值
未知
01
技术亮点
- 兼容 OpenAI 和 Anthropic 风格接口,降低已有 Agent 接入成本。
- 将在线推理、反馈收集、训练、评估、发布和版本管理整合为完整闭环。
- 不仅支持模型权重演化,也支持 Agent harness 演化,包括规则、技能、提示词、配置和扩展。
- 服务可以在运行过程中同步更新后的权重,无需重启即可让后续请求使用新版本。
- 内置版本历史和 artifact 管理,便于追踪更新过程。
- 提供 cookbook recipes,包括 SAO、OpenClawRL、TTTD、SkillClaw 等持续学习方案。
- 支持基于评分、测试结果、结构化反馈或交互信号进行学习。
- Apache-2.0 许可,适合商业和研究二次开发。
- 设计目标比单纯推理框架或训练框架更完整,覆盖 live traffic、training、version management 和 harness evolution。
02
目标用户
- 正在构建自改进 Agent 的 AI 工程师
- 需要将在线推理与训练反馈闭环打通的 LLMOps 团队
- 研究持续学习、强化学习、Agent 演化的科研人员
- 希望基于真实用户反馈持续优化模型或 Agent 行为的创业团队
- 需要管理模型权重、Agent 技能、提示词版本的后端开发者
- 熟悉 Python、HTTP API、LLM 推理和训练部署的高级开发者
03
配置要求
- Python 版本要求为 3.10+。
- 需要 git-lfs 支持 artifact 和 checkpoint 管理。
- 模型权重训练场景通常需要 GPU,具体显存和训练依赖需参考官方 Evolve your model 文档。
- 需要配置 REEF_TOKEN 作为服务访问令牌。
- 需要配置 MODEL_PATH,例如 Qwen/Qwen2.5-1.5B-Instruct。
- 需要准备 recipe 配置文件,例如 recipes/sao/examples/sao/serve.yaml。
- 客户端调用推理接口时通常需要携带 Authorization: Bearer <REEF_TOKEN>。
- 多场景隔离或新建场景需要使用 x-reef-scenario 请求头。
- 反馈上报需要保存 Reef 返回的 x-reef-agent-record-id,并通过 /reef/report 提交 score、feedback 和 references。
- 不同 recipe 有不同输入数据、反馈格式、训练频率、评估和发布策略,需要单独配置。
04
适用场景
- 将 Reef 作为 OpenAI/Anthropic 兼容的推理代理层,统一接收 Agent 请求并记录交互数据
- 根据用户评分、测试结果、验证器结果等反馈,自动触发训练步骤以优化模型权重
- 为代码 Agent、任务执行 Agent 或自动化工具演化 harness,例如提示词、规则、技能池和配置
- 构建可在线更新的模型服务,在不重启服务的情况下同步新版本权重
- 对候选模型或候选 harness 进行评估,只有新版本表现更好时才发布
- 研究 SAO、OpenClawRL、TTTD、SkillClaw 等不同持续学习 recipe 的效果
- 在企业内部搭建可审计、有版本历史的 Agent 改进系统
05
部署与配置
- 安装 Python 3.10 或更高版本。
- 安装 uv 包管理工具,项目 README 推荐使用 uv 管理虚拟环境和依赖。
- 如需使用 artifact 和 checkpoint 功能,需要安装系统级 git-lfs,并执行 git lfs install。
- 从 PyPI 安装:运行 uv venv && source .venv/bin/activate,然后执行 uv pip install reef-infra。
- 验证安装:运行 python3 -c "import reef; print(reef.__version__)"。
- 如需开发或运行训练示例,建议从源码安装:git clone https://github.com/Human-Agent-Society/reef.git,进入目录后运行 uv pip install -e .。
- 运行 SAO 等训练示例时,需要根据文档安装额外依赖,例如 uv pip install -e ".[slime]" && uv pip install --no-deps --group runtime。
- 配置 MODEL_PATH、REEF_TOKEN 等环境变量后,可使用 reef serve -c recipes/sao/examples/sao/serve.yaml 启动服务。
- 通过 curl http://127.0.0.1:8900/healthz 检查服务是否正常启动。
06
风险与注意事项
- 项目相对新,GitHub stars 为 268,生态成熟度和生产案例可能有限。
- 持续学习和在线自我改进系统复杂度高,错误的反馈或评估机制可能导致模型或 Agent 行为退化。
- 训练权重需要 GPU 和较复杂的运行环境,对中小团队有一定资源门槛。
- recipe 配置、反馈 schema、版本发布策略需要深入理解,初学者上手难度较高。
- 如果直接处理真实用户请求,需要额外考虑隐私、数据合规、日志脱敏和安全审计。
- 在线更新模型或 harness 可能引入不可预期行为,生产环境应设置严格的评估、回滚和灰度机制。
- 部分 cookbook recipes 不随 PyPI wheel 发布,开发或训练示例通常需要源码 checkout。
- 依赖外部文档和 GPU 训练栈,部署稳定性取决于底层推理、训练框架和模型兼容性。
2026-09-04
第29名
新收录 · github_search