Python · 项目报告

i3T4AN/KADATH

Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.

已完成 打开 GitHub
I
362星标
4Fork
0Issue
Apache-2.0许可证

分析结果

项目分析

KADATH 是一个面向 LLM Agent 的进化式多智能体运行时框架。它不是只优化一次提示词,而是围绕用户设定的目标,自动生成可衡量的 benchmark,让一组 Agent 在多个 epoch 中竞争、被评分、变异、繁殖和淘汰,从而逐步筛选出更擅长完成目标的 Agent。每个 Agent 的“基因组”包含系统提示词、Python 实现、工具、依赖和支持文件;而评分、调度、隔离、证据冻结、谱系和运行控制由不可进化的 kernel 管理。项目使用 Python,依赖 Docker 化的 PostgreSQL、MinIO、LiteLLM、SearXNG 等服务,并通过 OpenAI 模型驱动 Architect、Organism、Grader、Tweaker、Birther 等角色。

适用领域 LLM Agent 框架 / 多智能体系统 / Agent 评估与基准测试 / 进化算法 / 遗传算法 / 自动化提示词与 Agent 优化 / AI 研究基础设施 / 自主智能体实验平台 / 可复现实验与证据审计
配置难度 高。该项目不是普通 Python 库,而是一个完整的 Agent 演化实验平台。使用者需要理解 LLM Agent、benchmark 设计、Docker 服务编排、模型 API 成本控制、容器隔离、证据审计和多代实验参数。对于熟悉 Python 和 Docker 的开发者可以按脚本启动体验,但要稳定用于研究或业务优化,需要较强工程能力。
商业价值 中高。KADATH 对需要持续优化 Agent 表现的团队有较大研究和原型价值,尤其适合 Agent 评估平台、自动化研究助手、企业内部任务代理竞赛、提示词/Agent 策略搜索等场景。它的价值在于把 Agent 优化从手工试 prompt 提升到可追踪、可复现、可比较的进化过程。不过短期生产价值受限于成本、复杂度、benchmark 可靠性和过拟合风险,更适合作为研发基础设施或高价值任务的优化工具,而不是低成本通用 Agent 运行框架。
01

技术亮点

  • 核心设计清晰地区分 kernel 和 organisms:Agent 可以演化自己的 prompt、代码和工具定义,但不能修改评分、调度、谱系和隔离规则。
  • 强调可复现性:目标、benchmark、工具清单、运行配置、Git tree、prompt 和 runtime signature 都会被锁定和校验。
  • 具备完整证据链:保留候选输出、工作区文件、artifact、浏览器产物、worker 输出、模型调用 trace、工具 trace、崩溃状态和身份元数据。
  • 评分机制较严谨:Grader 负责从证据中抽取事实,最终分数由 kernel 根据锁定公式计算,避免 Agent 自评分污染结果。
  • 支持多代进化:种群经过评分、选择、变异、繁殖和淘汰,适合研究 Agent 能否在固定 benchmark 下持续提升。
  • 工具隔离和安全边界较多:只读 genome、独立容器、私有浏览器 profile、受控 HTTP 访问、worker 并发限制、私网地址拦截等。
  • 支持临时 worker:Agent 可以把子问题委派给受限的临时 worker,但 worker 不参与遗传,也不能修改父 Agent。
  • README 展示了一个 10 个 epoch 中 top-five fitness 明显提升的实验案例,说明作者已做过概念验证。
  • Apache-2.0 许可证,对商业和二次开发相对友好。
02

目标用户

  • 研究 LLM Agent、Agent Swarm、多智能体协作的 AI 研究人员
  • 希望系统化评估和优化 Agent 表现的开发者
  • 做 Agent 产品原型、自动化任务代理或内部 AI 工具的团队
  • 需要对 Agent 运行过程、证据、评分、谱系进行审计的工程团队
  • 熟悉 Docker、Python、LLM API 和实验型 AI 框架的高级开发者
  • 探索自进化 Agent、自动 benchmark 生成、Agent 竞争选择机制的创业团队或实验室
03

配置要求

  • 必须配置 OpenAI API Key。
  • 需要指定 OpenAI 模型 ID,用于多个内部角色和 Agent 执行。
  • 需要 Docker 环境,因为项目依赖 PostgreSQL、MinIO、LiteLLM、SearXNG、浏览器/worker 等容器服务。
  • 首次启动会在本地生成配置并保存到 .kadath/config.env,文件采用 owner-only 权限。
  • 需要足够的磁盘空间保存运行数据库、对象存储、Agent 工作区、冻结证据、模型调用 trace 和 Git 谱系。
  • 需要较高的 LLM token 预算;README 明确提到会消耗大量模型 token。
  • 如果启用浏览器能力,需要 Playwright/Chromium 相关容器正常运行。
  • 如果目标需要外部网络检索,需要允许本地 SearXNG 和受控 HTTP/HTTPS 访问。
  • 运行参数包括目标、epoch 时长、种群规模、epoch 数量,这些会显著影响成本和耗时。
  • benchmark 一旦批准会锁定目标、工具清单、运行配置和 Architect 输出,后续修改会导致运行停止而不是静默改变实验。
04

适用场景

  • 针对特定目标自动演化出更好的 Agent,例如信息检索、报告生成、代码任务、网页研究等
  • 比较不同 Agent prompt、工具组合、实现策略在同一锁定 benchmark 下的表现
  • 构建可复现的 Agent 评估实验,保留模型调用、工具调用、工作区文件和评分证据
  • 研究遗传算法与 LLM Agent 结合的效果,包括变异、繁殖、选择和代际进步
  • 为企业内部任务设计代理竞赛,让多个 Agent 尝试解决同一问题并自动排名
  • 测试 Agent 在带浏览器、搜索、HTTP、临时 worker 等工具环境中的任务执行能力
  • 生成和维护 Agent 谱系,观察哪些 prompt、代码结构或工具策略带来性能提升
05

部署与配置

  • 准备本地环境:安装 Docker / Docker Compose,确保可以运行容器化服务。
  • 准备 Python / shell 运行环境,项目主要通过仓库中的 ./kadath.sh 启动。
  • 克隆仓库:git clone https://github.com/i3T4AN/KADATH.git && cd KADATH。
  • 运行启动脚本:./kadath.sh。
  • 首次启动时,根据交互式终端界面输入 OpenAI API Key。
  • 选择或填写用于 Architect、Organism、Grader、Tweaker、Birther 的 OpenAI 模型 ID。
  • 等待首次启动自动生成本地 PostgreSQL、MinIO、LiteLLM、SearXNG 等服务密钥并准备 Docker 镜像。
  • 通过 CLI 创建新 run:输入目标、epoch 时长、种群规模和 epoch 数量。
  • 审查 Architect 自动生成的 benchmark,包括评分范围、rubric、证据要求、反作弊规则、工具权限和限制。
  • 确认 benchmark 后开始运行,系统会执行多代 Agent 竞争、评分、选择和变异。
06

风险与注意事项

  • LLM API 成本可能非常高;项目定位就是通过大量 token 进行多代演化。
  • 系统复杂度高,包含多个容器服务、数据库、对象存储、模型网关、浏览器、worker 和 Git 谱系,部署和排障门槛较高。
  • 依赖 OpenAI API 和模型质量,评分、benchmark 生成和变异效果都会受模型能力影响。
  • 自动生成 benchmark 虽有严格契约,但对于难以客观测量的真实业务目标,仍可能只能得到代理指标,存在偏差。
  • Agent 演化可能过拟合锁定 benchmark,而不一定泛化到真实生产场景。
  • 项目 stars 较多但 forks 很少,可能仍处在早期实验阶段,社区生态和生产案例有限。
  • README 中大量功能涉及隔离和安全控制,但实际安全性仍需代码审计,尤其是容器权限、网络访问、密钥脱敏和文件边界。
  • 运行周期长、资源占用高,不适合轻量级 Agent 原型或低成本验证。
  • 如果企业环境需要私有模型、内部工具或本地部署,需要评估 LiteLLM 兼容性和配置改造成本。

历史记录

热榜历史快照

2026-08-14 第29名 新收录 · github_search