KADATH 是一个面向 LLM Agent 的进化式多智能体运行时框架。它不是只优化一次提示词,而是围绕用户设定的目标,自动生成可衡量的 benchmark,让一组 Agent 在多个 epoch 中竞争、被评分、变异、繁殖和淘汰,从而逐步筛选出更擅长完成目标的 Agent。每个 Agent 的“基因组”包含系统提示词、Python 实现、工具、依赖和支持文件;而评分、调度、隔离、证据冻结、谱系和运行控制由不可进化的 kernel 管理。项目使用 Python,依赖 Docker 化的 PostgreSQL、MinIO、LiteLLM、SearXNG 等服务,并通过 OpenAI 模型驱动 Architect、Organism、Grader、Tweaker、Birther 等角色。
适用领域
LLM Agent 框架 / 多智能体系统 / Agent 评估与基准测试 / 进化算法 / 遗传算法 / 自动化提示词与 Agent 优化 / AI 研究基础设施 / 自主智能体实验平台 / 可复现实验与证据审计
配置难度
高。该项目不是普通 Python 库,而是一个完整的 Agent 演化实验平台。使用者需要理解 LLM Agent、benchmark 设计、Docker 服务编排、模型 API 成本控制、容器隔离、证据审计和多代实验参数。对于熟悉 Python 和 Docker 的开发者可以按脚本启动体验,但要稳定用于研究或业务优化,需要较强工程能力。
商业价值
中高。KADATH 对需要持续优化 Agent 表现的团队有较大研究和原型价值,尤其适合 Agent 评估平台、自动化研究助手、企业内部任务代理竞赛、提示词/Agent 策略搜索等场景。它的价值在于把 Agent 优化从手工试 prompt 提升到可追踪、可复现、可比较的进化过程。不过短期生产价值受限于成本、复杂度、benchmark 可靠性和过拟合风险,更适合作为研发基础设施或高价值任务的优化工具,而不是低成本通用 Agent 运行框架。
01
技术亮点
- 核心设计清晰地区分 kernel 和 organisms:Agent 可以演化自己的 prompt、代码和工具定义,但不能修改评分、调度、谱系和隔离规则。
- 强调可复现性:目标、benchmark、工具清单、运行配置、Git tree、prompt 和 runtime signature 都会被锁定和校验。
- 具备完整证据链:保留候选输出、工作区文件、artifact、浏览器产物、worker 输出、模型调用 trace、工具 trace、崩溃状态和身份元数据。
- 评分机制较严谨:Grader 负责从证据中抽取事实,最终分数由 kernel 根据锁定公式计算,避免 Agent 自评分污染结果。
- 支持多代进化:种群经过评分、选择、变异、繁殖和淘汰,适合研究 Agent 能否在固定 benchmark 下持续提升。
- 工具隔离和安全边界较多:只读 genome、独立容器、私有浏览器 profile、受控 HTTP 访问、worker 并发限制、私网地址拦截等。
- 支持临时 worker:Agent 可以把子问题委派给受限的临时 worker,但 worker 不参与遗传,也不能修改父 Agent。
- README 展示了一个 10 个 epoch 中 top-five fitness 明显提升的实验案例,说明作者已做过概念验证。
- Apache-2.0 许可证,对商业和二次开发相对友好。
02
目标用户
- 研究 LLM Agent、Agent Swarm、多智能体协作的 AI 研究人员
- 希望系统化评估和优化 Agent 表现的开发者
- 做 Agent 产品原型、自动化任务代理或内部 AI 工具的团队
- 需要对 Agent 运行过程、证据、评分、谱系进行审计的工程团队
- 熟悉 Docker、Python、LLM API 和实验型 AI 框架的高级开发者
- 探索自进化 Agent、自动 benchmark 生成、Agent 竞争选择机制的创业团队或实验室
03
配置要求
- 必须配置 OpenAI API Key。
- 需要指定 OpenAI 模型 ID,用于多个内部角色和 Agent 执行。
- 需要 Docker 环境,因为项目依赖 PostgreSQL、MinIO、LiteLLM、SearXNG、浏览器/worker 等容器服务。
- 首次启动会在本地生成配置并保存到 .kadath/config.env,文件采用 owner-only 权限。
- 需要足够的磁盘空间保存运行数据库、对象存储、Agent 工作区、冻结证据、模型调用 trace 和 Git 谱系。
- 需要较高的 LLM token 预算;README 明确提到会消耗大量模型 token。
- 如果启用浏览器能力,需要 Playwright/Chromium 相关容器正常运行。
- 如果目标需要外部网络检索,需要允许本地 SearXNG 和受控 HTTP/HTTPS 访问。
- 运行参数包括目标、epoch 时长、种群规模、epoch 数量,这些会显著影响成本和耗时。
- benchmark 一旦批准会锁定目标、工具清单、运行配置和 Architect 输出,后续修改会导致运行停止而不是静默改变实验。
04
适用场景
- 针对特定目标自动演化出更好的 Agent,例如信息检索、报告生成、代码任务、网页研究等
- 比较不同 Agent prompt、工具组合、实现策略在同一锁定 benchmark 下的表现
- 构建可复现的 Agent 评估实验,保留模型调用、工具调用、工作区文件和评分证据
- 研究遗传算法与 LLM Agent 结合的效果,包括变异、繁殖、选择和代际进步
- 为企业内部任务设计代理竞赛,让多个 Agent 尝试解决同一问题并自动排名
- 测试 Agent 在带浏览器、搜索、HTTP、临时 worker 等工具环境中的任务执行能力
- 生成和维护 Agent 谱系,观察哪些 prompt、代码结构或工具策略带来性能提升
05
部署与配置
- 准备本地环境:安装 Docker / Docker Compose,确保可以运行容器化服务。
- 准备 Python / shell 运行环境,项目主要通过仓库中的 ./kadath.sh 启动。
- 克隆仓库:git clone https://github.com/i3T4AN/KADATH.git && cd KADATH。
- 运行启动脚本:./kadath.sh。
- 首次启动时,根据交互式终端界面输入 OpenAI API Key。
- 选择或填写用于 Architect、Organism、Grader、Tweaker、Birther 的 OpenAI 模型 ID。
- 等待首次启动自动生成本地 PostgreSQL、MinIO、LiteLLM、SearXNG 等服务密钥并准备 Docker 镜像。
- 通过 CLI 创建新 run:输入目标、epoch 时长、种群规模和 epoch 数量。
- 审查 Architect 自动生成的 benchmark,包括评分范围、rubric、证据要求、反作弊规则、工具权限和限制。
- 确认 benchmark 后开始运行,系统会执行多代 Agent 竞争、评分、选择和变异。
06
风险与注意事项
- LLM API 成本可能非常高;项目定位就是通过大量 token 进行多代演化。
- 系统复杂度高,包含多个容器服务、数据库、对象存储、模型网关、浏览器、worker 和 Git 谱系,部署和排障门槛较高。
- 依赖 OpenAI API 和模型质量,评分、benchmark 生成和变异效果都会受模型能力影响。
- 自动生成 benchmark 虽有严格契约,但对于难以客观测量的真实业务目标,仍可能只能得到代理指标,存在偏差。
- Agent 演化可能过拟合锁定 benchmark,而不一定泛化到真实生产场景。
- 项目 stars 较多但 forks 很少,可能仍处在早期实验阶段,社区生态和生产案例有限。
- README 中大量功能涉及隔离和安全控制,但实际安全性仍需代码审计,尤其是容器权限、网络访问、密钥脱敏和文件边界。
- 运行周期长、资源占用高,不适合轻量级 Agent 原型或低成本验证。
- 如果企业环境需要私有模型、内部工具或本地部署,需要评估 LiteLLM 兼容性和配置改造成本。
2026-08-14
第29名
新收录 · github_search