Python · 项目报告

jaredpalmer/kev

tiny Jev-like model built on top of Qwen2.5-0.5B you can train and run on your MacBook

已完成 打开 GitHub
J
412星标
25Fork
2Issue
Apache-2.0许可证

分析结果

项目分析

kev 是一个受 TypeSafe Jev 启发的轻量级“决策模型”项目,基于 Qwen2.5/Qwen3 基座模型加 LoRA 适配器和小型 pointer readout head。它不是生成文本,而是针对输入文档或状态,一次前向计算并行回答多个结构化问题,输出校准概率。支持 yes/no、choice、多级 score 三类问题,并提供兼容 TypeSafe System One API 的本地服务。项目重点适合在本地 MacBook 上运行推理,在云端 GPU 或 Apple Silicon 上训练和评估。

适用领域 大语言模型应用 / 概率决策模型 / 文本分类 / 客户支持自动分流 / 本地 AI 推理 / LoRA 微调 / 结构化问答 / 模型评估与校准 / API 服务 / AI Agent 决策组件
配置难度 中等偏高。只运行 kev-0.5b 或 kev-4b 服务对熟悉 Python、uv、Hugging Face 的开发者来说不难;但如果要理解 block-causal mask、pointer readout、LoRA 训练、概率校准和自定义评测,则需要较强的机器学习和 LLM 工程背景。
商业价值 未知
01

技术亮点

  • 一次前向计算即可回答多个问题,避免为每个问题重复编码文档。
  • 使用 block-causal mask 确保每个问题可以看到 state,但不能看到其他 sibling question,问题隔离性较强。
  • 输出为概率分布而非自然语言文本,更适合分类、评分、路由等工程场景。
  • 支持 noul、choice、score 三类结构化问题,覆盖 yes/no、多选项分类和有序评分。
  • 兼容 TypeSafe System One API,官方 typesafe-sdk 只需修改 base_url 即可接入本地服务。
  • 提供 0.5B、0.6B、4B、8B 多个 checkpoint,便于在精度、内存、速度之间取舍。
  • Apache-2.0 许可证,商业使用友好。
  • 提供 playground,可视化测试模型输出、packed/separate 差异、选项顺序敏感性和隔离性。
  • README 中公开了较详细的架构说明、评测指标和 checkpoint 对比。
  • 基于 Qwen 系列模型和 LoRA,便于中文开发者理解、二次训练或迁移到类似基座模型。
02

目标用户

  • 希望在本地运行小型 AI 决策模型的开发者
  • 需要将文本输入映射为结构化概率输出的后端工程师
  • 研究 Jev / System One 架构的机器学习研究者
  • 需要构建客服工单分类、风险判断、规则判断系统的团队
  • 熟悉 Python、Hugging Face、Qwen、LoRA 的 AI 工程师
  • 希望在 MacBook 或单卡 GPU 上实验小模型的个人开发者
03

配置要求

  • Python 3.12+
  • uv 包管理工具
  • Node.js 20+,仅 playground 需要
  • Hugging Face 模型下载访问能力
  • 推荐 Apple Silicon Mac 用于本地服务,README 中主要测试了 MPS
  • kev-4b 推荐使用 32GB 内存 Mac,以 bf16 运行,约 1 秒延迟
  • kev-8b 可在 32GB Mac 上 bf16 服务,约 2 秒延迟
  • kev-0.5b 可在本地 fp32 运行,延迟约 160ms
  • 训练 4B/8B 版本推荐使用 H100 等 CUDA GPU,项目示例使用 Modal
  • 服务默认无认证机制,只适合本地或受控网络环境
  • 可通过 KEV_DTYPE=bf16 等环境变量指定推理 dtype
  • API 兼容 TypeSafe System One 的请求与响应结构
04

适用场景

  • 客服工单自动分流:根据客户描述判断应交由退货、物流、账单等团队处理
  • 优先级和紧急程度评估:对一段文本输出多级 score 或 yes/no 判断
  • 批量结构化判断:一次输入文档,同时回答多个隔离的问题,减少重复编码成本
  • 替代文本生成式分类:不让模型生成解释文本,而是直接输出概率分布
  • 本地 System One API 兼容服务:使用 typesafe-sdk 指向本地 kev 服务进行实验
  • 模型校准研究:比较不同 checkpoint 在 in-distribution 和 out-of-domain 数据集上的表现
  • AI 决策组件原型:作为 Agent 工作流中的低延迟分类、路由或风险评分模块
  • 交互式 playground 实验:通过网页界面测试问题顺序、选项排列、隔离性等行为
05

部署与配置

  • 安装 Python 3.12+。
  • 安装 uv:https://docs.astral.sh/uv/。
  • 如需运行 playground,安装 Node.js 20+。
  • 克隆仓库:git clone https://github.com/jaredpalmer/kev.git && cd kev。
  • 同步 Python 依赖:uv sync --extra serve。
  • 安装前端 playground 依赖:cd playground && npm install && cd ..。
  • 从 Hugging Face Hub 使用指定 checkpoint,例如 jaredpalmer/kev-4b。首次启动时会自动下载基座模型和权重。
  • 启动本地服务:KEV_DTYPE=bf16 uv run --extra serve python -m kev.serve --run jaredpalmer/kev-4b --port 8009。
  • 通过 curl 请求 POST /v1/systemone,或使用 TypeSafe SDK,将 base_url 设置为 http://127.0.0.1:8009。
  • 如需启动 playground:cd playground && npm run dev -- -p 3001,然后打开 http://localhost:3001。
06

风险与注意事项

  • 项目仍偏研究和实验性质,多个 checkpoint 被标注为 preview,并未完全通过作者预设的 release 标准。
  • out-of-domain 表现仍明显低于官方 Jev,kev-4b/8b 在部分场景可能存在泛化不足。
  • README 明确提到 kev-8b out-of-domain Brier 为 0.34,且有 8% confident errors,说明高置信错误不可忽视。
  • 服务没有认证机制,不适合直接暴露到公网。
  • 模型输出概率并不等同于真实可靠置信度,关键业务场景需要额外校准、人工复核和灰度验证。
  • 主要测试环境是 Apple Silicon、CUDA/H100 和 MPS,其他硬件或系统可能需要调试。
  • 需要从 Hugging Face 下载模型权重,国内网络环境可能存在下载速度或访问问题。
  • 目前 README 中展示的数据和任务主要偏英文场景,中文文本上的效果需要自行评测。
  • choice 选项顺序、提示词格式、criteria 描述质量可能影响输出,需要业务侧规范化。
  • 本地运行 4B/8B 模型对内存要求较高,小内存设备体验可能较差。

历史记录

热榜历史快照

2026-09-20 第23名 新收录 · github_search