Python · 项目报告

wfzyx/von

The open-source System One decision model. Sub-15ms, non-autoregressive, local drop-in alternative to TypeSafe Jev.

已完成 打开 GitHub
W
557星标
44Fork
6Issue
Apache-2.0许可证

分析结果

项目分析

Von 是一个开源的“System One”决策模型与 SDK,面向分类、意图路由、条件判断、风险评分等非生成式 AI 场景。它采用非自回归推理方式,一次前向传播即可对多个候选项或多个问题进行并行评估,目标是替代使用大语言模型逐 token 生成来做分类/路由的方案。项目提供 Python 与 TypeScript/JavaScript SDK,并宣称兼容 TypeSafe Jev 的 /v1/systemone 规范。模型权重约 395M 参数、约 1.5GB,可本地部署,在 GPU 上可达到约 18ms 级别延迟,适合需要低延迟、概率校准、可本地运行的决策系统。

适用领域 机器学习 / 自然语言理解 / 意图识别 / 文本分类 / 规则/策略决策 / 工单分流 / 风控与合规判断 / AIOps/DevOps 告警路由 / 客服自动化 / 实时游戏/机器人控制 / 本地 AI 推理服务
配置难度 中等。简单分类/判断场景接入较容易,Python SDK 代码量很少;但若要在生产系统中稳定使用,需要理解 Choice/Noul/Score 建模方式、设计业务标签和 criteria、评估中文表现、配置本地推理硬件,并完成阈值校准与监控。
商业价值 该项目的商业价值主要在于用更低延迟和更低运行成本替代 LLM 分类/路由类任务。对于客服工单、告警分流、风控审核、SLA 判断、内容安全前置过滤等场景,Von 可以作为本地化、可控、快速的决策层,减少云 API 依赖和生成式模型的不确定输出。如果企业当前大量调用大模型只为得到一个类别、概率或评分,迁移到这类非自回归决策模型可能显著降低成本并提升响应速度。但在中文和行业专有场景中,落地前必须进行充分评测和阈值调优。
01

技术亮点

  • 非自回归架构,不需要逐 token 生成,适合分类、判断、评分等结构化决策任务。
  • 支持 Choice、Noul、Score 三类决策原语:多分类、二元概率判断、连续/序数评分。
  • 一次前向传播可并行回答多个问题,适合低延迟多维度风控、路由和工单处理。
  • 本地可运行,Apache-2.0 许可证,相比闭源云 API 更利于私有化部署和成本控制。
  • 宣称在 GPU 上可达到约 18ms/sub-25ms 延迟,显著低于常见 LLM 分类方案。
  • 输出概率经过校准,适合基于阈值触发自动化流程。
  • 兼容 TypeSafe /v1/systemone 规范,方便从 Jev 类系统迁移。
  • 提供 Python 与 TypeScript/JavaScript SDK,便于后端和全栈项目集成。
02

目标用户

  • 需要低延迟分类或路由能力的后端开发者
  • 正在用 LLM 做意图识别、工单分类、审核判断但希望降低成本和延迟的 AI 应用开发者
  • 需要本地部署、避免依赖闭源云 API 的企业团队
  • AIOps、客服系统、支付/风控、合规审查等业务系统开发团队
  • 希望研究非自回归决策模型、概率校准和 System One 推理范式的机器学习工程师
  • 需要 TypeSafe Jev 开源替代品的开发者
03

配置要求

  • Python 3.12+。
  • TypeScript 5.x / Node.js 或 Bun 环境,仅在使用 JS/TS SDK 时需要。
  • 模型权重约 1.5GB,本地运行需要足够磁盘空间和内存/显存。
  • 推荐使用支持加速的硬件:NVIDIA CUDA、AMD ROCm/Linux、Apple Silicon MPS,或多线程 CPU。
  • 首次运行可能需要从 Hugging Face 下载模型权重:wfzyx/von。
  • 如果部署为服务,需要配置 HTTP server、模型缓存目录、设备选择、并发和超时等运行参数;README 片段未给出完整服务端配置细节。
  • 在生产环境中应为不同业务场景设计清晰的 choices、criteria 和 instructions,并基于真实数据校准阈值。
04

适用场景

  • 客服工单按业务域自动分类,例如基础设施、账单、功能请求等
  • 告警或事故文本的严重程度评分与自动升级
  • 判断某个事件是否满足阻断、违规、欺诈、紧急等条件,并输出概率
  • 对用户输入进行安全护栏判断,例如是否违反策略、是否需要人工复核
  • 多问题并行推理:一次输入同时得到意图、紧急程度、风险评分等结果
  • 作为 LLM 前置路由器,把请求分发到不同模型、工具或业务流程
  • 替代自回归 LLM 做结构化决策,减少 JSON/schema 解析失败
  • 实时控制场景中的动作选择,例如游戏、机器人或仿真环境中的快速决策
05

部署与配置

  • 确保 Python 版本为 3.12 或以上。
  • 使用 pip 安装 Python SDK:pip install von-sdk
  • 或使用 uv 安装:uv add von-sdk
  • 也可以直接从 GitHub 安装:pip install git+https://github.com/wfzyx/von.git
  • 如使用 TypeScript/JavaScript,可安装 Node/Bun 版本:bun add von-sdk 或 npm install von-sdk
  • 在 Python 中 import von 后,可使用 von.decide、von.judge、von.rate、von.system_one 等接口进行推理。
  • 如需复现实验,可运行:uv run python benchmarks/run_doom_benchmark.py
06

风险与注意事项

  • README 中给出的性能指标主要来自项目方描述,生产采用前应使用自己的中文、行业和边界样本进行独立评测。
  • 模型虽然适合决策和分类,但不是通用生成式 LLM,不能替代文本生成、复杂对话或长篇推理任务。
  • 中文场景表现未知;训练数据描述以英文 NLI/推理数据为主,中文分类、中文客服、中文合规文本可能需要额外验证。
  • 395M 模型虽然比大模型小,但仍需要下载约 1.5GB 权重,并对部署环境有一定资源要求。
  • 概率校准不等于业务风险可直接接受,阈值需要按具体数据分布重新验证。
  • 如果 choices 或 criteria 描述不清晰,模型输出可能不稳定或不符合业务预期。
  • Apache-2.0 许可证较宽松,但仍需确认模型权重、依赖库和数据来源在企业合规中的可接受性。
  • 实时或高并发服务还需要自行处理批量推理、限流、监控、降级和错误恢复。

历史记录

热榜历史快照

2026-09-24 第28名 新收录 · github_search