Python · 项目报告

Liuziyu77/Valen

Train a Jev-like multimodal model by yourself. System One Model, now with vision.

已完成 打开 GitHub
L
425星标
47Fork
0Issue
Apache-2.0许可证

分析结果

项目分析

Valen(万澜)是一个受 Jev/System One Model 启发的多模态决策模型项目,支持文本、图像、视频输入,并针对给定候选项输出概率分布,而不是生成自然语言答案。它基于 Qwen3.5-0.8B/2B 骨干模型,加上共享 decision head,用于低延迟、高结构化的视觉/文本决策任务。仓库包含模型实现、数据处理、SFT 训练、实验性 RLCD 训练、推理与评测脚本,并提供 Hugging Face 上的预览模型和数据集。

适用领域 多模态机器学习 / 视觉语言模型 / 决策模型 / 强化学习/偏好优化实验 / 模型训练与微调 / 低延迟 AI 推理 / 游戏智能体 / VQA/视觉问答 / 结构化 AI 接口
配置难度 中高。对于只运行 smoke 推理和在线 Demo 的开发者,难度中等;但如果要训练自定义多模态决策模型、理解数据格式、调参 SFT/RLCD 并部署低延迟服务,需要较强的 PyTorch、Hugging Face、多模态模型训练和 GPU 工程经验。
商业价值 该项目的商业价值主要在于为业务系统提供低延迟、结构化、可解释概率输出的多模态决策能力。相比通用大模型生成文本,Valen 更适合客服分流、质检判断、游戏/机器人动作选择、视觉检测后的候选决策、Agent 工具调用选择等封闭候选场景。Apache-2.0 许可证降低了二次开发门槛,但实际落地仍需评估模型效果、基座模型许可、推理成本、数据安全和业务场景泛化能力。
01

技术亮点

  • 不是传统生成式 VLM,而是候选项概率决策模型,接口更结构化,适合工程系统集成。
  • 支持文本、图像和视频输入,面向多模态决策场景。
  • 基于较小的 Qwen3.5-0.8B/2B 模型,目标是降低推理延迟和资源成本。
  • README 展示了在 Sokoban 游戏中相比 27B 生成模型更低延迟的示例。
  • 提供在线 Hugging Face Space Demo,便于快速体验。
  • 提供预训练/预览 checkpoint、训练数据集、评估数据集和评测流程。
  • 包含 SFT 训练和实验性 RLCD 训练配置,支持开发者用自有数据训练。
  • Apache-2.0 许可证对商业二次开发较友好。
  • 有中文 README 和微信群入口,对中国开发者更友好。
02

目标用户

  • 希望训练自定义多模态决策模型的算法工程师
  • 研究 System One Model、Jev 类架构的 AI 研究者
  • 需要低延迟候选项打分模型的后端/应用开发者
  • 做视觉问答、游戏决策、机器人感知决策的开发团队
  • 熟悉 PyTorch、Hugging Face、Qwen 模型生态的中国开发者
  • 想基于开源 Apache-2.0 项目做二次开发或商业原型验证的团队
03

配置要求

  • Python 3.10 或更高版本。
  • 需要 Valen checkpoint 和对应的 Qwen3.5-2B 基座模型,两者都需要下载到本地。
  • 需要能够访问 Hugging Face 下载模型和数据集;中国大陆网络环境可能需要镜像、代理或提前离线下载。
  • 训练需要 GPU 环境,具体显存取决于 Qwen3.5-0.8B/2B、batch size、序列长度、图像/视频输入规模和是否使用混合精度。
  • 推理 2B 模型也建议使用 NVIDIA GPU;CPU 推理可能非常慢。
  • 训练数据需要符合项目 JSONL 格式:包含 request/state/messages/questions/criteria 以及 targets/probabilities 等字段。
  • 如果处理图像输入,需要确保 image_url 或本地图片路径可被程序访问。
  • 如使用 RLCD 训练,需要理解其仍为实验性功能,并检查对应配置文件和技术文档。
  • 商业使用时除 Apache-2.0 代码许可证外,还需要核查 Qwen 基座模型、Hugging Face 数据集和其他源数据的许可证。
04

适用场景

  • 给定图片、文本或视频上下文,从多个候选动作/答案中选择最优项
  • 游戏智能体决策,例如 Sokoban 推箱子方向选择
  • 视觉问答中对候选答案进行概率评分,而不是生成长文本
  • 构建低延迟 Agent 决策模块,用于在线系统中的快速判断
  • 对自有业务数据进行 SFT 微调,训练专用的多模态分类/选择模型
  • 评估图像质量变化、模糊程度等对模型决策置信度的影响
  • 替代大参数生成式 VLM,在特定候选决策场景下降低推理成本
05

部署与配置

  • 准备 Python 3.10+ 环境,建议使用 conda 或 venv 创建独立虚拟环境。
  • 克隆仓库:git clone https://github.com/Liuziyu77/Valen.git && cd Valen
  • 根据 docs/technical.md 中的环境要求安装依赖,通常需要执行类似 pip install -r requirements.txt 或根据 pyproject.toml 安装项目依赖。
  • 安装并登录 Hugging Face CLI:pip install -U huggingface_hub,然后执行 hf auth login。
  • 下载 Valen 预览 checkpoint:hf download Valen-Team/Valen-Preview-0923 --local-dir models/Valen-Preview-0923
  • 下载 Qwen3.5-2B 基座模型:hf download Qwen/Qwen3.5-2B --local-dir models/Qwen3.5-2B
  • 运行推理测试:python -m valen.inference --checkpoint models/Valen-Preview-0923 --data data/smoke/train.jsonl --output output/sft_warmup/predictions.jsonl
  • 运行评测管线:python -m valen.evaluate --checkpoint models/Valen-Preview-0923 --data data/smoke/train.jsonl --output output/sft_warmup/smoke_eval
  • 如需训练,修改 configs/train/qwen/sft_warmup.json 等配置后运行:python -m valen.train --config configs/train/qwen/sft_warmup.json
06

风险与注意事项

  • 项目 star 数约 425,仍属于较早期项目,生态和社区成熟度有限。
  • Valen-Preview-0923 是预览模型,效果可能不稳定,不能直接假设适合生产环境。
  • RLCD 标注为 experimental,训练稳定性、收益和复现成本需要自行验证。
  • 依赖 Qwen3.5-2B 基座模型,实际商用需单独核查基座模型许可和使用条款。
  • 多模态训练和推理对 GPU、显存、数据质量要求较高,个人开发者复现完整训练可能成本较大。
  • README 中的性能展示主要来自项目示例和特定评测集,迁移到业务场景可能需要重新评估。
  • 候选项概率模型适合封闭选项决策,不适合需要开放式长文本生成的任务。
  • Hugging Face 模型和数据下载在国内网络环境可能存在访问问题。
  • 视频输入能力在 README 中被提及,但实际工程可用性、格式支持和性能需要进一步阅读代码验证。

历史记录

热榜历史快照

2026-09-29 第30名 新收录 · github_search