Valen(万澜)是一个受 Jev/System One Model 启发的多模态决策模型项目,支持文本、图像、视频输入,并针对给定候选项输出概率分布,而不是生成自然语言答案。它基于 Qwen3.5-0.8B/2B 骨干模型,加上共享 decision head,用于低延迟、高结构化的视觉/文本决策任务。仓库包含模型实现、数据处理、SFT 训练、实验性 RLCD 训练、推理与评测脚本,并提供 Hugging Face 上的预览模型和数据集。
适用领域
多模态机器学习 / 视觉语言模型 / 决策模型 / 强化学习/偏好优化实验 / 模型训练与微调 / 低延迟 AI 推理 / 游戏智能体 / VQA/视觉问答 / 结构化 AI 接口
配置难度
中高。对于只运行 smoke 推理和在线 Demo 的开发者,难度中等;但如果要训练自定义多模态决策模型、理解数据格式、调参 SFT/RLCD 并部署低延迟服务,需要较强的 PyTorch、Hugging Face、多模态模型训练和 GPU 工程经验。
商业价值
该项目的商业价值主要在于为业务系统提供低延迟、结构化、可解释概率输出的多模态决策能力。相比通用大模型生成文本,Valen 更适合客服分流、质检判断、游戏/机器人动作选择、视觉检测后的候选决策、Agent 工具调用选择等封闭候选场景。Apache-2.0 许可证降低了二次开发门槛,但实际落地仍需评估模型效果、基座模型许可、推理成本、数据安全和业务场景泛化能力。
01
技术亮点
- 不是传统生成式 VLM,而是候选项概率决策模型,接口更结构化,适合工程系统集成。
- 支持文本、图像和视频输入,面向多模态决策场景。
- 基于较小的 Qwen3.5-0.8B/2B 模型,目标是降低推理延迟和资源成本。
- README 展示了在 Sokoban 游戏中相比 27B 生成模型更低延迟的示例。
- 提供在线 Hugging Face Space Demo,便于快速体验。
- 提供预训练/预览 checkpoint、训练数据集、评估数据集和评测流程。
- 包含 SFT 训练和实验性 RLCD 训练配置,支持开发者用自有数据训练。
- Apache-2.0 许可证对商业二次开发较友好。
- 有中文 README 和微信群入口,对中国开发者更友好。
02
目标用户
- 希望训练自定义多模态决策模型的算法工程师
- 研究 System One Model、Jev 类架构的 AI 研究者
- 需要低延迟候选项打分模型的后端/应用开发者
- 做视觉问答、游戏决策、机器人感知决策的开发团队
- 熟悉 PyTorch、Hugging Face、Qwen 模型生态的中国开发者
- 想基于开源 Apache-2.0 项目做二次开发或商业原型验证的团队
03
配置要求
- Python 3.10 或更高版本。
- 需要 Valen checkpoint 和对应的 Qwen3.5-2B 基座模型,两者都需要下载到本地。
- 需要能够访问 Hugging Face 下载模型和数据集;中国大陆网络环境可能需要镜像、代理或提前离线下载。
- 训练需要 GPU 环境,具体显存取决于 Qwen3.5-0.8B/2B、batch size、序列长度、图像/视频输入规模和是否使用混合精度。
- 推理 2B 模型也建议使用 NVIDIA GPU;CPU 推理可能非常慢。
- 训练数据需要符合项目 JSONL 格式:包含 request/state/messages/questions/criteria 以及 targets/probabilities 等字段。
- 如果处理图像输入,需要确保 image_url 或本地图片路径可被程序访问。
- 如使用 RLCD 训练,需要理解其仍为实验性功能,并检查对应配置文件和技术文档。
- 商业使用时除 Apache-2.0 代码许可证外,还需要核查 Qwen 基座模型、Hugging Face 数据集和其他源数据的许可证。
04
适用场景
- 给定图片、文本或视频上下文,从多个候选动作/答案中选择最优项
- 游戏智能体决策,例如 Sokoban 推箱子方向选择
- 视觉问答中对候选答案进行概率评分,而不是生成长文本
- 构建低延迟 Agent 决策模块,用于在线系统中的快速判断
- 对自有业务数据进行 SFT 微调,训练专用的多模态分类/选择模型
- 评估图像质量变化、模糊程度等对模型决策置信度的影响
- 替代大参数生成式 VLM,在特定候选决策场景下降低推理成本
05
部署与配置
- 准备 Python 3.10+ 环境,建议使用 conda 或 venv 创建独立虚拟环境。
- 克隆仓库:git clone https://github.com/Liuziyu77/Valen.git && cd Valen
- 根据 docs/technical.md 中的环境要求安装依赖,通常需要执行类似 pip install -r requirements.txt 或根据 pyproject.toml 安装项目依赖。
- 安装并登录 Hugging Face CLI:pip install -U huggingface_hub,然后执行 hf auth login。
- 下载 Valen 预览 checkpoint:hf download Valen-Team/Valen-Preview-0923 --local-dir models/Valen-Preview-0923
- 下载 Qwen3.5-2B 基座模型:hf download Qwen/Qwen3.5-2B --local-dir models/Qwen3.5-2B
- 运行推理测试:python -m valen.inference --checkpoint models/Valen-Preview-0923 --data data/smoke/train.jsonl --output output/sft_warmup/predictions.jsonl
- 运行评测管线:python -m valen.evaluate --checkpoint models/Valen-Preview-0923 --data data/smoke/train.jsonl --output output/sft_warmup/smoke_eval
- 如需训练,修改 configs/train/qwen/sft_warmup.json 等配置后运行:python -m valen.train --config configs/train/qwen/sft_warmup.json
06
风险与注意事项
- 项目 star 数约 425,仍属于较早期项目,生态和社区成熟度有限。
- Valen-Preview-0923 是预览模型,效果可能不稳定,不能直接假设适合生产环境。
- RLCD 标注为 experimental,训练稳定性、收益和复现成本需要自行验证。
- 依赖 Qwen3.5-2B 基座模型,实际商用需单独核查基座模型许可和使用条款。
- 多模态训练和推理对 GPU、显存、数据质量要求较高,个人开发者复现完整训练可能成本较大。
- README 中的性能展示主要来自项目示例和特定评测集,迁移到业务场景可能需要重新评估。
- 候选项概率模型适合封闭选项决策,不适合需要开放式长文本生成的任务。
- Hugging Face 模型和数据下载在国内网络环境可能存在访问问题。
- 视频输入能力在 README 中被提及,但实际工程可用性、格式支持和性能需要进一步阅读代码验证。
2026-09-29
第30名
新收录 · github_search