Python · 项目报告

browser-use/jev-ultrafast

i. am. speed.

已完成 打开 GitHub
B
4,916星标
303Fork
29Issue
MIT许可证

分析结果

项目分析

Jev Ultrafast 是一个用 Python 编写的浏览器自动化智能体框架,核心特点是“动态、索引化的动作空间”。它会把当前网页可见控件抽取成带编号的元素表,再通过 TypeSafe 的 Jev 模型一次性预测要执行的操作和目标元素;只有在需要输入文本时,才调用小型文本模型生成内容。项目重点展示了高速浏览器任务执行,例如在 Google Flights 上完成“苏黎世到伦敦航班搜索”的演示用时约 7.1 秒。该项目适合研究浏览器 Agent、网页自动化、LLM 工具调用、安全执行与高性能交互循环的开发者。

适用领域 浏览器自动化 / AI Agent / LLM 应用开发 / 网页任务执行 / RPA / 前端 DOM 分析 / 自动化测试 / 智能体安全执行
配置难度 中高级。该项目运行演示相对直接,但深入理解需要熟悉 Python、异步浏览器自动化、DOM/ARIA、LLM 结构化输出、TypeSafe 决策模型、OpenAI-compatible API 配置以及浏览器远程调试。对于普通应用开发者,上手使用难度中等;若要改造为稳定生产级浏览器 Agent,难度较高。
商业价值 该项目的商业价值主要体现在高性能网页自动化和 AI Agent 基础设施方向。相比传统基于截图或大模型逐步推理的浏览器 Agent,它通过结构化 DOM 状态、动态动作空间和一次请求完成操作/目标选择,显著降低延迟和浏览器协议调用数量。对于需要自动完成搜索、表单填写、后台运营、数据查询、流程导航的产品团队,它可以作为低延迟浏览器 Agent 的技术参考或原型基础。不过项目仍处于偏实验和 MVP 阶段,若用于商业场景,需要重点补齐任务成功率评估、站点兼容性、权限控制、审计日志、失败恢复和结果验证。
01

技术亮点

  • 一次决策周期只发起一个 TypeSafe 请求,同时预测操作和目标元素,减少网络往返。
  • 默认 Agent 循环不依赖截图,而是使用结构化 DOM 状态,速度更快、上下文更小。
  • 页面每次观察都会生成新的元素表,只向模型提供当前可见且可操作的控件。
  • 动作空间包括 CLICK、TYPE_TEXT、SELECT、SCROLL_UP、SCROLL_DOWN、WAIT、DONE、BLOCKED。
  • 只有 TYPE_TEXT 时才调用文本模型生成输入内容,降低不必要的文本生成成本。
  • 执行目标来自真实观测到的 DOM 节点,而不是让模型生成 CSS 选择器、坐标、JavaScript 或 shell 命令。
  • 执行前会重新检查页面 freshness、点击遮挡、当前几何位置等,提升安全性和可靠性。
  • 提供本地 Inspector,可查看编号元素、操作概率、目标概率和已执行动作。
  • 代码规模相对较小,核心文件包括 agent.py、snapshot.js、browser.py、model.py、questions.py 和 demo.py,便于阅读学习。
  • MIT 许可证,适合二次开发和商业集成。
02

目标用户

  • 希望构建浏览器 Agent 的 AI 应用开发者
  • 研究 LLM 网页自动化的工程师
  • 需要高性能网页任务执行的 RPA 开发者
  • 关注 TypeSafe、结构化输出和动作空间建模的开发者
  • 希望学习浏览器 DOM 快照、可见控件抽取和安全点击执行机制的工程师
  • 对 browser-use、browser-harness 生态感兴趣的开发者
03

配置要求

  • 需要 TYPESAFE_API_KEY,用于调用 TypeSafe 的 Jev 决策模型。
  • 需要 TEXT_MODEL_API_KEY,示例配置中使用 OpenRouter API Key。
  • 默认文本模型示例为 inception/mercury-2.5,并关闭 reasoning。
  • 可配置 Gemini、GLM、DeepSeek 等兼容 OpenAI 接口的文本模型,但需要设置对应模型名、接口地址和 reasoning 选项。
  • 需要可连接的 Chrome 浏览器,项目通过 Browser Harness 与 Chrome 通信。
  • 运行真实示例和录制脚本会产生付费 API 调用。
  • 测试本身是离线的,但 live examples、recording scripts 需要模型服务。
04

适用场景

  • 用自然语言驱动浏览器完成网页任务
  • 自动搜索航班、酒店、百科文章等信息
  • 构建网页操作型 AI Agent 原型
  • 研究如何减少 LLM 浏览器自动化中的延迟
  • 对网页可见控件进行结构化抽取并生成动作空间
  • 开发带可视化 Inspector 的浏览器任务调试工具
  • 验证网页自动化任务结果,例如航班路线、日期和搜索结果是否匹配
05

部署与配置

  • 安装 Python 环境和 uv 包管理工具。
  • 克隆仓库:git clone https://github.com/browser-use/jev-ultrafast.git
  • 进入目录:cd jev-ultrafast
  • 安装依赖:uv sync
  • 复制环境变量文件:cp .env.example .env
  • 在 .env 中填写 TYPESAFE_API_KEY 和 TEXT_MODEL_API_KEY。
  • 运行演示:uv run jev
  • 打开浏览器访问:http://127.0.0.1:8766
  • 点击 Start demo,然后选择 Run automatically。
  • 如果 Chrome 连接有问题,运行:uv run browser-harness --doctor,并按提示允许 Chrome 远程调试。
06

风险与注意事项

  • 当前性能数据主要来自少量任务和少量重复实验,不代表通用可靠性基准。
  • Google Flights 演示虽然很快,但不意味着所有复杂网页都能达到类似速度。
  • DOM 读取器只覆盖常见 HTML 和 ARIA 控件,并未完整实现 accessible-name 规范。
  • 对 Shadow DOM、iframe、canvas、文件上传、弹窗标签页、嵌套滚动和任意键盘控件的支持仍有限。
  • DONE 动作仍需要外部独立验证,否则可能误判任务完成。
  • 使用真实模型 API 会产生费用,且性能和稳定性依赖第三方模型服务。
  • 与 Chrome 远程调试和本地浏览器配置相关,开发环境可能需要额外排查。
  • Owned tabs 共享现有 Chrome profile,可能受到用户登录状态、缓存、地区和语言设置影响。
  • 目前更像 MVP 和研究型项目,生产环境使用前需要补充监控、异常处理、权限隔离和任务验证机制。

历史记录

热榜历史快照

2026-09-19 第1名 新收录 · github_search
2026-09-18 第2名 新收录 · github_search