TypeScript · 项目报告

wassgha/rescript

🎬 Open source, transcript-based video/audio editor that lives in the browser.

已完成 打开 GitHub
W
490星标
56Fork
4Issue
NOASSERTION许可证

分析结果

项目分析

Rescript 是一个开源的浏览器端视频/音频编辑器,核心理念是“像编辑文本一样编辑媒体”。用户导入视频或音频后,应用会在本地通过 Whisper 生成带词级时间戳和说话人标签的转录文本;删除转录中的文字,就会自动剪掉对应的媒体片段。它支持填充词一键删除、导入字幕文件、实时预览剪辑效果,并可在浏览器中通过 ffmpeg.wasm 导出 MP4 或 M4A。项目基于 Next.js、React、TypeScript、Tailwind、transformers.js、ONNX 和 ffmpeg.wasm 构建,强调隐私、本地处理和无需上传文件。

适用领域 音视频编辑 / AI 转录 / 浏览器端媒体处理 / 播客制作 / 视频剪辑工具 / 字幕与转写 / WebAssembly 应用 / 前端 AI 应用 / 隐私优先工具
配置难度 中等。普通用户可直接使用在线 Demo 或本地 npm 启动;但如果要自行部署、优化中文转录、处理大文件性能、配置 COOP/COEP、调整模型缓存或二次开发编辑逻辑,则需要较强的前端、WebAssembly、浏览器安全策略和音视频处理经验。
商业价值 该项目对中文内容创作者工具、播客剪辑平台、在线课程处理、企业会议录音整理和隐私敏感的媒体处理场景有较高参考价值。它展示了无需后端 GPU、无需上传文件的本地 AI 剪辑工作流,可以降低服务器成本并增强隐私卖点。对于商业化产品,可在其基础上扩展中文转录优化、中文填充词库、批量处理、品牌模板、字幕翻译、团队协作、云端可选加速和桌面端封装。不过浏览器端性能、模型下载体验和长视频稳定性仍是商业落地前需要重点解决的问题。
01

技术亮点

  • 完全浏览器端运行,媒体文件不需要上传到服务器,隐私友好。
  • 基于转录文本进行剪辑,交互方式对非专业剪辑用户非常直观。
  • 支持词级时间戳,删除文字即可形成对应的音视频剪切区间。
  • 支持说话人分离,可以按说话人组织转录内容。
  • 支持一键删除填充词,适合播客、访谈、口播视频的快速清理。
  • 支持导入 SRT、VTT、JSON 字幕文件,可跳过本地 Whisper 转录步骤。
  • 内置时间线、波形、词标签、剪切区域、播放头和缩放等编辑体验。
  • 实时预览会自动跳过剪切片段,便于确认最终效果。
  • 使用 ffmpeg.wasm 在浏览器中完成 MP4 或 M4A 导出。
  • 技术栈现代,适合前端开发者学习浏览器 AI 推理与媒体处理。
02

目标用户

  • 播客创作者
  • 视频博主和自媒体创作者
  • 访谈、会议、课程录制内容的剪辑人员
  • 需要快速删除口癖和无效片段的内容生产者
  • 重视隐私、不希望上传原始音视频的用户
  • 前端开发者和 AI Web 应用开发者
  • 希望研究浏览器内 Whisper、ffmpeg.wasm、WebGPU 推理的开发者
  • 需要二次开发本地化音视频编辑工具的团队
03

配置要求

  • 推荐使用 Chromium 系浏览器,例如 Chrome、Edge。
  • 应用需要 SharedArrayBuffer,因此部署时必须配置 COOP/COEP 响应头。
  • 首次转录时需要联网下载 AI 模型:Whisper Base 约 200MB,Whisper Small 约 600MB,另有较小的说话人分离模型。
  • 模型下载后会缓存到浏览器存储中,之后可离线运行。
  • WebGPU 可用时会用于推理加速,不可用时回退到 WASM。
  • 浏览器需有足够内存和存储空间,尤其是处理长视频或使用 Whisper Small 时。
  • 媒体导出依赖多线程 ffmpeg.wasm,对浏览器隔离策略和性能要求较高。
  • 如果自行部署,需要确认 public/vendor 中 ffmpeg、onnxruntime 等 WASM 资源路径正确。
  • README 中提到存在匿名 Google Analytics 请求,如面向隐私敏感用户或国内环境部署,建议检查并按需移除。
  • 项目 README 声明 MIT License,但仓库元数据 license 字段为空,商业使用前建议确认 LICENSE 文件是否存在。
04

适用场景

  • 导入访谈视频,通过删除转录文本快速剪掉无关内容
  • 一键删除播客或视频中的“嗯”“啊”“呃”等填充词
  • 将已有 SRT、VTT 或 JSON 字幕导入后进行基于字幕的剪辑
  • 在不上传媒体文件的情况下完成私密音视频处理
  • 对课程、会议、演讲录音进行快速粗剪
  • 在浏览器中离线完成转录、剪辑和导出
  • 作为示例项目学习 transformers.js、Whisper、ONNX、ffmpeg.wasm 和 Web Worker 的集成
  • 构建面向中文内容创作者的本地化 AI 剪辑工具原型
05

部署与配置

  • 确保本地已安装 Node.js 和 npm。
  • 克隆仓库:git clone https://github.com/wassgha/rescript.git
  • 进入项目目录:cd rescript
  • 安装依赖:npm install。该步骤也会将 ffmpeg 和 onnxruntime 的 WASM 文件复制到 public/vendor。
  • 启动开发服务器:npm run dev
  • 在浏览器中打开 http://localhost:3000
  • 拖入带音轨的视频或音频文件开始测试。
  • 生产构建可运行:npm run build
  • 代码检查可运行:npm run lint
06

风险与注意事项

  • 浏览器端 AI 转录和 ffmpeg 导出对 CPU、GPU、内存要求较高,低配置设备体验可能较差。
  • 首次加载模型体积较大,国内访问 Hugging Face 可能较慢或不稳定。
  • Whisper Base/Small 对中文识别可用,但准确率、标点、说话人分离效果可能因音质和场景而异。
  • 长视频处理可能耗时较长,并可能遇到浏览器内存限制。
  • 需要 SharedArrayBuffer 和 COOP/COEP,部署到普通静态站点或嵌入第三方页面时可能需要额外配置。
  • ffmpeg.wasm 导出虽然方便,但性能通常弱于原生 ffmpeg 或服务端渲染。
  • 项目星标约 269,仍属于较早期/小众项目,生产环境使用前需要充分测试。
  • 仓库元数据未显示 license,但 README 写明 MIT,建议使用前核对许可证文件。
  • 默认包含 Google Analytics 匿名统计说明,若强调完全无第三方请求,需要自行移除或确认实现。
  • 中文填充词识别和删除规则可能需要本地化增强,目前 README 示例主要是英文 um/uh 类场景。

历史记录

热榜历史快照

2026-08-02 第14名 新收录 · github_search
2026-08-01 第14名 新收录 · github_search
2026-07-31 第14名 新收录 · github_search
2026-07-30 第23名 新收录 · github_search
2026-07-29 第29名 新收录 · github_search