Rescript 是一个开源的浏览器端视频/音频编辑器,核心理念是“像编辑文本一样编辑媒体”。用户导入视频或音频后,应用会在本地通过 Whisper 生成带词级时间戳和说话人标签的转录文本;删除转录中的文字,就会自动剪掉对应的媒体片段。它支持填充词一键删除、导入字幕文件、实时预览剪辑效果,并可在浏览器中通过 ffmpeg.wasm 导出 MP4 或 M4A。项目基于 Next.js、React、TypeScript、Tailwind、transformers.js、ONNX 和 ffmpeg.wasm 构建,强调隐私、本地处理和无需上传文件。
适用领域
音视频编辑 / AI 转录 / 浏览器端媒体处理 / 播客制作 / 视频剪辑工具 / 字幕与转写 / WebAssembly 应用 / 前端 AI 应用 / 隐私优先工具
配置难度
中等。普通用户可直接使用在线 Demo 或本地 npm 启动;但如果要自行部署、优化中文转录、处理大文件性能、配置 COOP/COEP、调整模型缓存或二次开发编辑逻辑,则需要较强的前端、WebAssembly、浏览器安全策略和音视频处理经验。
商业价值
该项目对中文内容创作者工具、播客剪辑平台、在线课程处理、企业会议录音整理和隐私敏感的媒体处理场景有较高参考价值。它展示了无需后端 GPU、无需上传文件的本地 AI 剪辑工作流,可以降低服务器成本并增强隐私卖点。对于商业化产品,可在其基础上扩展中文转录优化、中文填充词库、批量处理、品牌模板、字幕翻译、团队协作、云端可选加速和桌面端封装。不过浏览器端性能、模型下载体验和长视频稳定性仍是商业落地前需要重点解决的问题。
01
技术亮点
- 完全浏览器端运行,媒体文件不需要上传到服务器,隐私友好。
- 基于转录文本进行剪辑,交互方式对非专业剪辑用户非常直观。
- 支持词级时间戳,删除文字即可形成对应的音视频剪切区间。
- 支持说话人分离,可以按说话人组织转录内容。
- 支持一键删除填充词,适合播客、访谈、口播视频的快速清理。
- 支持导入 SRT、VTT、JSON 字幕文件,可跳过本地 Whisper 转录步骤。
- 内置时间线、波形、词标签、剪切区域、播放头和缩放等编辑体验。
- 实时预览会自动跳过剪切片段,便于确认最终效果。
- 使用 ffmpeg.wasm 在浏览器中完成 MP4 或 M4A 导出。
- 技术栈现代,适合前端开发者学习浏览器 AI 推理与媒体处理。
02
目标用户
- 播客创作者
- 视频博主和自媒体创作者
- 访谈、会议、课程录制内容的剪辑人员
- 需要快速删除口癖和无效片段的内容生产者
- 重视隐私、不希望上传原始音视频的用户
- 前端开发者和 AI Web 应用开发者
- 希望研究浏览器内 Whisper、ffmpeg.wasm、WebGPU 推理的开发者
- 需要二次开发本地化音视频编辑工具的团队
03
配置要求
- 推荐使用 Chromium 系浏览器,例如 Chrome、Edge。
- 应用需要 SharedArrayBuffer,因此部署时必须配置 COOP/COEP 响应头。
- 首次转录时需要联网下载 AI 模型:Whisper Base 约 200MB,Whisper Small 约 600MB,另有较小的说话人分离模型。
- 模型下载后会缓存到浏览器存储中,之后可离线运行。
- WebGPU 可用时会用于推理加速,不可用时回退到 WASM。
- 浏览器需有足够内存和存储空间,尤其是处理长视频或使用 Whisper Small 时。
- 媒体导出依赖多线程 ffmpeg.wasm,对浏览器隔离策略和性能要求较高。
- 如果自行部署,需要确认 public/vendor 中 ffmpeg、onnxruntime 等 WASM 资源路径正确。
- README 中提到存在匿名 Google Analytics 请求,如面向隐私敏感用户或国内环境部署,建议检查并按需移除。
- 项目 README 声明 MIT License,但仓库元数据 license 字段为空,商业使用前建议确认 LICENSE 文件是否存在。
04
适用场景
- 导入访谈视频,通过删除转录文本快速剪掉无关内容
- 一键删除播客或视频中的“嗯”“啊”“呃”等填充词
- 将已有 SRT、VTT 或 JSON 字幕导入后进行基于字幕的剪辑
- 在不上传媒体文件的情况下完成私密音视频处理
- 对课程、会议、演讲录音进行快速粗剪
- 在浏览器中离线完成转录、剪辑和导出
- 作为示例项目学习 transformers.js、Whisper、ONNX、ffmpeg.wasm 和 Web Worker 的集成
- 构建面向中文内容创作者的本地化 AI 剪辑工具原型
05
部署与配置
- 确保本地已安装 Node.js 和 npm。
- 克隆仓库:git clone https://github.com/wassgha/rescript.git
- 进入项目目录:cd rescript
- 安装依赖:npm install。该步骤也会将 ffmpeg 和 onnxruntime 的 WASM 文件复制到 public/vendor。
- 启动开发服务器:npm run dev
- 在浏览器中打开 http://localhost:3000
- 拖入带音轨的视频或音频文件开始测试。
- 生产构建可运行:npm run build
- 代码检查可运行:npm run lint
06
风险与注意事项
- 浏览器端 AI 转录和 ffmpeg 导出对 CPU、GPU、内存要求较高,低配置设备体验可能较差。
- 首次加载模型体积较大,国内访问 Hugging Face 可能较慢或不稳定。
- Whisper Base/Small 对中文识别可用,但准确率、标点、说话人分离效果可能因音质和场景而异。
- 长视频处理可能耗时较长,并可能遇到浏览器内存限制。
- 需要 SharedArrayBuffer 和 COOP/COEP,部署到普通静态站点或嵌入第三方页面时可能需要额外配置。
- ffmpeg.wasm 导出虽然方便,但性能通常弱于原生 ffmpeg 或服务端渲染。
- 项目星标约 269,仍属于较早期/小众项目,生产环境使用前需要充分测试。
- 仓库元数据未显示 license,但 README 写明 MIT,建议使用前核对许可证文件。
- 默认包含 Google Analytics 匿名统计说明,若强调完全无第三方请求,需要自行移除或确认实现。
- 中文填充词识别和删除规则可能需要本地化增强,目前 README 示例主要是英文 um/uh 类场景。
2026-08-02
第14名
新收录 · github_search
2026-08-01
第14名
新收录 · github_search
2026-07-31
第14名
新收录 · github_search
2026-07-30
第23名
新收录 · github_search
2026-07-29
第29名
新收录 · github_search