返回博客

在浏览器中完成视频字幕、音频提取与字幕视频导出

了解 Video Describer AI 如何在浏览器本地提取音频、使用 Whisper Tiny 生成字幕,并导出 SRT、VTT 或带字幕的视频。

2026年8月3日Video Describer AI 团队Video Describer AI 团队

短视频工作流经常需要在多个工具之间来回切换:先提取音频,再转写字幕,接着翻译,最后把字幕嵌入视频。对于两分钟以内的素材,其中很多计算其实可以直接在现代浏览器中完成。

Video Describer AI 采用“浏览器优先”的方式处理视频。原始文件用于本地预览、抽帧、音频提取、语音识别和字幕视频导出;只有确实需要云端 AI 的步骤才会发起网络请求。

如果你的目标是理解画面语言而不是对白,可以使用 Video Describer 视频转提示词工具,提取主体、构图、镜头、光线、色彩、风格和完整时间分段。

浏览器本地完成了哪些工作?

视频读取与限制检查

选择视频后,浏览器会先读取文件大小、时长和分辨率。当前工作台支持不超过 50 MB、时长不超过 2 分钟的视频。检查在分析前完成,可以避免上传后才发现文件不符合要求。

保存音频

保存音频功能使用项目本地托管的 FFmpeg WebAssembly 文件处理视频。转换发生在当前浏览器标签页中,完成后直接下载 MP3,不需要先把整段视频上传到服务器。

首次使用时需要加载 FFmpeg 运行文件,后续操作通常会复用已初始化的实例。高分辨率素材仍可能占用较多内存,因此关闭其他高负载标签页会让处理更加稳定。

使用 Whisper Tiny 生成字幕

字幕生成会先将视频音轨转换为 16 kHz 单声道音频,再交给浏览器中的 Whisper Tiny 模型识别。开始前可以选择视频语言,也可以保留“自动识别”。

模型首次加载所需时间取决于设备性能和本地缓存。完成后,结果会按时间段显示,并与视频播放位置联动:播放到某条字幕时,对应字幕会高亮并自动进入可视区域;点击字幕也可以跳转到相应时间。

SRT、VTT 与字幕视频有什么区别?

Video Describer AI 支持三种常见输出方式:

  • SRT:兼容大多数剪辑软件和视频平台,适合继续编辑。
  • VTT:更适合网页视频播放器和 Web 项目。
  • 字幕视频:将当前字幕画面直接写入导出的视频,播放时不依赖外部字幕文件。

如果后续还要修改文本、字体或位置,优先下载 SRT;如果需要一份打开即可看到字幕的成片,再导出字幕视频。

字幕翻译为什么使用云端服务?

语音识别可以使用专门的轻量模型在浏览器运行,但高质量多语言翻译通常需要更大的语言模型。当前字幕翻译会将字幕文本和目标语言发送给已配置的 Fal 服务,不会为翻译上传原始视频。

翻译结果沿用原字幕时间轴,因此可以直接切换查看、下载,或作为字幕视频的导出内容。翻译前仍建议快速检查原始字幕,避免识别错误被带入译文。

最近分析会保存什么?

字幕识别完成后,最近分析会保存视频文件元数据、识别语言以及字幕文字和时间段,并标记为“字幕生成”类型。原始视频、提取出的音频和浏览器内存中的模型输入不会写入这条历史记录。

历史记录可以单条永久删除,也可以一次清空。点击字幕记录时,会在独立弹窗中重新查看完整时间轴,而不会覆盖上方正在使用的工作台。

提高字幕准确率的实用建议

  1. 尽量使用人声清晰、背景音乐较弱的素材。
  2. 已知语言时主动选择,而不是始终依赖自动识别。
  3. 对人名、品牌名、数字和专业术语进行人工复核。
  4. 翻译前先修正原字幕,避免错误继续传播。
  5. 导出字幕视频前完整播放一次,确认字幕时序和换行。

浏览器端处理并不意味着所有设备速度相同,但它能减少不必要的原始素材传输,并把短视频的常用处理步骤集中在一个工作台中。

你可以继续使用独立的字幕提取工具音频提取工具,或通过 AI 视频生成器把整理出的创意方向生成新视频。