跳到主要内容
本地提取 · AI 转写

提取音频 / 转文字

从视频里取出音轨,需要的话再转成带时间轴的文字。

选择视频或音频文件

文件留在本机,转写模型也在浏览器里跑

导出的音频是什么格式

WAV 是未压缩的原始采样,任何设备都能打开,代价是体积大(约每分钟 10 MB)。需要放进播放器或发给别人时选 MP3,用的是浏览器里的编码器,128 kbps 单声道,一分钟大约 1 MB。

转写的准确率

用的是 Whisper 的轻量版本,在浏览器里跑。安静环境下的普通话口语大致能到八九成准确,背景音乐大、多人抢话、方言口音重的片段会明显下降。时间轴按模型给出的分段生成,导出 SRT 或 VTT 后可以直接挂到视频上再手工校对。

没有人声的地方会被丢掉,不会出现在结果里。这类模型碰上静音或纯音乐时会凭空编出一段读着挺通顺的话,还常常把同一句刷几十遍,所以我们按音量核对每一段,对不上的直接拦掉。如果整段音频都没人说话,会直接告诉你没听出人声,而不是给你一堆编出来的字。

常见问题

音频会上传吗?
不会。解码、编码和语音识别都在这个页面里完成,没有任何一步会把数据发出去。这也是为什么第一次要下载模型文件。
为什么转写这么慢?
模型在你的 CPU 上跑。一分钟音频通常要几十秒到一两分钟,取决于设备性能。手机上会更慢,长音频建议用电脑。
支持哪些语言?
界面上给了中文和英文两个选项,这两个的效果最稳。模型本身认得更多语言,但没有调好的分词和标点,效果参差。
SRT 和 LRC 有什么区别?
SRT 和 VTT 是视频字幕格式,每条带起止时间;LRC 是歌词格式,只有起始时间,音乐播放器用它做逐行滚动。