跳到主要内容
纯浏览器处理 · 音频不上传

视频提取音频
还能直接转成文字

把视频里的声音单独存下来,音轨原样搬运、不重新编码,音质和原片一致; 需要 MP3 也能一键转。再点一下就能转成带时间轴的文字稿,识别同样在你自己的浏览器里跑。

音轨无损提取可转 MP3语音转文字字幕 SRT / VTT / LRC文件不离开本机
提取音频,或者把它转成文字提取和转写都在你自己的浏览器里,文件不上传

把视频或音频拖进来,或者点下面的按钮选一个

视频会只把音轨抠出来,音频则直接用。文件只在本地读取,不会传到服务器, 所以多长的录音都不占上传时间。

想拿抖音、快手这类平台视频的音频?先在首页解析, 解析出来的结果里就有「提取音频」,也能一键带到这里转文字。

提取出来的音频版权归原作者所有,请勿用于商业用途或未经授权的二次分发。

为什么值得单独把音频拿出来

一段访谈、一节网课、一条播客切片,真正有用的往往只是声音。 音频单独存下来,体积通常只有原视频的十分之一,通勤路上塞着耳机就能听完; 要引用其中一句话时,转成文字稿再搜关键词,比拖着进度条来回找快得多。

这个工具不走「解码再重新编码」那条路,而是把视频容器里的音轨字节原样搬进一个 .m4a。所以既不掉音质,也不用等——半小时的视频通常一两秒就处理完, 因为根本没有重新压缩这一步。只有遇到实在读不出音轨的文件,才会退回解码重编成 WAV。

转文字是怎么做到不上传的

识别用的是 OpenAI 的 Whisper 模型,通过 WebAssembly 和 WebGPU 直接跑在你的浏览器里。 第一次用会下载几十到几百 MB 的模型文件,之后浏览器会把它缓存起来,再用就不必重下。 音频本身一个字节都没有离开你的设备——这也正是我们坚持把它放在浏览器里做的原因, 会议录音、私人语音这些东西,本不该为了转个文字先交给别人的服务器。

代价是速度:用 CPU 跑的话,识别一段音频大致要花它本身时长的几分之一到一两倍, 机器支持 WebGPU 会快很多。所以长音频建议先选「快速」档试出效果,再决定要不要换更准的。

操作步骤

三步拿到音频和文字稿

  1. 点「选择本地文件」或者把视频、音频直接拖进虚线框里
  2. 音轨提取完就能试听,点「下载音频」拿原样搬出来的 m4a;需要 MP3 就点旁边那个按钮,码率自己挑
  3. 想要文字稿就选好质量和语言点「转成文字」,完成后可以导出 TXT,或 SRT / VTT / LRC 字幕
功能说明

为听和读这两件事准备的细节

音轨原样搬,不重新编码

MP4 里的音轨字节直接搬进 .m4a,不解码也不重压,音质和原片完全一致。半小时的视频通常一两秒就处理完,体积只有原片的十分之一左右。需要 MP3 时旁边有一个按钮,码率自己挑。

转文字带时间轴

识别结果按句切开,每句都标着它在音频里的位置。点一下时间就能跳到那一句听,核对起来不用来回拖进度条。

导出 TXT、SRT、VTT、LRC

TXT 是连续的全文,直接贴进文档就能改;SRT 剪辑软件和字幕站都认;VTT 是网页 video 标签唯一认的字幕格式;LRC 给播客和音乐播放器的歌词界面用。

音频不离开本机

提取靠浏览器自带的解码器,识别靠跑在本地的 Whisper 模型。文件不会上传到任何服务器,会议录音、私人语音也能放心处理。

三档质量自己挑

「快速」最省时间,「均衡」日常够用,「精准」明显更准但慢三四倍。模型第一次用才下载,之后浏览器缓存着,换页面也不用重下。

和解析、抽帧打通

首页解析出来的视频可以一键带到这里提音频,不必先下载再上传。同一条视频要画面就去抽帧工作台,要声音就来这儿。

常见问题

音频提取与转文字相关问题

提取出来的音频会掉音质吗?

正常情况下不会。工具是把视频容器里的音轨字节原样搬出来,不解码也不重新压缩,得到的 .m4a 和原片里的声音完全一致。只有极少数读不出音轨的文件才会退回解码重编成 WAV,那种情况界面上会明确写出来。

转成 MP3 会掉音质吗?

会掉一点,这是格式决定的,不是工具的问题。视频里的音轨是 AAC,转 MP3 必须先解码成 PCM 再压一遍,属于有损转有损,两次压缩的误差会叠加。想要原汁原味就用默认的 m4a 下载,它是从视频里原样搬出来的;确实需要 MP3 的话把码率选到 192 或 320,损失会小到基本听不出来。

什么时候才需要 MP3?

车载音响、几年前的 MP3 播放器、部分只接受 MP3 上传的平台和一些老软件。除此之外 m4a 更划算——iOS、安卓、Windows、macOS 原生都认,微信能发,剪映和 Premiere 都能直接导入,同码率下 AAC 的音质还比 MP3 好一档。

为什么长音频不能转 MP3?

解码是按未压缩的尺寸占内存的,二十分钟的立体声 44.1kHz 解出来就是四百多 MB,再长浏览器标签页会被系统直接杀掉。所以超过二十分钟那个按钮是灰的,原音轨下载不受影响,想转的话先把视频剪短。

音频和视频会上传到你们服务器吗?

不会。提取和识别都在浏览器本地完成,文件从头到尾待在你自己的设备上。唯一走网络的是第一次下载识别模型,那是从公开的模型仓库拉的,跟你的音频内容无关。

可以只上传一段音频吗?

可以。MP3、M4A、WAV、AAC 这些浏览器能播的音频格式都能直接拖进来,跳过提取那一步直接转文字。

转文字准不准?错字怎么办?

用的是 Whisper 模型,普通话和常见英语内容识别得不错,标点也会自动加。方言、口音重、背景音乐大或者多人抢话的片段会明显变差。选更高的质量档会准一些,代价是慢三四倍。识别完还留了一步兜底:结果区有「复制给 AI 校对」,把文字连同校对要求一起复制走,贴进 DeepSeek 这类对话式 AI,再把它改好的内容整段贴回来就能覆盖,时间轴不会动。本站不接任何 AI 接口,这一步由你自己决定用哪家、要不要用。

转一段音频要多久?

取决于机器和你选的档位。支持 WebGPU 的电脑通常比音频本身的时长快好几倍;只能用 CPU 的话,「快速」档大致和音频时长相当,「精准」档会慢上几倍。界面上有进度,识别到第几分钟看得见。

第一次为什么要等着下载模型?

因为识别是在你本地跑的,模型得先到你机器上。「快速」档约 45 MB,「均衡」约 85 MB,「精准」约 250 MB。下完浏览器会缓存,之后再用同一档就不必重下了。

支持多长的音频?

提取没有实际限制。转文字则是越长等得越久,而且识别过程要把音频完整放在内存里,一小时以上的录音在低配设备上可能吃不消,建议先剪成几段。

想提取平台视频的音频?

先用首页的解析工具解析出无水印原片,结果里就有「提取音频」,也能一键带到这里转文字。

去解析视频