音轨原样搬,不重新编码
MP4 里的音轨字节直接搬进 .m4a,不解码也不重压,音质和原片完全一致。半小时的视频通常一两秒就处理完,体积只有原片的十分之一左右。需要 MP3 时旁边有一个按钮,码率自己挑。
把视频里的声音单独存下来,音轨原样搬运、不重新编码,音质和原片一致; 需要 MP3 也能一键转。再点一下就能转成带时间轴的文字稿,识别同样在你自己的浏览器里跑。
把视频或音频拖进来,或者点下面的按钮选一个
视频会只把音轨抠出来,音频则直接用。文件只在本地读取,不会传到服务器, 所以多长的录音都不占上传时间。
想拿抖音、快手这类平台视频的音频?先在首页解析, 解析出来的结果里就有「提取音频」,也能一键带到这里转文字。
提取出来的音频版权归原作者所有,请勿用于商业用途或未经授权的二次分发。
一段访谈、一节网课、一条播客切片,真正有用的往往只是声音。 音频单独存下来,体积通常只有原视频的十分之一,通勤路上塞着耳机就能听完; 要引用其中一句话时,转成文字稿再搜关键词,比拖着进度条来回找快得多。
这个工具不走「解码再重新编码」那条路,而是把视频容器里的音轨字节原样搬进一个 .m4a。所以既不掉音质,也不用等——半小时的视频通常一两秒就处理完, 因为根本没有重新压缩这一步。只有遇到实在读不出音轨的文件,才会退回解码重编成 WAV。
识别用的是 OpenAI 的 Whisper 模型,通过 WebAssembly 和 WebGPU 直接跑在你的浏览器里。 第一次用会下载几十到几百 MB 的模型文件,之后浏览器会把它缓存起来,再用就不必重下。 音频本身一个字节都没有离开你的设备——这也正是我们坚持把它放在浏览器里做的原因, 会议录音、私人语音这些东西,本不该为了转个文字先交给别人的服务器。
代价是速度:用 CPU 跑的话,识别一段音频大致要花它本身时长的几分之一到一两倍, 机器支持 WebGPU 会快很多。所以长音频建议先选「快速」档试出效果,再决定要不要换更准的。
MP4 里的音轨字节直接搬进 .m4a,不解码也不重压,音质和原片完全一致。半小时的视频通常一两秒就处理完,体积只有原片的十分之一左右。需要 MP3 时旁边有一个按钮,码率自己挑。
识别结果按句切开,每句都标着它在音频里的位置。点一下时间就能跳到那一句听,核对起来不用来回拖进度条。
TXT 是连续的全文,直接贴进文档就能改;SRT 剪辑软件和字幕站都认;VTT 是网页 video 标签唯一认的字幕格式;LRC 给播客和音乐播放器的歌词界面用。
提取靠浏览器自带的解码器,识别靠跑在本地的 Whisper 模型。文件不会上传到任何服务器,会议录音、私人语音也能放心处理。
「快速」最省时间,「均衡」日常够用,「精准」明显更准但慢三四倍。模型第一次用才下载,之后浏览器缓存着,换页面也不用重下。
首页解析出来的视频可以一键带到这里提音频,不必先下载再上传。同一条视频要画面就去抽帧工作台,要声音就来这儿。
正常情况下不会。工具是把视频容器里的音轨字节原样搬出来,不解码也不重新压缩,得到的 .m4a 和原片里的声音完全一致。只有极少数读不出音轨的文件才会退回解码重编成 WAV,那种情况界面上会明确写出来。
会掉一点,这是格式决定的,不是工具的问题。视频里的音轨是 AAC,转 MP3 必须先解码成 PCM 再压一遍,属于有损转有损,两次压缩的误差会叠加。想要原汁原味就用默认的 m4a 下载,它是从视频里原样搬出来的;确实需要 MP3 的话把码率选到 192 或 320,损失会小到基本听不出来。
车载音响、几年前的 MP3 播放器、部分只接受 MP3 上传的平台和一些老软件。除此之外 m4a 更划算——iOS、安卓、Windows、macOS 原生都认,微信能发,剪映和 Premiere 都能直接导入,同码率下 AAC 的音质还比 MP3 好一档。
解码是按未压缩的尺寸占内存的,二十分钟的立体声 44.1kHz 解出来就是四百多 MB,再长浏览器标签页会被系统直接杀掉。所以超过二十分钟那个按钮是灰的,原音轨下载不受影响,想转的话先把视频剪短。
不会。提取和识别都在浏览器本地完成,文件从头到尾待在你自己的设备上。唯一走网络的是第一次下载识别模型,那是从公开的模型仓库拉的,跟你的音频内容无关。
可以。MP3、M4A、WAV、AAC 这些浏览器能播的音频格式都能直接拖进来,跳过提取那一步直接转文字。
用的是 Whisper 模型,普通话和常见英语内容识别得不错,标点也会自动加。方言、口音重、背景音乐大或者多人抢话的片段会明显变差。选更高的质量档会准一些,代价是慢三四倍。识别完还留了一步兜底:结果区有「复制给 AI 校对」,把文字连同校对要求一起复制走,贴进 DeepSeek 这类对话式 AI,再把它改好的内容整段贴回来就能覆盖,时间轴不会动。本站不接任何 AI 接口,这一步由你自己决定用哪家、要不要用。
取决于机器和你选的档位。支持 WebGPU 的电脑通常比音频本身的时长快好几倍;只能用 CPU 的话,「快速」档大致和音频时长相当,「精准」档会慢上几倍。界面上有进度,识别到第几分钟看得见。
因为识别是在你本地跑的,模型得先到你机器上。「快速」档约 45 MB,「均衡」约 85 MB,「精准」约 250 MB。下完浏览器会缓存,之后再用同一档就不必重下了。
提取没有实际限制。转文字则是越长等得越久,而且识别过程要把音频完整放在内存里,一小时以上的录音在低配设备上可能吃不消,建议先剪成几段。