音视频

视频音轨编辑

给视频静音、换掉整条音轨、在原声上垫一段背景音乐,或者把录小了的声音调大。四种模式都不碰画面,视频流原样复制过去,需要重新编码的只有声音,所以才这么快。FFmpeg 在你的标签页里运行,文件不上传。

  • 每一种模式都是把视频流原样复制,导出来的画面就是你拍到的画面
  • 时间轴画出加进来的音频从哪开始、到哪结束,导出前还能直接试听

把视频拖到这里

文件留在你的电脑上,不会上传

可读取 MP4、MOV、MKV、WebM、AVI、WMV、FLV、MPEG-TS、MPG、3GP,以及 FFmpeg 认识的绝大多数格式。

把声音去掉,整段去掉或者只去掉其中一段。整条音轨不写进去的话,两边都不解码,是这里最快的一种。

还没有视频

先选一个视频文件。选了之后才会开始下载引擎。

音轨

功能简介

改视频的声音,动的是文件里两条流中的一条,另一条根本没有解码的理由。这里就是这么做的,所以下面每一种模式都很快,画面也和你拍到的一模一样。

  1. 01

    画面只复制,从不重新编码

    不管你对声音做什么,视频流都是一个包一个包搬过去的。不解码、不缩放、不重新压缩,所以 4K 素材出来还是那份 4K 素材,而不是它的又一次转录。为了静音就把整个文件重编一遍的网站,等于用一段漫长的等待和一次肉眼可见的画质下降,换一个只涉及一条流的操作。

  2. 02

    四件真正有人要做的事

    去掉声音,整段或者只去掉某一段;换掉整条音轨;在原声之上垫一层音乐,两边音量分开调;或者把录小了的声音提上来。每一件是一个独立模式,只显示这件事需要的选项,而不是把所有开关堆在一个面板里。

  3. 03

    导出之前就画清楚音频够不够长

    音频一加进来就会画在时间轴上:从哪开始、铺到哪、结尾还剩多少没有声音、有多少放不下会被截掉。「音乐比视频短了十五秒」通常是下载完才发现的事,其实完全可以提前告诉你。

  4. 04

    先听,再决定

    按下播放,浏览器就会按你设的音量、淡入淡出和起始位置,把视频和新音轨实时混在一起。背景音乐压在人声下面到底多大合适,本来就是靠耳朵定的;先猜一个数字、再渲染一遍去验证,是最慢的那条路。

  5. 05

    有时候连声音也不用重编

    如果直接放一条现成音轨进来,不改音量、不加淡入淡出、也不挪起点,而容器又正好收得下它的编码,那声音也是复制的。两条流都原样搬过去,整件事就成了重写一个文件,成品里的画面和声音就是这两个文件带来的那两条流。这一点会在动手之前写在计划里。

  6. 06

    本地处理,不上传

    FFmpeg 编译成 WebAssembly 在标签页里跑。不上传、不排队、不打水印、不需要账号,也没有为了预览而截断时长。采访素材、客户录像、有保密约定的内容全都留在你的电脑上,处理过程中打开网络面板就能自己确认。

如何使用

从一段声音不对的录像,到一段声音对了的录像,四步。

  1. 01

    选择视频。引擎会从这一步开始下载,大约 31 MB,只需要一次。然后会读出时长、编码格式,以及它到底有没有音轨。

  2. 02

    选择要做什么:静音、替换音轨、在原声上加音乐,或者调音量。后两种里的替换和加音乐需要再选一个音频文件,MP3、M4A、WAV、FLAC 等常见格式都能读。

  3. 03

    设好音量、淡入淡出和新音轨的起点,然后点播放听一遍。下方时间轴会显示新的声音铺到了哪里、有多少被截掉、有多少地方还是空的。

  4. 04

    点开始处理。成品会拿你输入的视频时长核对一遍,然后出现在右边,下载前可以先播一遍。

功能说明

决定你拿回来的文件是不是你要的那一个的那些细节。

  • 每种模式都把视频流一个包一个包复制过去,画面不解码、不缩放、也不重新压缩
  • 四种模式:去掉声音、替换音轨、在原声下面加一条、调整原声音量
  • 可以只把其中一段变成无声,范围在文件长度上拖两个滑块选
  • 实时预览会按你设的音量、淡入淡出和起点,把视频和新音轨混在一起播
  • 音量同时用百分比和分贝显示,从完全静音到约八倍增益,刻度按听感排布
  • 可以测出视频现有声音的最响处和平均值,一键把峰值提到接近上限的位置
  • 时间轴显示新音轨从哪开始、覆盖了多少、截掉了多少、结尾还剩多少是空的
  • 音频比视频短时可以循环,并显示循环几遍;也可以就让后面留白
  • 淡入淡出对当前写出的那条音轨生效,长度上限是它自身的一半,不会出现淡过头
  • 混音和提升音量时可开启峰值控制,把总和压在满刻度以下,没撞上限时听不出来
  • 输出保持输入的封装格式,声音格式只在这个容器真正接受的范围内选
  • 成品会拿输入视频的时长核对一遍,画面被截短会被报出来而不是直接交给你
  • HEVC、AV1、VP9、ProRes 以及 FFmpeg 能解封装的其他编码都能处理,因为它们从来不会被解码
  • 全程在浏览器标签页里完成,不上传、不排队、不需要账号、不打水印、不限时长

适合哪些场景

人们来找「怎么改视频声音」时,通常正卡在这些地方。

  1. 背景噪音大到没法用的录像

    在马路边、大风天或者空调呼呼响的房间里拍的片段,画面往往是想留的,声音是想扔的。去掉音轨不动画面,也就给后面配旁白或者垫音乐留出了位置,在这里做或者拿到剪辑软件里做都行。

  2. 拍进去了没有授权的音乐

    拍摄时旁边正开着收音机或者歌单,视频发出去可能被平台自动消音甚至下架。自己先把声音去掉、换成能用的曲子,主动权就回到了你手上,而且画面在这个过程里没有被重编。

  3. 单独录的旁白

    用手机或者正经麦克风单独录旁白,音质比相机收音好得多。替换模式把它放到视频上,起点滑块可以让它和画面对齐,不用为此打开一整套剪辑时间轴。

  4. 给已有人声垫一层背景音乐

    在口播或者产品视频下面加一层轻音乐,是「混音」而不是「替换」最常见的场景。两边音量分别可调,配比是听出来的不是猜出来的,峰值控制还能防止两路叠起来变成失真。

  5. 录得太小声的素材

    相机麦克风增益调低了,或者领夹麦滑了位置,出来的文件正常音量下根本听不清。先测一下,看清它离满刻度还差多少,再按这个数提上去,比凭感觉拧一个数字靠谱得多。

  6. 只有中间某一段必须去掉

    响起的手机铃、不该留在文件里的姓名、录制中途的一句闲话,往往只涉及几秒钟。把这一段变成无声,其余部分的音量原样保留,画面也不动,一遍就处理完了。

  7. 完全没有声音的录屏

    录屏工具经常在没接麦克风的情况下导出。给一段无声录像配旁白或者音乐,操作方式和替换音轨一样,而且工具会直接告诉你「没有可混的原声」,不会闷头产出一个奇怪的文件。

  8. 不能离开本机的素材

    采访、医疗录像、法务材料,以及任何签了保密约定的内容,不该为了去掉一条音轨就传到别人的服务器上。这里全部在标签页里完成,打开网络面板就能看到什么都没发出去。

延伸阅读

本工具产出的是视频,所以把音轨从录像里抽出来存成 MP3 或 WAV,或者先把另一段录像的声音准备好,是 音频转换器的事。这里改的是整个文件的声音,也从不缩短画面,所以只想要其中一段的话,得先去 视频截取把视频剪到那一段。至于成品保持了输入的封装格式,之后想换成别的格式,那是 视频格式转换的活。

为什么改声音不用赔上画面

这个工具看起来反常的地方,大多来自视频文件的一个结构事实;剩下的来自响度是怎么量出来的。

  1. 一个视频文件里装着两条流

    MP4、MOV、MKV 这些都是容器:里面并排放着一条压缩过的画面流和一条压缩过的声音流,各带各的时间戳,互相并不知道对方的存在。换掉其中一条,是往同一个壳子里写另一条流,而不是把文件重新做一遍。

  2. 所以画面在这里从来不用解码

    改尺寸、换格式、压体积这些活,最后都得把帧解出来再编回去,等待和画质损失都是从那儿来的。而声音的事一样都不需要。所以画面的数据包读出来就直接写回去,成品里的画面和原来是同一份数据。

  3. 也所以 HEVC 和 AV1 在这里不是问题

    在本站其他视频工具里,这两种编码都要附带说明:这个构建写不了 HEVC,也没有硬件可以用来解 AV1。但只做复制时它们都不成问题,数据包搬家的时候没人往里面看。iPhone 拍的 HEVC 和从网上下的 AV1 在这里就是普通输入。

  4. 去掉整条音轨和静音一段,是两件事

    整条不写,就是什么都不解码,操作等同于复制文件。把中间十秒变成无声,音轨得存在而且内容要变,就必须解码、修改、再编一遍。两者都不动画面,但只有前一件是免费的。

  5. 容器决定新的声音能是什么格式

    每种封装格式只接受一份固定的编码清单。MP4 收 AAC 和 MP3,所以你放进去的 MP3 会被直接复制进去;WebM 两个都不收,进去的音轨会编成 Vorbis。这也是输出格式跟着输入走的原因——原容器是唯一确定能原样收下这条视频流的壳子。

  6. 两路声音叠起来会撞上限

    数字音频有一个硬上限,记作 0 dB。音乐垫在人声下面是把两条波形相加,峰值正好撞到一起时总和就可能越过这个上限。越过去的部分会被削平,听上去就是噼啪声。把峰值压在上限下面一点就能避免,而没有撞上限时它什么也不做。

使用建议

想一次就拿到满意的文件,这几件事值得先做。

  • 点开始处理之前先听一遍预览,人声和背景音乐的配比本来就是听出来的,试听只花几秒,渲染一遍再验证要花几分钟
  • 背景音乐先从原声的四分之一左右起步,然后按耳朵调,不用算
  • 音乐盖住人声时,优先把原声压低一点,而不是把音乐调大,这样总电平离上限更远
  • 给太小声的素材提音量之前先测一下,测量能告诉你到底还剩多少余量,猜不行
  • 只要有两路声音同时在响,就把峰值控制留着,反正没有真的撞上限时它什么都不做
  • 给新加的音轨首尾各留一两秒淡入淡出,这是大多数人一耳朵能听出来「像不像剪过」的地方
  • 一小段音乐要铺满一个长视频时用循环,别去找更长的文件,然后在时间轴上看最后一遍是从哪里断的
  • 只想要视频的一部分就先去截取,本工具改的是整个文件的声音,不会把视频变短

边界与注意事项

这个工具刻意不做的事,以及它会吃力的地方。

  • 它只改声音。画面不会被缩放、转码、压缩或者剪短,文件进来多长出去还是多长。
  • 它没法把一种声音从另一种里分离出来。把人声里的车流声去掉、把伴奏里的人声抽走、消掉底噪,都属于分离问题,这里一样也不做——能选的只有整条音轨或者其中一段。
  • 一次只能加一条音轨。前后接两段音乐,或者旁白加背景乐再加音效,得用剪辑软件。
  • 进去一条音轨,出来一条音轨。带多条语言音轨的文件只保留第一条,字幕和章节也不会保留。
  • 静音区间在你设的时刻开始和结束,两端没有过渡。正好落在很响的地方时,接缝可能听得出一声轻响。
  • 编码过的声音是有损的。AAC、MP3、Vorbis 这些格式按设计就要丢掉一部分细节,所以在这里被解码再编码的音轨,无论码率多高都比源文件多了一代损失。只有复制那条路径没有这个问题,计划卡片会写明你走的是哪一条。
  • 峰值控制压的是即将超出上限的总和,它撤销不了文件里本来就录进去的失真。拍摄时就爆掉的声音仍然是爆的。
  • 输出保持输入的封装格式,因为原容器是唯一确定能原样收下这条视频流的壳子。换格式是另一件事,交给另一个工具。
  • 加进来的必须是音频文件。想用另一个视频里的声音,得先把它的音轨提取出来,那是下面链接里的另一步。
  • 预览是浏览器把两个文件同步播放、再经过一层增益节点得到的。音量、淡入淡出和起点都和最终渲染一致,但它毕竟是实时混音而不是成品文件,机器吃力时两边可能短暂偏移,随后会被拉回来。
  • 测量响度要把整条音轨读一遍,长视频需要等一会儿。它报的是最响的那一个采样点和整体平均值,这和广播行业的响度标准不是一回事。
  • 首次使用要下载约 31 MB 的引擎。之后会被缓存,但在一个全新的浏览器配置里第一次处理要付这份下载。
  • 浏览器本身解不了的文件,在这里无论输入还是输出都没法预览、也没法试听。具体是哪些取决于浏览器:AVI 和 WMV 到哪儿都不认,HEVC 在 Safari 能播、别处基本不能,MKV 则有的浏览器收有的不收。浏览器不能预览不代表引擎不能处理;下载结果后请用播放器再确认。
  • 整个文件会和结果一起放在内存里,而 WebAssembly 是 32 位的,所以体积超过大约四分之一 GB 之后就不稳了,在手机上尤其明显。

常见问题

视频配错了声音时,最常被问到的那些问题。

怎么去掉视频里的声音?

把视频放进来,模式保持在静音、范围选整段视频,然后点开始处理。音轨直接不写进输出文件,视频流则一个包一个包复制过去,两边都不解码,画面完全不动。它通常比重编整段视频快得多,但仍要读写完整个文件,等待时间会随文件体积增加。输出格式也和你输入的一样。

怎么把视频的音轨换成我自己的音频?

选替换音轨,再选一个音频文件,MP3、M4A、WAV、FLAC 等常见格式都能读。原来的声音会被丢掉,你的音轨写在它的位置上。起点在哪、比视频短时要不要循环、音量多大、要不要淡入淡出都由你定,时间轴会画出它铺到了哪里。如果这条音轨不需要任何调整,而容器又收得下它的编码,它会被直接复制进去而不重编,两条流都是原样过来的。

视频静音之后画质会变差吗?

不会。视频流是复制而不是解码的,所以成品里的画面就是原来那份压缩数据,而不是对它的再一次压缩。这一点值得说清楚,因为大多数在线消音网站是靠把整个文件重编一遍来实现的,为一个只涉及一条流的操作付出漫长的等待和一代肉眼可见的画质损失。这里唯一失去的是声音,而那正是你要的。

我的视频会被上传吗?

不会。引擎是编译成 WebAssembly 的 FFmpeg,在你的浏览器标签页里运行。两个文件都是从硬盘读进标签页内存的,做好的视频再作为下载写回去。它们都不经过网络,你可以在处理过程中打开网络面板自己确认。

怎么给视频加背景音乐?

选加背景音乐,把曲子放进来。原声会保留,音乐按你设的音量垫在下面,口播类内容通常从原声的四分之一左右起步。先点播放:浏览器会按当前设置同时播两路,让你在渲染之前就听到配比,而不是之后。音乐比视频短时选循环可以铺到结尾,比视频长时多出来的部分会被截掉,时间轴上会写明截掉多少。

视频声音太小,怎么调大?

选调音量,点「测一下现在多大声」。它会把整条音轨读一遍,报出最响处和平均值,单位是相对满刻度的分贝——一段峰值在 −18 的录音,就是还有 18 分贝没用上的余量。再把峰值提到接近上限,用的正好就是这段余量,比先猜一个数再渲染去看结果可靠得多。要注意的是,把小声的录音提上来,底噪也会跟着上来;录制时就爆掉的声音也没法靠这个救回来。

音乐比视频短怎么办?

你可以选。后面留白就是播完一遍之后视频剩下的部分没有新的声音;循环则是每次播完立刻从头开始,一直到视频结束。两种做法视频都保持原来的长度——这句话值得单独说,因为命令行上给视频配音频最常见的那种写法,会把画面截短到和较短的那条音轨一样长,而这正是本工具重点要避免的失败。成品在交给你之前会拿原始时长核对一遍。

能只把视频中间的一段静音吗?

可以。选静音,把范围从整段视频切到其中一段,然后在文件长度上拖出区间。区间以外的声音保持原来的音量。改动音轨内容和整条丢掉不一样,需要把声音解码再编一遍,不过画面照样是复制的。区间两端是硬切,落在很响的地方时接缝可能听得出来。

导出来是什么格式?

和你放进去的封装格式一样:MP4 出来还是 MP4,MOV 还是 MOV,WebM 还是 WebM。这是有意为之而不是能力不足——原容器是唯一确定能原样收下这条视频流的壳子,换成别的就可能逼着画面重编一次,而重编画面恰恰是这个工具从不做的事。如果你还需要别的格式,处理完再用视频格式转换转一次。

能反过来把视频里的音频提取出来吗?

这里不行,本工具产出的是视频而不是音频文件。把音轨从录像里抽出来存成 MP3、M4A、WAV 或 FLAC,是下面链接的音频转换器负责的事;想用另一个视频里的声音给这个视频配音,也是先去那边提取,再把音频文件拿回来。

新加的声音为什么没铺到视频结尾?

因为它比视频短,而且设成了只播一遍。时间轴上写得很直接:新的声音覆盖了视频的多少、结尾还剩多长是空的。解决办法是改成循环、把起点往前挪,或者换一个更长的文件。反过来的情况也是同样的显示方式:音轨比视频长时多出来的部分会被截掉,截掉多少在渲染之前就写出来,而不是事后才发现。

iPhone 拍的、4K 的、HEVC 的视频能处理吗?

能,而且比本站其他视频工具更顺。iPhone 的 HEVC 录像和网上下载的 AV1 在别处比较麻烦,因为这个构建写不了 HEVC,也没有硬件可以用来解 AV1。但只做复制时这两条都不成立——数据包搬过去的时候没人往里面看。分辨率同理:4K 文件和 720p 文件花的时间一样,因为两者都不会被解码。唯一会受影响的是预览:浏览器放不了 HEVC,在这里同样放不了,所以在 Chrome 或 Firefox 上处理 iPhone 素材时是听不到试听的,只能凭数值设置。

更多相关工具

更多在本地、只跑在浏览器里的音视频工具。