文档中心

使用指南、教程和常见问题

人声分离与分轨有什么区别

常见问题

人声分离和分轨有什么区别?
人声分离输出两路:人声和其余全部。分轨输出多条独立声部,通常是人声、鼓、贝斯和剩余和声。两者是同一套技术的不同档位,只有打算重新混音时,拆成多轨才值得。
什么时候该用分轨,而不是只分离人声?
当你想把某一件乐器单独处理、采样某一元素的 loop、替换鼓组,或者只对某一部分做均衡和压缩而不影响其他部分时。做卡拉OK 或清唱,两路分离就够了。
为什么我分离出来的伴奏又薄又有回声?
那是声道相减的典型结果。拿一路立体声声道减另一路,假定人声在正中央,会把底鼓、贝斯和一部分人声一起减掉。基于重建的分离不会有这个问题,因为它从不做减法。
为什么分出来的 stem 加不回原曲?
有些工具在重建每一路时会丢能量,叠起来就比原素材薄。互补式分离能精确还原,因此重新混音是可逆的。

简短答案

人声分离给你两个输出:人声,和其余所有。决定权在工具手里。 分轨给你独立的声部——通常是人声、鼓、贝斯和剩余和声——每一条都可以当成单独音轨来用。

两者是同一个底层技术的不同设置。分四份做的活更多、更有用;只想拿个伴奏来唱,只分人声一次就够。

两者要解决的同一个问题

一段录好的混音就是一条波形。每件乐器在同一时刻占据同样的频率——80 Hz 的底鼓和 82 Hz 的贝斯音符重叠,底下可能还垫着人声的低频。这里没有可以下刀的缝。任何号称能把乐器取出来的工具,都必须估计每个瞬间里有多少属于它,再重建出一条缺了它的信号。

现在的做法是训练一个神经网络,让它学会每件乐器在频谱上、在时间上通常长什么样。更早的做法是纯算术,两者音质的差距,就是你听过的大部分翻车事故的来源。

为什么廉价版本会失败

常见的取巧做法是假定人声被摆在正中央,然后一路声道减另一路。对 1960 年代的立体声录音,这招出人意料地好用。对现代录音则完全失效,因为现代混音的中央塞满了东西:底鼓、贝斯、军鼓、钢琴,有时候还有第二个人声。

拿回来的是一个单薄、相位错乱的版本,贝斯和人声都被削掉了一部分。这不是你调参数能救的——信息在一开始就没被分开,只是被平均掉了。

该选哪一个

选人声分离,如果你要:

  • 一条卡拉OK 或伴奏,用来唱/弹
  • 一个清唱版本,用来做翻唱或视频
  • 把人声单独拎出来研究
  • 拿伴奏去覆盖一段版权敏感的片段

选完整分轨,如果你要:

  • 重新混音——把鼓拿出来换一段新节奏
  • 采样,并且想要某一元素的干净 loop
  • 只对某件乐器做均衡或压缩,不动其他部分
  • 做卡拉OK 时想用自己的声音盖掉原唱

输出质量上的实际注意点

素材越难分,分出来的东西就越需要后期收拾:

串音。 每条 stem 里都会残留一点别的乐器。把分轨先降噪再混回去,改善很明显。 瑕疵。 非常密集或重度失真的素材会产生颤音。在 stem 两端加一个短淡入淡出能遮掉大部分。 相位。 分轨之间有时会有几毫秒的时间偏移。如果你的重混听着发空,先把某条轨挪几毫秒,别急着开均衡。

stem 值不值得拆,看这一点

当一次分离是互补的——所有 stem 相加精确等于原始混音——你就可以放心大胆地分离,不损失任何东西。任意重组各声部,原曲永远可以还原。在重建过程中会丢能量的工具做不到这一点:叠它们的 stem,混出来的结果会永久地比原始素材薄。

如果你打算拿 stem 做实验,这个性质比任何单条 stem 的保真度都值钱,因为每一次实验都可逆。