高品質人聲抽取:AI Vocal Remover 提取純淨 Acapella
另外還有一個關鍵概念叫殘響(Reverb)與混響分離。真實錄音中,人聲不會是乾淨的乾聲,它一定帶著空間感。有些模型會嘗試把人聲的「乾聲」與「空間殘響」一起抽出來,有些則只抽乾聲,導致人聲聽起來很扁。這也是為什麼同一組模型,搭配不同設定,成果可能天差地遠。
二、主流 AI Vocal Remover 工具實測與評比
市面上的工具大致可以分成三類:線上服務、桌面軟體/DAW 插件、開源模型。這三類沒有絕對優劣,關鍵是你的使用情境。
線上免費工具:快速、免安裝,但要注意格式與隱私
線上工具的最大優勢是「零門檻」。打開瀏覽器、拖進檔案、等幾十秒、下載成品,整個流程不需要安裝任何東西。對於偶爾需要一段 acapella 的人來說,這是最省事的選擇。
常見的線上服務包括 Vocalremover.org、Moises 的網頁版、LALAL.AI 的試用版、以及各種打著「AI 人聲分離」名號的免費網站。它們多半使用開源模型(後面會談)包裝而成,差別主要在介面、輸出格式、以及是否限制檔案長度與取樣率。
使用線上工具時,有幾件事一定要留意:
結論:線上工具適合「臨時應急」與「非商業用途」。如果你只是想做一支社群短片,它完全夠用;但如果你要拿去混音、發行、或做正式的二創作品,它通常不是終點。
桌面軟體與專業 DAW 插件:品質與可控性的天花板
當你開始在意品質,就會往桌面端走。這條路線的選項包括:
桌面端最重要的價值不是「分得更乾淨」,而是可控性。你可以選擇不同模型、調整重疊區間、決定要不要保留殘響、甚至把分離出來的人聲再丟進第二次分離做淨化。這些彈性,是線上工具完全給不了的。
開源模型:Demucs、MDX-Net、UVR5 的差異
如果你想要的是「理解本質」而不只是「按按鈕」,那一定要認識這幾個名字。
Spleeter 是 Deezer 在 2019 年釋出的開源模型,可以說是把「AI 音源分離」帶進大眾視野的功臣。它提供 2 stems(人聲/伴奏)與 5 stems(人聲/鼓/貝斯/鋼琴/其他)兩種模式。優點是輕量、速度快,缺點是品質以現在標準來看已經明顯落後,高頻容易破損、人聲帶有明顯的數位感。
Demucs 由 Meta(原 Facebook)的研究團隊開發,目前已演進到 HT Demucs(Hybrid Transformer Demucs)系列。它在多個公開評測(如 MUSDB18)上長期名列前茅,特點是波形域處理、對相位還原良好,人聲自然度高。代價是運算量較大,沒有 GPU 的話跑一首歌可能要等上好幾分鐘。
MDX-Net 系列則是社群(特別是 UVR5 生態系)中大量使用的模型架構,衍生出非常多變體,例如針對人聲優化的 MDX23C、Kim Vocal 系列等等。這類模型的優點是「專精」——有些專門處理人聲,有些專門處理鼓,有些專門對付殘響。實務上,最好的做法往往不是只用一個模型,而是針對不同素材挑選不同模型,甚至多個模型疊加。
這裡要提醒一個觀念:沒有「最強模型」,只有「最適合這首歌的模型」。一首 1970 年代的類比錄音、一首 2020 年代的電子舞曲、一首純鋼琴伴奏的抒情歌,最佳模型可能完全不同。這也是為什麼專業玩家會同時裝好幾個模型,逐一切換試聽。
三、實戰流程:從原始音檔到乾淨 Acapella 的六個步驟
接下來進入實作。以下流程適用於 UVR5 或任何具備多模型切換能力的桌面工具,線上工具只能做到其中一部分,但觀念是共通的。
步驟一:素材盤點與前置處理
很多人忽略了這一步,但它對成果的影響可能超過模型選擇。
首先,來源品質決定上限。如果你手上的檔案是 YouTube 轉出來的 128kbps MP3,那高頻已經被砍掉了,再強的模型也救不回來。盡量取得無損(FLAC、WAV)或至少 320kbps 的來源。如果只能從串流平台取得,記得確認下載格式。
其次,確認檔案的聲道與取樣率。立體聲檔案通常分離效果更好,因為模型可以利用左右聲道的差異來判斷音源位置。如果來源是單聲道,先轉成立體聲(雖然不會無中生有,但能避免某些工具報錯)。
第三,修掉明顯的異常。如果檔案開頭有爆音、有 DJ 旁白、有淡入淡出,建議先在音訊編輯軟體裡裁掉。這些異常會干擾模型判斷,特別是突然的巨大音量變化,常常會讓分離結果出現一段「破音」。此外,如果歌曲有明顯的剪接點或變速,也建議先處理成連續版本。
最後,如果要處理整張專輯,建議先做一次「試跑」:挑一首最具代表性的歌,跑完之後仔細聽,確認模型與參數設定可行,再批次處理。這樣可以省下大量重工時間。
步驟二:模型選擇與參數設定
進入工具之後,第一個要面對的就是模型清單。以下提供一個實用的判斷邏輯:
參數方面,最常調整的包括:
步驟三:多模型堆疊與二次淨化
這是「高品質」與「堪用」之間的分水嶺。單一模型跑出來的人聲,通常會殘留兩類東西:伴奏殘影(例如鼓的殘響、貝斯的低頻嗡鳴)與人聲瑕疵(例如水下感、金屬感、唇齒音被磨掉)。
進階做法是「堆疊」:
第一輪:主模型分離。用你最信任的模型跑出人聲軌。
另外一個實用技巧是「保留兩版」:一版是較為保守、人聲自然但可能殘留一點伴奏的結果;另一版是較為激進、人聲乾淨但聽起來略薄。在混音階段,你可以根據上下文選用,甚至把兩版用不同比例混合。
步驟四:修補殘響、唇齒音與爆音
分離出來的人聲,通常會有三個典型問題。
第一,殘響不自然。 因為原曲的人聲殘響與伴奏殘響在頻譜上是重疊的,模型往往只能抓一部分。結果就是人聲聽起來「乾中帶濕」,空間感斷斷續續。處理方式是:要嘛把殘響壓得更乾(用 gate 或 de-reverb 工具),要嘛乾脆加一層新的殘響蓋上去,讓它聽起來一致。
第二,唇齒音受損。 齒音(s、sh、t 音)能量集中在 5kHz 到 10kHz,而這個頻段正是分離模型最容易誤判的地方。常見的補救是用 de-esser 控制過度刺耳的齒音,同時用輕微的高頻激勵(exciter)補回一點空氣感。但切記:補不回來的東西不要硬補,過度激勵會讓人聲變得「沙沙的」。
第三,爆音與接縫。 如果處理過程中出現「喀」的一聲,通常來自片段接縫或音量突變。可以在音訊編輯軟體中手動修掉,或調整 overlap 參數重跑。
如果你使用的是 iZotope RX 這類工具,Spectrogram Repair、De-reverb、De-click 這些模組會非常有幫助。它們不能無中生有,但可以把已經分離出來的人聲修得更「像樣」。
步驟五:動態處理與音量標準化
分離出來的人聲,動態範圍往往比原始混音大得多。這是因為模型把伴奏移除之後,原本被人聲「壓住」的細節全部跑出來了,導致安靜的地方變得太安靜、大聲的地方又太突兀。
處理順序建議如下:
這一步的關鍵心態是:你是在修復,不是在重製。分離出來的人聲永遠不可能等同於原始錄音的乾聲,所以目標應該是「聽起來自然、可用」,而不是「聽起來像錄音室母帶」。
步驟六:匯出與存檔規範
最後是存檔。這一步看起來很無聊,但養成好習慣會省下未來無數麻煩。
四、常見問題與疑難排解
以下整理幾個實務上最常被問到的問題,以及對應的處理思路。
分離出來的人聲為什麼聽起來「水下感」很重?
所謂「水下感」,通常來自三個原因:相位還原不良、高頻缺失、以及頻譜遮罩過度。
相位問題最常見於頻譜遮罩派的模型。當模型判斷某個時頻格子屬於人聲時,它還原波形的方式如果太粗糙,就會產生那種「悶悶的、像隔著牆」的感覺。解法是改用波形域模型(如 Demucs 系列),或提高 overlap 讓相位估算更連續。
高頻缺失則是因為模型在訓練時,高頻資料相對稀少,加上壓縮格式本身已經砍掉高頻,導致分離後 10kHz 以上幾乎空白。解法是從來源著手(用無損檔),並在後期用輕微的高頻補償。
頻譜遮罩過度則是參數設太激進。如果你把 aggression 調到最高,模型會傾向「寧可錯殺」,結果人聲也被削掉一大塊。建議把參數調回中間值,用「多跑幾輪、每輪溫和」的方式取代「一輪激進」。
為什麼有些歌怎麼分都分不乾淨?
這是必然的,不是你的錯。以下幾種情況天生就難分:
重殘響的錄音:殘響會把聲音「塗抹」開來,模型難以定位。
低品質來源:前面提過,128kbps 的檔案本來就沒有足夠資訊。
現場版本:觀眾聲、PA 回授、樂器串音,都會讓分離變得極端困難。
遇到這類素材,實務上的建議是「降低期待」。與其追求完美分離,不如把目標設定為「做出一段可用的樣本」,然後用其他方式補強——例如自己重唱、用合成器補伴奏、或用效果器掩蓋瑕疵。
伴奏殘留人聲怎麼辦?
如果你要的是 instrumental 而不是 acapella,那問題反過來:伴奏裡還聽得到人聲的影子。這通常是因為模型在判斷時,把一部分人聲成分歸類到伴奏軌。
解法有幾個:一是換模型重跑,不同模型對「人聲邊界」的判斷不同;二是把伴奏軌再丟進一次分離(有些工具支援「只取伴奏」模式);三是用 EQ 或動態處理,針對人聲主要頻段(約 300Hz 到 3kHz)做輕微的動態衰減,但這會連帶影響樂器,要小心使用。
另外一個常被忽略的技巧是用不同模型跑兩次,然後取交集或差集。聽起來很土,但實務上有效。
五、法律與倫理:二創之前你該知道的事
這一節不是要嚇你,而是希望你在享受技術便利的同時,不要踩到不該踩的線。
首先要釐清一個常見誤解:「AI 分離」不等於「取得授權」。你從一首歌裡抽出人聲,並不會因此取得該錄音的任何權利。人聲本身涉及兩個層面的權利:一個是錄音著作權(由唱片公司或製作方擁有),一個是詞曲著作權(由創作者或版權方擁有)。分離動作只是技術操作,不改變權利歸屬。
那麼,什麼情況下可以用?大致可以分成幾種:
除了法律,也談一下社群倫理。在音樂製作圈裡,直接拿別人的 acapella 當自己的作品發布,是很忌諱的事。即使法律上僥倖過關,名譽上的損失往往更難挽回。比較健康的做法是:把分離出來的人聲當作學習素材或過渡工具,而不是最終產品。要發布,就自己想辦法找人錄、或用合法授權的素材庫。
另外,如果你分離的是自己的作品(例如你原本的混音檔遺失了,只剩下立體聲母帶),那當然完全沒有問題。這種「自救」用途其實是 AI 分離技術最正當、也最實用的應用場景之一。
六、結語:工具會進化,耳朵才是核心
回頭看這幾年,AI 音源分離的進步速度非常驚人。從 Spleeter 剛出來時大家驚呼「竟然可以分離」,到現在 HT Demucs、MDX 系列能做到幾乎聽不出破綻的程度,中間不過短短幾年。可以預期,未來還會有更強的模型出現,操作也會越來越簡單。
但技術再強,有兩件事不會變。第一,來源品質決定上限。爛的輸入永遠不會變成好的輸出,這一點在 AI 時代依然成立。第二,判斷好壞的耳朵才是核心。模型不會告訴你「這個版本聽起來比較自然」,只有你自己能判斷。
所以,與其追逐最新的模型,不如把時間花在兩件事上:一是累積對聲音的敏感度,多聽、多比較、多問自己「這裡聽起來對嗎」;二是把流程標準化,建立一套自己熟悉的工具組合與處理步驟。當你有了穩定的流程,工具升級時你只需要替換其中一環,而不是整個打掉重練。
最後,如果你剛開始接觸,建議從 UVR5 這類免費開源工具入手。它不算最方便,但能讓你真正理解「模型選擇」與「參數調整」的意義。等到你對流程有感覺了,再往專業軟體或自架模型發展。這條路不急,慢慢走,你會發現自己能處理的素材範圍越來越大,而那種「從一首混音完成的歌裡,親手挖出乾淨人聲」的成就感,其實滿過癮的。
希望這篇指南對你有幫助。如果你在實作過程中遇到特別難處理的素材,歡迎把狀況描述清楚(來源格式、歌曲類型、遇到的問題),社群裡總有人走過同一條路。