高品質人聲抽取:AI Vocal Remover 提取純淨 Acapella

concept%20visualization%20for%20%E9%AB%98%E5%93%81...
發表時間:2026 年 09 月 20 日 | 更新日期:2026 年 09 月 20 日 | 編輯:雅寶社區編輯團隊
高品質人聲抽取:AI Vocal Remover 提取純淨 Acapella - 雅寶社區 · 頂客論壇

  • 頻譜遮罩派(Spectrogram Masking):先把音訊轉成頻譜圖,讓模型判斷每一個時頻格子「有多少比例屬於人聲」,再重建波形。這類模型的代表是 Spleeter、早期的 MDX 系列。運算相對快,但容易產生金屬感或水下感,因為相位資訊是間接還原的。
  • 波形域派(Waveform / Hybrid Domain):直接在波形上做卷積與注意力運算,或採用混合架構(如 Demucs 系列、HT Demucs)。這類模型對相位處理更精細,人聲聽起來更自然,但對硬體要求較高,跑一首歌可能需要數十秒到數分鐘。
  • 另外還有一個關鍵概念叫殘響(Reverb)與混響分離。真實錄音中,人聲不會是乾淨的乾聲,它一定帶著空間感。有些模型會嘗試把人聲的「乾聲」與「空間殘響」一起抽出來,有些則只抽乾聲,導致人聲聽起來很扁。這也是為什麼同一組模型,搭配不同設定,成果可能天差地遠。

    二、主流 AI Vocal Remover 工具實測與評比

    市面上的工具大致可以分成三類:線上服務、桌面軟體/DAW 插件、開源模型。這三類沒有絕對優劣,關鍵是你的使用情境。

    線上免費工具:快速、免安裝,但要注意格式與隱私

    線上工具的最大優勢是「零門檻」。打開瀏覽器、拖進檔案、等幾十秒、下載成品,整個流程不需要安裝任何東西。對於偶爾需要一段 acapella 的人來說,這是最省事的選擇。

    常見的線上服務包括 Vocalremover.org、Moises 的網頁版、LALAL.AI 的試用版、以及各種打著「AI 人聲分離」名號的免費網站。它們多半使用開源模型(後面會談)包裝而成,差別主要在介面、輸出格式、以及是否限制檔案長度與取樣率。

    使用線上工具時,有幾件事一定要留意:

  • 取樣率與位元率:很多免費服務會把上傳檔案壓成 128kbps MP3 再處理,這會嚴重破壞高頻細節,人聲的唇齒音與空氣感直接消失。如果它沒有標示「保留原始品質」,就要有心理準備。
  • 檔案長度限制:免費版通常限制 5 到 10 分鐘,或限制每月處理次數。對於完整專輯級的處理需求,很快就不夠用。
  • 隱私與版權:把未發表的 demo 上傳到第三方伺服器,等於把檔案交到別人手上。服務條款怎麼寫、檔案會不會被保留、會不會被拿去訓練模型,都值得花五分鐘讀一下。
  • 無法微調:線上工具通常只有「人聲」與「伴奏」兩軌輸出,沒辦法調整分離強度、沒辦法指定頻段、也沒辦法做二次淨化。
  • 結論:線上工具適合「臨時應急」與「非商業用途」。如果你只是想做一支社群短片,它完全夠用;但如果你要拿去混音、發行、或做正式的二創作品,它通常不是終點。

    桌面軟體與專業 DAW 插件:品質與可控性的天花板

    當你開始在意品質,就會往桌面端走。這條路線的選項包括:

  • Ultimate Vocal Remover(UVR5):開源、免費、Windows/macOS 都有,內建大量模型可切換,是社群裡最常被推薦的選擇。它支援 GPU 加速(NVIDIA CUDA、Apple Silicon 的 MPS),處理速度與品質都相當優秀。
  • iZotope RX 系列:專業音訊修復軟體,它的 Music Rebalance 模組可以調整人聲、貝斯、打擊、其他的比例。品質高、可控性強,但價格不便宜,且比較偏向「修復」而非「純分離」。
  • Steinberg SpectraLayers:以頻譜編輯聞名,適合需要對分離結果做細部修補的人。
  • 各種 DAW 內建或第三方插件:例如 Logic Pro 的 Stem Splitter、Ableton 的相關工具,或是像 Gaudio Studio 這類獨立軟體。優點是能直接整合進工作流程,缺點是模型選擇通常較少。
  • 桌面端最重要的價值不是「分得更乾淨」,而是可控性。你可以選擇不同模型、調整重疊區間、決定要不要保留殘響、甚至把分離出來的人聲再丟進第二次分離做淨化。這些彈性,是線上工具完全給不了的。

    開源模型:Demucs、MDX-Net、UVR5 的差異

    如果你想要的是「理解本質」而不只是「按按鈕」,那一定要認識這幾個名字。

    Spleeter 是 Deezer 在 2019 年釋出的開源模型,可以說是把「AI 音源分離」帶進大眾視野的功臣。它提供 2 stems(人聲/伴奏)與 5 stems(人聲/鼓/貝斯/鋼琴/其他)兩種模式。優點是輕量、速度快,缺點是品質以現在標準來看已經明顯落後,高頻容易破損、人聲帶有明顯的數位感。

    Demucs 由 Meta(原 Facebook)的研究團隊開發,目前已演進到 HT Demucs(Hybrid Transformer Demucs)系列。它在多個公開評測(如 MUSDB18)上長期名列前茅,特點是波形域處理、對相位還原良好,人聲自然度高。代價是運算量較大,沒有 GPU 的話跑一首歌可能要等上好幾分鐘。

    MDX-Net 系列則是社群(特別是 UVR5 生態系)中大量使用的模型架構,衍生出非常多變體,例如針對人聲優化的 MDX23C、Kim Vocal 系列等等。這類模型的優點是「專精」——有些專門處理人聲,有些專門處理鼓,有些專門對付殘響。實務上,最好的做法往往不是只用一個模型,而是針對不同素材挑選不同模型,甚至多個模型疊加

    這裡要提醒一個觀念:沒有「最強模型」,只有「最適合這首歌的模型」。一首 1970 年代的類比錄音、一首 2020 年代的電子舞曲、一首純鋼琴伴奏的抒情歌,最佳模型可能完全不同。這也是為什麼專業玩家會同時裝好幾個模型,逐一切換試聽。

    三、實戰流程:從原始音檔到乾淨 Acapella 的六個步驟

    接下來進入實作。以下流程適用於 UVR5 或任何具備多模型切換能力的桌面工具,線上工具只能做到其中一部分,但觀念是共通的。

    步驟一:素材盤點與前置處理

    很多人忽略了這一步,但它對成果的影響可能超過模型選擇。

    首先,來源品質決定上限。如果你手上的檔案是 YouTube 轉出來的 128kbps MP3,那高頻已經被砍掉了,再強的模型也救不回來。盡量取得無損(FLAC、WAV)或至少 320kbps 的來源。如果只能從串流平台取得,記得確認下載格式。

    其次,確認檔案的聲道與取樣率。立體聲檔案通常分離效果更好,因為模型可以利用左右聲道的差異來判斷音源位置。如果來源是單聲道,先轉成立體聲(雖然不會無中生有,但能避免某些工具報錯)。

    第三,修掉明顯的異常。如果檔案開頭有爆音、有 DJ 旁白、有淡入淡出,建議先在音訊編輯軟體裡裁掉。這些異常會干擾模型判斷,特別是突然的巨大音量變化,常常會讓分離結果出現一段「破音」。此外,如果歌曲有明顯的剪接點或變速,也建議先處理成連續版本。

    最後,如果要處理整張專輯,建議先做一次「試跑」:挑一首最具代表性的歌,跑完之後仔細聽,確認模型與參數設定可行,再批次處理。這樣可以省下大量重工時間。

    步驟二:模型選擇與參數設定

    進入工具之後,第一個要面對的就是模型清單。以下提供一個實用的判斷邏輯:

  • 乾淨的現代流行歌(人聲居中、伴奏立體、混音乾淨):優先選 HT Demucs 系列或針對人聲優化的 MDX 模型,通常一次就能得到不錯的結果。
  • 吵雜的搖滾或電子樂(失真吉他、大量合成器):需要更「激進」的模型,或是分段處理。這類素材常出現人聲與吉他頻段重疊,導致分離後人聲帶有糊感。
  • 老錄音或現場版本(類比底噪、觀眾聲、殘響重):建議選擇對殘響處理較好的模型,並預留後續修補的空間。
  • 純人聲+單一樂器(吉他伴唱、鋼琴伴奏):這類素材其實最簡單,多數模型都能處理得不錯,甚至不需要太講究。
  • 參數方面,最常調整的包括:

  • Segment(片段長度):決定模型一次處理多長的音訊。數值越大越能掌握整體結構,但記憶體需求越高。一般建議先用預設值,遇到爆音或接縫感明顯時再調整。
  • Overlap(重疊率):片段之間的重疊比例。提高重疊率可以減少接縫處的斷裂感,但處理時間會變長。
  • Aggression(激進度):部分模型提供此參數,數值越高越積極地移除伴奏成分,但人聲也更容易受損。建議從中間值開始嘗試。
  • 輸出格式:一律選 WAV,不要選 MP3。分離是一個破壞性過程,不要在中間環節再壓縮一次。
  • 步驟三:多模型堆疊與二次淨化

    這是「高品質」與「堪用」之間的分水嶺。單一模型跑出來的人聲,通常會殘留兩類東西:伴奏殘影(例如鼓的殘響、貝斯的低頻嗡鳴)與人聲瑕疵(例如水下感、金屬感、唇齒音被磨掉)。

    進階做法是「堆疊」:

    第一輪:主模型分離。用你最信任的模型跑出人聲軌。

  • 第二輪:把人聲軌再丟進另一個模型。有些模型專門處理「已經大致乾淨、但仍有殘留」的音訊。這一輪的目標是清掉殘影。
  • 反向驗證:把第一輪的伴奏軌與第二輪的人聲軌加回去,聽聽看是否接近原曲。如果加回去之後少了東西,代表你的處理把某些成分吃掉了。
  • 頻譜修補:如果分離後人聲的某個頻段明顯凹陷(常見是 4kHz 到 8kHz 的空氣感),可以用 EQ 輕微補償。但要注意,補償不等於還原,過度處理會讓人聲變得刺耳。
  • 另外一個實用技巧是「保留兩版」:一版是較為保守、人聲自然但可能殘留一點伴奏的結果;另一版是較為激進、人聲乾淨但聽起來略薄。在混音階段,你可以根據上下文選用,甚至把兩版用不同比例混合。

    步驟四:修補殘響、唇齒音與爆音

    分離出來的人聲,通常會有三個典型問題。

    第一,殘響不自然。 因為原曲的人聲殘響與伴奏殘響在頻譜上是重疊的,模型往往只能抓一部分。結果就是人聲聽起來「乾中帶濕」,空間感斷斷續續。處理方式是:要嘛把殘響壓得更乾(用 gate 或 de-reverb 工具),要嘛乾脆加一層新的殘響蓋上去,讓它聽起來一致。

    第二,唇齒音受損。 齒音(s、sh、t 音)能量集中在 5kHz 到 10kHz,而這個頻段正是分離模型最容易誤判的地方。常見的補救是用 de-esser 控制過度刺耳的齒音,同時用輕微的高頻激勵(exciter)補回一點空氣感。但切記:補不回來的東西不要硬補,過度激勵會讓人聲變得「沙沙的」。

    第三,爆音與接縫。 如果處理過程中出現「喀」的一聲,通常來自片段接縫或音量突變。可以在音訊編輯軟體中手動修掉,或調整 overlap 參數重跑。

    如果你使用的是 iZotope RX 這類工具,Spectrogram Repair、De-reverb、De-click 這些模組會非常有幫助。它們不能無中生有,但可以把已經分離出來的人聲修得更「像樣」。

    步驟五:動態處理與音量標準化

    分離出來的人聲,動態範圍往往比原始混音大得多。這是因為模型把伴奏移除之後,原本被人聲「壓住」的細節全部跑出來了,導致安靜的地方變得太安靜、大聲的地方又太突兀。

    處理順序建議如下:

  • 輕度壓縮:用 2:1 到 4:1 的比例、慢 attack、中速 release,把人聲的動態稍微收緊。目標是讓它聽起來一致,而不是壓扁。
  • EQ 修飾:先用高通濾波(high-pass)切掉 80Hz 以下的低頻垃圾,這通常是分離殘留的貝斯或鼓聲。再針對 200Hz 到 400Hz 的渾濁感做小幅衰減。
  • 音量標準化:把峰值標準化到 -1dB 到 -3dB 之間,或使用 LUFS 標準(例如 -14 LUFS 適合串流平台)。如果你是要拿去混音,建議保持在 -6dB 左右的峰值,留給後續處理空間。
  • 這一步的關鍵心態是:你是在修復,不是在重製。分離出來的人聲永遠不可能等同於原始錄音的乾聲,所以目標應該是「聽起來自然、可用」,而不是「聽起來像錄音室母帶」。

    步驟六:匯出與存檔規範

    最後是存檔。這一步看起來很無聊,但養成好習慣會省下未來無數麻煩。

  • 格式:WAV、24-bit、與原始檔案相同的取樣率(通常是 44.1kHz 或 48kHz)。
  • 命名:建議採用「歌曲名_人聲_模型名_版本.wav」這樣的格式,例如「SongTitle_Vocal_HTDemucs_v2.wav」。不要用「final_final_真的最終版.wav」。
  • 保留中間檔:至少保留原始檔、第一輪人聲、第一輪伴奏。未來如果要重做,這些都是素材。
  • 備份:音訊檔很大,但硬碟很便宜。專案資料夾建議同步到雲端或外接硬碟。
  • 四、常見問題與疑難排解

    以下整理幾個實務上最常被問到的問題,以及對應的處理思路。

    分離出來的人聲為什麼聽起來「水下感」很重?

    所謂「水下感」,通常來自三個原因:相位還原不良、高頻缺失、以及頻譜遮罩過度。

    相位問題最常見於頻譜遮罩派的模型。當模型判斷某個時頻格子屬於人聲時,它還原波形的方式如果太粗糙,就會產生那種「悶悶的、像隔著牆」的感覺。解法是改用波形域模型(如 Demucs 系列),或提高 overlap 讓相位估算更連續。

    高頻缺失則是因為模型在訓練時,高頻資料相對稀少,加上壓縮格式本身已經砍掉高頻,導致分離後 10kHz 以上幾乎空白。解法是從來源著手(用無損檔),並在後期用輕微的高頻補償。

    頻譜遮罩過度則是參數設太激進。如果你把 aggression 調到最高,模型會傾向「寧可錯殺」,結果人聲也被削掉一大塊。建議把參數調回中間值,用「多跑幾輪、每輪溫和」的方式取代「一輪激進」。

    為什麼有些歌怎麼分都分不乾淨?

    這是必然的,不是你的錯。以下幾種情況天生就難分:

  • 人聲與樂器頻段高度重疊:例如人聲與失真吉他同時落在 1kHz 到 3kHz,模型很難判斷誰是誰。
  • 大量和聲與疊唱:多層人聲堆疊時,模型可能只抓到主唱,把和聲當成伴奏移除。
  • 重殘響的錄音:殘響會把聲音「塗抹」開來,模型難以定位。

    低品質來源:前面提過,128kbps 的檔案本來就沒有足夠資訊。

    現場版本:觀眾聲、PA 回授、樂器串音,都會讓分離變得極端困難。

    遇到這類素材,實務上的建議是「降低期待」。與其追求完美分離,不如把目標設定為「做出一段可用的樣本」,然後用其他方式補強——例如自己重唱、用合成器補伴奏、或用效果器掩蓋瑕疵。

    伴奏殘留人聲怎麼辦?

    如果你要的是 instrumental 而不是 acapella,那問題反過來:伴奏裡還聽得到人聲的影子。這通常是因為模型在判斷時,把一部分人聲成分歸類到伴奏軌。

    解法有幾個:一是換模型重跑,不同模型對「人聲邊界」的判斷不同;二是把伴奏軌再丟進一次分離(有些工具支援「只取伴奏」模式);三是用 EQ 或動態處理,針對人聲主要頻段(約 300Hz 到 3kHz)做輕微的動態衰減,但這會連帶影響樂器,要小心使用。

    另外一個常被忽略的技巧是用不同模型跑兩次,然後取交集或差集。聽起來很土,但實務上有效。

    五、法律與倫理:二創之前你該知道的事

    這一節不是要嚇你,而是希望你在享受技術便利的同時,不要踩到不該踩的線。

    首先要釐清一個常見誤解:「AI 分離」不等於「取得授權」。你從一首歌裡抽出人聲,並不會因此取得該錄音的任何權利。人聲本身涉及兩個層面的權利:一個是錄音著作權(由唱片公司或製作方擁有),一個是詞曲著作權(由創作者或版權方擁有)。分離動作只是技術操作,不改變權利歸屬。

    那麼,什麼情況下可以用?大致可以分成幾種:

  • 個人練習與學習:純粹自己聽、自己練習唱歌或混音,不對外發布,通常屬於合理使用(fair use)範圍較無爭議的地帶。
  • 非商業二創:例如做一支 Cover 影片上傳到社群平台。這種情況在各平台(YouTube、Instagram)通常會透過 Content ID 系統處理,權利方可能選擇分享收益或直接下架。風險由平台機制吸收,但你仍可能收到警告。
  • 商業使用:任何涉及營利的使用,例如放進廣告、販售的 beat、付費課程,都必須取得授權。這没有任何模糊空間。
  • 拿去訓練模型:這是目前爭議最大的地帶。用受版權保護的音樂訓練 AI 模型,在多數司法管轄區仍屬未定之天,建議避免。
  • 除了法律,也談一下社群倫理。在音樂製作圈裡,直接拿別人的 acapella 當自己的作品發布,是很忌諱的事。即使法律上僥倖過關,名譽上的損失往往更難挽回。比較健康的做法是:把分離出來的人聲當作學習素材或過渡工具,而不是最終產品。要發布,就自己想辦法找人錄、或用合法授權的素材庫。

    另外,如果你分離的是自己的作品(例如你原本的混音檔遺失了,只剩下立體聲母帶),那當然完全沒有問題。這種「自救」用途其實是 AI 分離技術最正當、也最實用的應用場景之一。

    六、結語:工具會進化,耳朵才是核心

    回頭看這幾年,AI 音源分離的進步速度非常驚人。從 Spleeter 剛出來時大家驚呼「竟然可以分離」,到現在 HT Demucs、MDX 系列能做到幾乎聽不出破綻的程度,中間不過短短幾年。可以預期,未來還會有更強的模型出現,操作也會越來越簡單。

    但技術再強,有兩件事不會變。第一,來源品質決定上限。爛的輸入永遠不會變成好的輸出,這一點在 AI 時代依然成立。第二,判斷好壞的耳朵才是核心。模型不會告訴你「這個版本聽起來比較自然」,只有你自己能判斷。

    所以,與其追逐最新的模型,不如把時間花在兩件事上:一是累積對聲音的敏感度,多聽、多比較、多問自己「這裡聽起來對嗎」;二是把流程標準化,建立一套自己熟悉的工具組合與處理步驟。當你有了穩定的流程,工具升級時你只需要替換其中一環,而不是整個打掉重練。

    最後,如果你剛開始接觸,建議從 UVR5 這類免費開源工具入手。它不算最方便,但能讓你真正理解「模型選擇」與「參數調整」的意義。等到你對流程有感覺了,再往專業軟體或自架模型發展。這條路不急,慢慢走,你會發現自己能處理的素材範圍越來越大,而那種「從一首混音完成的歌裡,親手挖出乾淨人聲」的成就感,其實滿過癮的。

    希望這篇指南對你有幫助。如果你在實作過程中遇到特別難處理的素材,歡迎把狀況描述清楚(來源格式、歌曲類型、遇到的問題),社群裡總有人走過同一條路。

    🏠 返回首頁