老舊錄音修復:利用 AI 消除黑膠雜音與磁帶嘶嘶聲

concept%20visualization%20for%20%E8%80%81%E8%88%8A...
發表時間:2026 年 09 月 20 日 | 更新日期:2026 年 09 月 20 日 | 編輯:雅寶社區編輯團隊
老舊錄音修復:利用 AI 消除黑膠雜音與磁帶嘶嘶聲 - 雅寶社區 · 頂客論壇

為什麼傳統降噪總是「連人聲一起吃掉」

傳統的降噪工具大致有三類。第一類是頻譜減法,原理是先「取樣」一段只有雜訊的段落,建立雜訊的頻譜模型,再從整段音訊裡把這個模型減掉。問題在於,真實音樂的頻譜是動態變化的,減掉一個靜態模型之後,你會聽到一種金屬感、水泡感的殘留,業界叫它「音樂雜訊(musical noise)」。第二類是雜訊閘或向下擴展器,低於門檻就壓低音量,結果是安靜段落的尾音被切得斷斷續續,出現「抽吸感」。第三類是低通或擱架式濾波,直接砍掉高頻,嘶聲沒了,但空氣感、泛音、空間殘響也全沒了。

根本原因是:傳統工具無法區分「穩定雜訊」和「穩定的音樂訊號」。一段持續的弦樂長音,在頻譜上看起來跟雜訊很像。AI 之所以能突破,正是因為它學過成千上萬個「有雜訊的音樂」與「乾淨的音樂」的配對,它知道弦樂長音該長什麼樣子、該有什麼樣的諧波結構,這不是規則可以寫出來的。

二、AI 修復的核心原理:它到底在「猜」什麼

理解原理不是為了炫技,而是為了知道「什麼時候該相信 AI、什麼時候該手動介入」。因為 AI 修復本質上是一種「有依據的猜測」,猜得對是還原,猜錯了就是造假。

三條主流技術路線

第一條是頻譜遮罩(Spectral Masking)。這是目前最主流、也最成熟的架構。做法是把音訊轉成頻譜圖(頻率 × 時間的熱圖),然後用一個類似 U-Net 的卷積網路,輸出一個「遮罩矩陣」——每個時頻格子上標示 0 到 1 之間的數值,代表「這格有多少比例是乾淨訊號」。把原頻譜乘上遮罩,再轉回時域波形,就完成了降噪。這種方法的優點是可控性高,你可以把遮罩視覺化,看清楚它到底在某些頻段做了什麼。

第二條是時域模型(Time-domain Modeling)。代表架構有 Conv-TasNet、DeepFilterNet、RNNoise 等。它不轉頻譜圖,直接吃原始波形,輸出乾淨波形。優點是延遲低、相位資訊保留得比較好,很適合即時通訊降噪。用在音樂修復上,它對瞬態的處理往往比頻譜遮罩更自然,但對寬頻嘶聲的抑制深度可能略遜一籌。

第三條是生成式模型(Generative Restoration)。這是最近成長最快的方向,包括 GAN 和擴散模型。它跟前面兩條路線的哲學完全不同:前面兩條是「減法」,盡量把雜訊拿掉;生成式是「加法」,它根據學到的音樂先驗,去重建那些被雜訊蓋掉的部分。比如一段被爆音打斷的鋼琴音,生成式模型可能會「補」出那個音的尾韻。聽起來很神奇,但風險也最高,因為它可能補出原本不存在的東西。這是目前 AI 修復最需要小心使用的一類工具。

AI 與傳統 DSP 的本質差異在哪裡

用一張表來說明會更清楚。

比較維度

傳統 DSP 降噪

AI 降噪/修復

判斷依據

固定規則、閾值、統計模型

訓練資料學到的訊號特徵

對穩態雜訊

有效,但易產生音樂雜訊

非常有效,殘留少

對非穩態雜訊

幾乎無能為力

可處理,視模型而定

瞬態保留

容易磨鈍

通常保留較好

可解釋性

高,參數意義明確

低,像黑盒子

過度處理風險

聽起來悶、抽吸

聽起來「假」、有合成感

運算需求

低,可即時

高,通常需要 GPU 或較長時間

這裡有一個關鍵觀念:AI 不是萬能,它是「另一種取捨方式」。傳統工具的問題是取捨太粗糙,AI 的問題是它的取捨你無法完全控制。所以最高品質的修復流程,永遠是「AI 做粗活、人耳做判斷、傳統工具做收尾」。把手動的頻譜編輯留給最頑固的那幾顆爆音,把 AI 留給大面積的底噪,這樣的組合效果最好。

三、完整工作流:從擷取到輸出的八個步驟

下面這套流程是實務上最穩定的做法。請注意,順序很重要——先處理低頻的穩態問題,再處理高頻,最後處理瞬態。反過來做會讓你反覆重工。

步驟 1 到 4:硬體準備、清潔、擷取與前處理

步驟一:硬體與訊號鏈。確保你的播放端本身不製造額外雜訊。唱盤的接地要接好,唱臂與唱頭的針壓、抗滑要按原廠建議設定。唱放(phono preamp)的品質直接決定底噪水平,如果你用的是內建唱放的入門唱盤,建議外接一台獨立的唱放。擷取端建議至少 24 bit / 96 kHz。很多人會問「黑膠的頻寬不是只到 20 kHz 嗎,為什麼要 96 kHz?」原因是取樣率越高,爆音這種極短瞬態的形狀保留得越完整,後續去爆音工具判斷起來就越準。24 bit 則是為了保留動態餘裕。

步驟二:清潔唱片與磁帶。黑膠的清洗效果遠比任何軟體修復都重要。用碳纖維刷乾刷只能去除表面浮塵,真正有效的是濕式清洗——無論是洗碟機、超音波清洗,或最克難的蒸餾水加軟毛刷。磁帶的部分,清潔磁頭、導帶輪、壓帶輪是基本功,但要注意老磁帶可能有「黏帶症候群」,播放前最好先低溫乾燥處理,否則會把磁帶扯壞。如果磁帶已經發霉,那要先處理霉斑再播放。

步驟三:擷取設定。原則只有一句話:擷取階段不要做任何處理。不要開任何等化、不要開任何降噪、不要用「黑膠模式」之類的預設濾波。你只需要設定好適當的錄音增益,讓峰值落在 -6 dB 到 -12 dB 之間,保留足夠餘裕。擷取完立刻備份一份原始檔到另一個硬碟或雲端,這是你唯一的「底稿」。

步驟四:前處理。檢查是否有直流偏移(DC offset),有的話先移除。檢查左右聲道的相位與平衡。檢查是否有過大的低頻能量(唱盤隆隆聲),如果有的話可以用很平緩的高通濾波器,例如在 20 到 30 赫茲處做 12 dB/oct 的衰減。這一步的目的不是美化,而是讓後面的 AI 工具不要浪費算力在不重要的問題上。

步驟 5 到 8:AI 除噪、去爆音、動態調整與輸出

步驟五:AI 去噪,分層處理。這是整篇最重要的觀念:不要想用一次處理解決所有問題。建議的順序是:先處理哼聲(50/60 Hz 及其諧波),再處理低頻隆隆聲,然後才進入寬頻降噪。寬頻降噪本身也建議分兩到三次做,每次的衰減量控制在 3 到 6 dB,而不是一次拉滿到 20 dB。為什麼?因為每一次處理都會留下微小的偽影,少量多次可以讓偽影分散、聽起來更自然;一次拉滿則會讓偽影集中在某個頻段,聽起來就很「數位」。

每次處理完,都要用 A/B 比對。具體做法是:把處理後與處理前的軌道並排,在同樣的播放位置反覆切換。特別注意兩件事——音樂的「起音」有沒有被磨圓?安靜段落的背景是不是變得「不自然的死寂」?如果後者成立,那你可能處理過頭了,因為真實錄音室裡也不存在絕對的數位靜音。

步驟六:去爆音與修補。去爆音工具通常有兩個參數最重要:偵測閾值(Threshold)與修補方式。閾值設太低,會把正常的打擊樂器也當成爆音處理;設太高,很多爆音會漏掉。建議先用自動偵測跑一遍,然後用「只顯示偵測到的位置」功能,人工巡一遍,把誤判的標記刪掉。修補方式通常有「插值」、「頻譜替換」等選項,對於單一爆音,插值是夠的;對於連續一大段的損壞(例如刮痕),就要用頻譜編輯手動處理。

步驟七:等化與動態微調。到這裡雜訊應該已經乾淨了,但聲音可能變得比較「薄」或「平」。這時候可以做一些溫和的調整:用寬頻的擱架式等化補回一點高頻的空氣感(但要小心不要把殘餘嘶聲一起放大),用輕微的壓縮讓整體動態更穩定。這一步的原則是「寧少勿多」,因為你面對的是歷史錄音,我們要的是還原,不是重新混音。

步驟八:輸出與備份。建議輸出三種版本:處理後的 24 bit / 96 kHz WAV 作為母帶保存;16 bit / 44.1 kHz 的版本用於 CD 或一般分享;以及一個壓縮過的格式(例如 FLAC 或高品質 AAC)用於串流或隨身播放。絕對不要在中間過程反覆轉檔,每一次有損轉檔都會累積劣化。另外,把所有的工作檔(含未處理的原檔)一起歸檔,因為五年後可能會有更好的 AI 工具,你隨時可以從原檔重來一次。

四、工具地圖:免費、開源與專業付費方案

工具選擇沒有絕對的好壞,只有「你的需求 × 你的預算 × 你的技術門檻」的組合。以下按類型介紹。

免費與開源選項

Audacity(搭配 OpenVINO AI 外掛)是目前最容易入門的組合。Audacity 本身就是免費的,加上 Intel 的 OpenVINO AI 外掛後,就有了 AI 音樂分離與 AI 降噪功能,在一般筆電上就能跑。它的降噪效果當然比不上專業付費工具,但對於「把家族老錄音修到可以聽」這個層級的需求,已經非常夠用。

DeepFilterNet 是開源的時域降噪工具,有命令列介面。它的強項是語音,對人聲錄音的嘶聲抑制效果相當好,而且延遲低。用它來處理訪談、口述歷史這類以人聲為主的錄音,是 CP 值很高的選擇。缺點是它不是為音樂設計的,處理純音樂素材時要小心。

noisereduce 是一個 Python 套件,實作了多種降噪演算法,包含基於深度學習的版本。如果你會寫一點 Python,它的彈性非常大,可以自己控制時間常數、頻率平滑等參數,很適合做批次處理。

Demucs 是 Meta 開源的音源分離模型,可以把音樂拆成人聲、鼓、貝斯、其他四個軌道。這跟降噪有什麼關係?關係很大——你可以先把音樂拆成 stems,然後對不同 stem 用不同的降噪策略。人聲軌用語音降噪模型,鼓軌專門處理爆音,吉他與鍵盤軌用頻譜遮罩。這種「先分離再處理」的策略,往往能得到比直接降噪更好的結果。

FFmpeg 的 arnndn 濾鏡內建了 RNNoise 的模型,適合做自動化的批次降噪。如果你有一大批檔案要處理,寫個 shell script 會省下大量時間。

另外像是 Ultimate Vocal Remover(UVR) 這類整合型工具,雖然主打人聲分離,但它內含的多種模型其實也可以拿來當降噪器使用,社群裡有不少人這樣玩。它的優點是圖形介面友善、支援批次,缺點是設定選項較多,需要花點時間摸索。

付費與專業方案

如果要認真做,iZotope RX 幾乎是業界標準。它的光譜降噪(Spectral De-noise)可以讓你手動「教」它辨識雜訊輪廓,去爆音(De-click)、去炒豆聲(De-crackle)、去哼聲(De-hum)都是獨立模組,可以精細控制。它的對話隔離(Dialogue Isolate)與音樂再平衡(Music Rebalance)也整合了 AI 模型。價格不便宜,但它能處理的問題範圍最廣,對於有大量老錄音要整理的專案,投資回報率很高。

Steinberg SpectraLayers 的強項是視覺化頻譜編輯。它把音訊畫成一張可以「用畫筆塗抹」的圖,你可以直接用選取工具圈出某個爆音、某段嘶聲,然後刪除或替換。它近年也加入了多個 AI 模型,可以做自動分離與修復。對於那些 AI 自動處理不掉的頑固雜訊,SpectraLayers 的手動編輯能力非常關鍵。

Acon Digital Restoration Suite 是相對親民的專業選擇,它的模組化設計讓你可以只買需要的部分。它的 DeNoise 與 DeClick 在音樂修復上的表現相當自然,是不少母帶工程師的日常工具。

Waves Clarity Vx 系列則偏向人聲與對白處理,如果你的老錄音主要是口述、訪談、廣播側錄,它的效果非常好,而且操作相對簡單。

線上服務與批次處理的取捨

現在也有很多「上傳檔案、雲端處理、下載結果」的線上服務,例如各種 AI 降噪網站。它們的優點是不用安裝、不用算力,缺點是隱私與版權風險。如果你處理的是家族錄音或自己的創作,上傳通常沒問題;但如果是受版權保護的商業錄音,或者涉及個人隱私的內容,就要非常謹慎。另外,線上服務通常不讓你看見處理過程,你無法判斷它到底做了什麼,這在需要精細控制的專案裡是很大的限制。

五、實戰細節:參數怎麼調、雜訊怎麼分層

工具知道了,接下來是真正決定成品品質的部分。

分層處理的順序與邏輯

前面提過順序很重要,這裡給一個更具體的清單:

  • 去哼聲(De-hum):處理 50 或 60 Hz 及其諧波。這是最穩態、最好處理的,先解決它。
  • 高通濾波:在 25 到 40 Hz 之間做緩降,去除隆隆聲與直流偏移。這一步會讓後面的降噪更有效率。
  • 去爆音(De-click):處理離散的瞬態脈衝。這一步建議在寬頻降噪之前做,因為爆音的寬頻能量會干擾降噪模型對雜訊的判斷。
  • 去炒豆聲(De-crackle):處理密集的小脈衝群。有些工具會把它跟去爆音整合在一起。
  • 寬頻降噪(De-noise):處理表面噪音與嘶嘶聲。這是衰減量最大、也最容易出錯的一步。
  • 手動修補:針對剩下的頑固問題,用頻譜編輯處理。

    每一步都要遵守「A/B 比對」與「少量多次」兩個原則。具體來說,寬頻降噪那個步驟,如果工具允許,我會建議第一次做 4 dB,聽一遍;第二次再做 3 dB,再聽一遍。兩次加起來 7 dB 的效果,通常比一次做 7 dB 自然得多。

    關鍵參數與判斷標準

    降噪強度(Reduction Amount)。這是最直觀的參數,但也是最容易濫用的。記住一個經驗值:對於底噪本來就不嚴重的錄音,3 到 6 dB 就夠了;對於狀況很差的老磁帶,可能需要 10 到 15 dB,但這種情況下你幾乎一定會聽到副作用。超過 15 dB 的降噪,除非使用生成式模型,否則很難不傷到音樂。

    頻譜平滑度(Spectral Smoothing)。這個參數控制降噪曲線在頻率軸上的平滑程度。設太低,會出現窄頻的凹陷,聽起來像某些頻段被挖掉了;設太高,降噪效果會變弱,殘留較多。建議從中等值開始試,然後根據聽感微調。

    時間平滑度(Temporal Smoothing / Attack & Release)。這個參數控制降噪量隨時間變化的快慢。太快會產生「抽吸感」,也就是背景音在音樂出現與消失之間明顯起伏;太慢則會讓短暫的雜訊(例如突然的一聲咳嗽)來不及被抑制。

    判斷處理是否過頭,我建議用三個檢查點:

  • 用耳機聽,也用喇叭聽。耳機會放大細節,讓你聽到偽影;喇叭則反映整體的聽感平衡。兩者都要過關。
  • 用很小的音量聽。在小音量下,過度處理的痕跡會特別明顯,因為人耳在小音量時對高頻的敏感度不同。
  • 切換到單聲道聽。很多立體聲下不明顯的偽影,在單聲道下會因為左右聲道相關性變化而浮現。
  • 至於「過度處理」的三個典型徵兆,請務必記住:一是尾音被切斷或聽起來像被吸走;二是背景出現不自然的「數位死寂」,與音樂段落形成突兀對比;三是高頻樂器(鈸、弦樂泛音、人聲齒音)失去光澤,聽起來像蒙了一層布。

    六、常見錯誤與進階技巧

    新手最常踩的六個坑

    第一,在擷取階段就開降噪。這是最致命的錯誤,因為你再也拿不回原始訊號了。務必保留未處理的原檔。

    第二,一次把降噪拉到最大。前面已經說過很多次,但還是要再強調一次,因為這是絕大多數失敗案例的成因。

    第三,只用單一工具處理全程。沒有一個工具能在所有雜訊類型上都最強。去哼聲、去爆音、去嘶聲,往往需要不同工具組合。

    第四,忽略相位與立體聲問題。有些降噪工具會獨立處理左右聲道,導致立體聲像崩塌或相位偏移。處理後一定要檢查單聲道相容性。

    第五,輸出時重複轉檔。WAV 轉 MP3 再轉回 WAV,每一次都會劣化。工作過程一律用無損格式。

    第六,沒有保留原始檔與中間檔。修復是迭代的,你可能會想回到某一步重來。沒有備份就等於沒有退路。

    讓成品更自然的進階策略

    策略一:並行處理(Parallel Processing)。把原始訊號分成兩路,一路做較強的降噪,一路不處理,然後按比例混合。這樣可以保留一部分自然的底噪質感,聽起來不會那麼「真空」。很多專業修復師都會用這招,比例通常是七比三或八比二。

    策略二:只在特定頻段處理。不要對全頻段做同樣的降噪。嘶聲集中在中高頻,你只需要在那個區間加強處理;低頻的隆隆聲用高通解決就好。有些工具支援「頻譜傾斜」或「頻段焦點」,善用它們。

    策略三:先分離再處理。用 Demucs 之類的工具把音樂拆成 stems,人聲軌用語音降噪模型,樂器軌用音樂降噪模型,鼓軌專注在瞬態修復。這種做法的工作量較大,但品質提升明顯,特別適合要發行的專案。

    策略四:高解析度處理再降頻。在 96 kHz 下進行 AI 降噪,然後降到 44.1 kHz 輸出。這樣做的好處是降噪模型有更多資訊可以判斷,偽影也更容易在降頻過程中被平滑掉。

    策略五:用參考錄音做 A/B。找一張同時期、同樣媒介、但狀況良好的錄音當作參考,反覆比對你的成品與它的差異。這比憑空想像「應該聽起來怎樣」可靠得多。

    策略六:刻意保留一點底噪。這聽起來很反直覺,但人類的聽覺對「絕對寂靜」其實是敏感的。在音樂段落之間保留極微量的底噪,反而會讓整體聽感更自然、更有空間感。當然,前提是這個底噪不能是突兀的爆音或明顯的哼聲。

    七、結語:讓時間的痕跡留下,讓雜訊離開

    老舊錄音修復的本質,是一場與時間的談判。我們不可能把三十年前的卡帶還原成今天的錄音室品質,也不應該那樣做——那些底噪、那些輕微的速度變化,本身就是這段錄音歷史的一部分。真正好的修復,是讓音樂重新可以被聽見、被享受,而不是把它變成一張沒有指紋的塑膠膜。

    AI 在這件事情上的價值,是它讓我們有機會用更細緻的方式做取捨。過去我們只有「濾掉」和「不濾」兩個選項,現在我們可以分辨「這一顆爆音該拿掉、那一個鋼琴起音該留下」。這是很大的進步。但工具再強,最後的判斷還是要靠耳朵。所以請記得:每一次處理之後,用你熟悉的音樂、用你信任的監聽環境,誠實地聽一遍。如果它聽起來像音樂,那就是對的;如果它聽起來像被處理過的音樂,那就再調一次。

    從今天開始,把你抽屜裡那幾卷磁帶、那幾張黑膠翻出來吧。它們已經等了很久,而現在,你終於有工具可以好好對待它們了。如果你在修復過程中遇到什麼有趣的狀況,或是有自己的獨門流程,也歡迎在「雅寶社區 · 頂客論壇」的影音創作版分享,讓更多人一起把這些老聲音救回來。

    ```

    🏠 返回首頁