AI 音速與節奏校正:保有 Humanize 律動感的自動化對拍
高品質的自動化對拍流程,通常是「先速度校正、再律動對齊、最後才局部拍點校正」,而不是一開始就全軌量化。順序錯了,後面怎麼補救都有限。
二、AI 節奏偵測:從波形到「拍點地圖」
所有自動對拍的第一步都是「知道拍點在哪」。這聽起來很基本,卻是最容易出錯的環節。AI 之所以在近年大幅改善對拍體驗,主要貢獻就在這一層。
2-1 起音偵測:找出能量突然上升的位置
傳統起音偵測(onset detection)依靠頻譜通量(spectral flux)、高頻能量、複數域差異等方法,計算每一格音框的能量變化,超過門檻就標記為起音。這類方法對小鼓、拍手、木吉他刷弦等瞬態明顯的聲音很有效,但遇到低頻大鼓、圓滑的貝斯、或是混了大量殘響的鋼琴,就常常抓不到或抓過頭。
AI 版本的起音偵測改用卷積神經網路直接在頻譜圖上做分類,例如 Google Magenta 的 Onsets and Frames 就是同時輸出起音與音高的模型。它的優勢在於「看過大量音樂」之後,學到了不同樂器的起音樣態,因此在鈍音、弱音、甚至被壓縮器壓扁的訊號上,辨識率明顯提升。對實務的意義是:你不需要再手動把偵測門檻調到極限,去抓那個一直被漏掉的 ghost note。
2-2 節拍追蹤:從起音到穩定的拍
有了起音點,下一步是推論出週期性的拍。傳統做法是動態規劃(例如 Ellis 在 2007 年提出的經典方法),在起音強度曲線上找出「整體最合理」的拍點序列,同時懲罰速度的劇烈變化。
AI 做法則是用遞迴神經網路(RNN)或時序卷積網路,直接從音訊預測每一格音框「是不是拍點」的機率,再搭配後處理。知名開源工具 madmom 與 BeatNet 都屬於這一類。它們的關鍵優勢是能處理三種傳統方法容易崩潰的情境:
2-3 速度曲線與變拍處理
準確的拍點地圖之後,工具會產生一條「速度曲線」(tempo map)。這條曲線的平滑程度是可以調整的,而這個參數直接決定了人性化律動的存亡。曲線太陡,每一次微小速度變化都會被記錄下來,後續對拍等於沒有對齊;曲線太平,整首歌會被硬拉成固定 BPM,漸慢的收尾、rubato 的樂句全部消失。
Logic Pro 的 Smart Tempo、Cubase 的 Tempo Detection、Studio One 的 Tempo Track 都提供了調整彈性。實務建議是:先讓工具偵測,再手動檢查段落交界處。副歌進入前的那半拍、bridge 的加速、尾奏的漸慢,這幾個地方最容易被 AI 判斷錯誤,需要人工微調。
2-4 AI 勝過傳統演算法的地方,以及它仍然會錯的地方
總結來說,AI 在節奏偵測上的優勢是:對音色的容忍度更高、對弱起音更敏感、對無鼓音樂更有推論能力。但它仍有三個典型失誤:
這三種情況都需要人工介入。AI 給你的是一份高品質的草稿,不是保證正確的答案。
三、音速校正的演算法差異:為什麼有些拉伸聽起來像橡皮筋
節拍抓到了,下一步是改變速度。這一步的品質落差極大,而且不同素材適用的演算法完全不同。理解原理,你才有辦法在設定面板裡選對選項。
3-1 相位聲碼器(Phase Vocoder):教科書級的做法
相位聲碼器把音訊切成短音框、轉到頻域,根據時間伸縮比例推進相位,再重疊相加回時域。它的優點是能處理複音素材、頻率解析度高,人聲與鋼琴都能用。缺點是相位估計誤差會在瞬態處產生「預響」(pre-echo)與金屬味的拖尾,拉伸比例越大越明顯。
對打擊樂來說,相位聲碼器是最不理想的選擇。大鼓的敲擊點會被抹開,小鼓的脆度會變成一片糊。如果你只有相位聲碼器可用,請把拉伸比例控制在 ±10% 以內,並在拉伸後用瞬態整形工具補救。
3-2 WSOLA、SOLA、PSOLA 家族:以波形為單位的重疊
這類方法不碰相位,而是在時域裡尋找波形相似的位置進行重疊相加。WSOLA(Waveform Similarity Overlap-Add)適合單音與節奏性素材,處理鼓 loop 的品質通常優於相位聲碼器。SOLA 是它的前身,同步性略差。PSOLA(Pitch Synchronous Overlap-Add)則是針對人聲與單音樂器設計,以音高週期為單位重疊,拉伸後仍能維持自然的聲帶質感。
許多 DAW 的「複合模式」實際上會自動判斷素材類型,混用這些演算法。Ableton Live 的 Beats 模式偏向切片與瞬態保護、Tones 模式偏向相位聲碼器、Complex 與 Complex Pro 則是為完整混音設計,代價是運算量大、延遲高。Pro Tools 的 Elastic Audio 提供 Polyphonic、Rhythmic、Monophonic、Varispeed 等模式,選擇邏輯類似。
3-3 AI 生成式伸縮:用神經網路「重畫」頻譜
近幾年的新方向是生成式模型。做法有兩路:一路是神經音訊編碼(例如 Meta 的 EnCodec、Google 的 SoundStream),把音訊壓縮成離散 token 序列後,在潛空間中重新取樣時間軸;另一路是可微分數位訊號處理(DDSP)與即時音訊變分自編碼器(RAVE),直接學習音色與表現之間的映射,能做到音高、響度、甚至演奏風格的分離與重組。
這類方法的最大好處是:它不只是在既有波形上做數學搬移,而是「重新合成」聽起來合理的訊號。因此在極端拉伸(例如把 90 BPM 拉到 140 BPM)或大幅度音高調整時,品質明顯優於傳統方法。代價是可能出現「過度平滑」的結果,某些原始的音色細節會被模型「想像」掉,聽起來像換了一把樂器。
實務上的建議是:小幅度修正(±10% 內)用傳統方法最快最穩;大幅度重構(超過 ±25%)可以嘗試 AI 生成式工具,但一定要與原始素材 A/B 比較,確認音色沒有被偷走。
3-4 素材類型與演算法對應表
素材類型
建議演算法
安全拉伸範圍
注意事項
電子鼓 loop
切片 / Beats 模式 / WSOLA
±20%
切片間距需對齊格線,避免切到殘響尾巴
現場鼓組多軌
多軌同步相位聲碼器
±8%
所有軌道必須共用同一組 warp marker
人聲主唱
PSOLA / 類神經模式
±10%
子音容易受損,拉伸後檢查 ㄘ、ㄙ、ㄎ 等音
電貝斯 / 合成貝斯
WSOLA 或相位聲碼器
±15%
低頻相位容易打架,拉伸後檢查與大鼓的關係
鋼琴 / 弦樂
相位聲碼器 / Complex Pro
±12%
殘響拖尾會產生金屬味,必要時先降殘響
完整混音母帶
AI 生成式或 Varispeed
±6%
超過此範圍建議重編曲,而非硬拉
四、實戰流程:在 DAW 裡做出「有呼吸感」的自動對拍
理解了原理,接下來是流程。以下流程適用於大多數主流 DAW,差異只在選單名稱。核心精神是「分階段處理、每階段驗收」,不要一次全開。
4-1 前置作業:先清理,再偵測
AI 節奏偵測的準確度,很大程度取決於你餵給它的素材。在按下分析之前,先做三件事:
另外,如果你的素材是現場演出、沒有節拍器,建議先確認工具是否支援「可變速度」模式。強制固定 BPM 會直接毀掉整首歌的時間結構,後續再怎麼修都回不來。
4-2 只修關鍵拍點,不要全軌量化
這是保有律動感最重要的一條原則。全軌量化等於把所有拍點都當成嫌疑犯,而實際上,一首歌裡真正需要修的通常不到 10%。
具體做法是:先聽一遍,把明顯的失誤記下來(用標記或文字筆記皆可),然後只針對這些位置建立 warp marker 或 flex marker。判斷標準可以參考以下幾點:
與其他樂器產生明顯「打結」的拍點,優先處理。
單獨聽起來不順、但與其他軌一起聽沒問題的拍點,不要動。
樂句開頭與結尾的拍點可以修,中間的細微浮動盡量保留。
小鼓與大鼓的相對關係優先於個別拍點的絕對位置。
換句話說,你要修的是「整體感」,不是「數學正確」。一個常見的經驗法則是:修完之後,如果把該軌單獨播放,聽起來應該還是像原本的演奏,只是少了幾處明顯的踉蹌。
4-3 保留 Groove:偏移量、Swing 與微時序
當你必須做較大範圍的對拍時,可以用「相對偏移」的方式來保留律動。具體有三個技巧:
第一,保留 swing 比例。如果原始素材是 16 分音符 swing,比例大約落在 54:46 到 62:38 之間。對拍時不要把它拉成 50:50,而是先量測原始比例,再在量化設定裡指定相同的 swing 值。多數 DAW 的量化面板都有 swing 參數,只是預設值通常是 0。
第二,保留偏移的「方向性」。如果整軌的 hi-hat 平均比格線晚 6 毫秒,這是一種刻意的 laid-back,不應該被抹平。你可以統一保留這個偏移量,只修正偏離平均值過大的個別拍點。
第三,保留拍點間距的變異。完全量化的拍點間距是定值,真人演奏會有自然的抖動。研究上,這種抖動的標準差若落在 3 到 12 毫秒之間,聽起來最自然;低於 2 毫秒會開始有機械感,高於 25 毫秒則會被聽成不穩。
4-4 多軌之間的相對律動,比絕對位置更重要
混音裡有句話:「寧可大家一起錯,也不要各錯各的。」這句話在對拍上完全成立。當你處理多軌素材時,真正決定律動感的是軌與軌之間的相對關係,而不是每一軌對格線的絕對距離。
實務做法是:先對齊「節奏核心」——通常是大鼓與貝斯,讓這兩者的相對關係穩定。然後讓其他元素(吉他、鍵盤、打擊樂器)相對於這個核心對齊,而不是相對於格線。這樣即使整個節奏組比格線晚了 8 毫秒,聽起來仍然是統一的 laid-back,而不是散掉。
如果素材來自不同時間、不同場地,甚至不同樂手,可以先找出每一軌的「共同重拍」,以那個重拍為錨點做相對對齊,其餘拍點保留原狀。這樣能大幅降低處理量,同時保住各軌的個性。
4-5 逆向量化:用 Groove Pool 把人性加回來
如果你的素材已經被過度量化,補救方法是律動注入。Ableton Live 的 Groove Pool 可以從任何音訊或 MIDI 素材中萃取律動特徵(包含時序偏移與力度變化),再套用到其他軌。Logic Pro 的 Groove Track、Cubase 的 Groove Quantize、Studio One 的 Groove Templates 也都有類似功能。
操作要點是:
選擇律動來源時,優先選同一首歌裡演奏最自然的片段,避免用不同風格的外部素材。
套用後務必檢查小鼓與大鼓的相對位置,這是最容易聽出違和感的地方。
AI 工具近年也開始提供「智慧律動建議」,會根據曲風自動推薦 swing 比例與人性化參數。這類建議可以當作起點,但不要照單全收,因為你的編曲密度、音色選擇與空間感都會影響最終感受。
五、Humanize 的量化指標與驗收流程
「聽起來有沒有呼吸感」是主觀判斷,但我們仍然可以用一些客觀數據輔助檢查,避免耳朵疲勞時做出錯誤決定。
5-1 五個可以量測的指標
多數 DAW 不直接顯示這些數字,但你可以透過 MIDI 匯出後用試算表計算,或使用專門的節奏分析工具。重點不是追求特定數值,而是比較「處理前」與「處理後」的差異。如果處理後某項指標變動超過 50%,就值得重新檢查是否修過頭。
5-2 耳朵驗收清單
數據只能輔助,最後還是要回到耳朵。以下是一份實用的驗收清單:
單獨播放該軌,是否還能聽出原本演奏者的個性?
與節奏核心一起播放,是否有「打結」或「拖泥帶水」的感覺?
把音量降到很小聲聽,律動感是否還在?小音量最容易暴露節奏的僵硬。
用手機喇叭或筆電內建喇叭聽,這種播放環境對時序問題特別敏感。
隔一天再聽一次。耳朵疲勞時做的判斷,隔夜複查常常會翻盤。
如果你發現自己在反覆調整同一個拍點超過三十分鐘,通常代表問題不在那個拍點,而在整體速度曲線或段落結構。這時候應該退一步,重新檢視 tempo map,而不是繼續微調 marker。
六、常見錯誤與疑難排解
6-1 拉伸後出現預響或金屬聲
這是相位聲碼器的典型症狀,尤其在鼓與鋼琴上。解決順序是:先降低拉伸比例,再切換到瞬態友善的模式(Beats、Rhythmic、切片),最後才考慮用 AI 生成式工具重建。若必須保留相位聲碼器,可以在拉伸後使用瞬態整形(transient shaper)或動態 EQ 補回敲擊感。
6-2 鼓組被切碎、殘響尾巴被切斷
切片類演算法在切割點過於密集時,會讓鈸與殘響聽起來碎裂。處理方式是加大切片間距、把切割點對齊零交越點,或改用不切片的 WSOLA 模式。多軌鼓組尤其要注意:每一軌的切片位置必須完全一致,否則會產生相位問題。
6-3 人聲對拍後變得平、失去情感
人聲的律動與咬字高度相關。對拍時若把音節拉得太整齊,會產生一種「唸稿」的感覺。建議做法是:只對齊母音的起點,保留子音的自然位置;樂句的呼吸點不要動;句尾的漸慢與裝飾音保留原狀。若使用 AI 對拍工具,請選擇有「保留母音長度」或「保護共振峰」選項的模式。
6-4 對拍後整體聽起來變快或變慢
這通常不是速度設定錯誤,而是律動被改變造成的主觀感受。當拍點被往前推,聽感會變快;往後推,聽感會變慢。處理方式是檢查 swing 比例是否被改動,以及 hi-hat 與小鼓的相對位置是否被統一化。把這兩個元素放回原本的偏移關係,通常就能解決。
6-5 AI 偵測結果明顯錯誤,該全部手動嗎?
不需要。比較有效率的做法是分段處理:把音樂切成 8 到 16 小節的區塊,逐段檢查 AI 的偵測結果,只重跑有問題的區塊。多數工具的錯誤具有段落性,不會整首全錯。另外,先把明顯的段落邊界標記好,AI 在段落內的分析準確度通常會大幅提升。
七、結語:AI 是節拍器,不是品味
自動化對拍發展到今天,技術上已經相當成熟。AI 能準確找出拍點、能生成平滑的速度曲線、能在極端條件下重建音訊品質。但有一件事它仍然做不到:判斷「這裡該不該準」。
決定一個拍點該不該修,靠的是你對曲風的理解、對編曲的判斷、以及對演奏者意圖的尊重。同一個 20 毫秒的偏移,在電子舞曲裡是必須清除的錯誤,在 Neo-Soul 裡卻是整首歌的魅力所在。AI 給你的是選項,不是答案。
務實的工作方式是:讓 AI 做它最擅長的事——偵測、分析、產生草稿;把判斷權留給自己——決定修改範圍、設定保留比例、驗收最終結果。每一次對拍之後,都問自己一個問題:這段音樂現在聽起來,還像有人在演奏嗎?如果答案是肯定的,那你的自動化對拍就成功了。如果答案是否定的,那就把量化強度退一格,把 swing 加一點,把幾個被修得太整齊的拍點放回原位。人性化不是靠工具給的,是靠你在自動化的流程裡,刻意留下來的。