2026 年 AI 音軌拆解:MIDI 轉換與 stem 音軌提取實戰
你會發現,這些情境對「品質」的要求其實落差很大。練團用的伴奏軌就算有一點殘留也沒關係,但如果你要把人聲放進自己的正式作品裡,那個標準就會瞬間拉高到「不能有任何原本伴奏的痕跡」。這也是為什麼後面的實戰章節會一直強調「先想清楚用途,再決定要花多少力氣」。同樣的工具,設定不一樣,成果可以差到十萬八千里。
二、先搞懂名詞:Stem、MIDI 與 Transcription 的分工
在進入操作之前,有幾個名詞一定要先分清楚,因為論壇上很多問題其實是出在「把不同階段的產物搞混了」。
2-1 Stem 音軌是什麼
Stem 這個詞指的是「把一首混音完成的歌曲,拆解成幾個主要的聲音群組」。傳統上標準是四軌:Vocals(人聲)、Drums(鼓組)、Bass(貝斯)、Other(其他,包含吉他、鋼琴、合成器、弦樂等)。但 2026 年的工具已經可以做到更細的分層,例如六軌(把鋼琴與吉他從 Other 裡拉出來)或十二軌(再細分弦樂、銅管、木管、背景合聲)。
重要的是,Stem 是「音訊」——它仍然是波形,仍然是 WAV 或 FLAC 檔。你可以播放它、混音它、加效果器,但你沒辦法直接修改裡面的單一音符。這就是它跟 MIDI 最大的差別。
2-2 Audio-to-MIDI 的本質
Audio-to-MIDI(或稱自動採譜、Automatic Music Transcription, AMT)做的事情,是把一段音訊轉換成「MIDI 事件」——也就是一連串帶著音高、力度、起始時間與長度的音符指令。它不處理聲音本身,而是試圖還原「這一段音樂是怎麼被演奏出來的」。
這個過程的難點在於:一段波形裡面同時疊了好幾個音,模型必須把混在一起的頻率成分拆解開來,判斷有幾個音、分別是什麼音高、什麼時候開始、什麼時候結束。對於單音素材(例如獨唱旋律、單音貝斯),這件事情相對簡單;但對於複音素材(例如鋼琴和聲、吉他刷弦、整個管弦樂團),難度會呈指數上升。
2-3 兩者的差異與互補
搞懂這個差異之後,一個非常重要的實戰原則就出現了:先把 Stem 分離做好,再對個別 Stem 做 MIDI 轉換。直接對整首混音做 Audio-to-MIDI,結果通常是一場災難,因為模型要同時處理人聲、鼓、貝斯、鋼琴全部混在一起的複雜訊號,錯誤率會高得嚇人。但如果你先分離出乾淨的貝斯軌,再對它做 MIDI 轉換,準確率可以拉到九成以上。
反過來說,Stem 分離也不是萬能。分離得再乾淨,它終究是音訊,不能改音符;而 MIDI 轉換就算只抓對八成,你也能在 DAW 裡手動修正剩下的兩成。兩者搭配起來,才是 2026 年真正有效率的工作流。
三、2026 年主流工具盤點:雲端、本機與 DAW 內建
接下來要面對現實問題:到底該用哪一套?我把目前市面上最主要的三大類工具整理如下,並在最後給一個對照表。
3-1 雲端服務:開箱即用,但要看方案
雲端服務最大的優點是「不用管硬體」。你只要上傳檔案,伺服器端的 GPU 會在幾十秒內把結果吐回來。2026 年這類服務的品質普遍很好,因為它們用的是最新的模型,而且持續在更新。常見的功能包含四軌或六軌分離、人聲去殘響、去和聲、去鼓聲、以及部分服務提供 Audio-to-MIDI。
缺點有三個:第一是隱私,你的未發表作品會上傳到別人的伺服器;第二是檔案大小與長度限制,免費用戶通常只能處理幾分鐘、壓縮過的音檔;第三是可控性低,你沒辦法調參數,只能接受它給你的結果。如果你只是偶爾處理一兩首歌,雲端服務是最省事的選擇;但如果你要批次處理大量素材,或者需要反覆微調,那本機方案會更適合。
3-2 本機開源模型:免費、可控、需要一點技術
開源社群這幾年的成果非常驚人。以 Demucs 系列為基礎的各種分支、加上新一代的 Transformer 架構模型,在本機 GPU 上跑出來的品質,已經足以跟雲端服務打對台。優點是完全免費、可以離線、可以批次處理、可以自己調參數,而且你的素材永遠不會離開你的電腦。
缺點也很明顯:需要一張像樣的顯卡。2026 年的入門門檻大概是 8GB 以上的 VRAM,處理一首四分鐘的歌大約需要一到三分鐘;如果用 CPU 硬跑,可能要十分鐘以上,而且某些模型會直接拒絕執行。另外,安裝環境對不熟悉命令列的人來說還是有點門檻,雖然現在很多工具都已經包成圖形介面,但遇到版本衝突或驅動問題時,還是得自己解決。
3-3 DAW 內建與外掛:無縫整合的選擇
2026 年,主流 DAW 幾乎都已經把 AI 分離功能做進去了,或者有官方合作的外掛。這種做法最大的優勢是「不用切換軟體」——你可以在專案裡直接對某一段音訊按右鍵,選擇分離成多軌,結果直接變成專案裡的軌道,時間軸完全對齊,不需要手動匯入匯出。
對於已經習慣某套 DAW 的人來說,這通常是效率最高的選擇。但要注意的是,DAW 內建功能的模型版本有時候會落後於最新的開源模型,尤其是比較舊版的 DAW。購買前建議先查一下它用的是哪一代的引擎。
類型
代表方案
優點
缺點
適合誰
雲端服務
各大線上分離平台
免安裝、品質穩定、速度快
隱私疑慮、有檔案限制、無法調參
偶爾使用、不想碰技術設定的人
本機開源
Demucs 系列與新一代模型
免費、可批次、可調參、離線
需要 GPU、安裝有門檻
大量處理、重視隱私、想深入調整的人
DAW 內建
主流 DAW 的內建分離功能
無縫整合、時間軸自動對齊
模型版本可能較舊、綁定軟體
已經有慣用 DAW 的創作者
四、實戰前的環境準備:別讓素材毀在第一步
很多人以為「丟進去就好」,結果分離出來的東西滿是雜訊、破音、或是時間對不上,問題往往不在模型,而在素材本身。這一節講的東西看起來很基本,但卻是決定成敗的關鍵。
4-1 硬體與算力配置
如果你打算走本機路線,以下是可以參考的配置基準。
另外提醒兩件事:第一,硬碟空間要留夠,因為分離過程會產生大量暫存檔,輸出的 WAV 檔也不小;第二,筆電跑長時間運算時要注意散熱,過熱降頻會讓處理時間拉長兩三倍。
4-2 檔案格式、取樣率與前處理
素材的品質直接決定分離的上限。以下是我建議的前處理流程:
第一,盡量用無損格式。WAV 或 FLAC 最好,320kbps 的 MP3 還勉強可以,再低的位元率就別期待有好結果。壓縮失真會在分離後被放大,聽起來像是一層沙沙的霧。如果手上只有低品質檔案,可以考慮先用修復類工具做一點降噪,但效果有限。
第二,取樣率選擇要一致。多數模型是在 44.1kHz 的資料上訓練的,餵 44.1kHz 或 48kHz 通常都沒問題,但如果你把 96kHz 的檔案直接丟進去,有些工具會自動重取樣,有些不會,導致結果聽起來怪怪的。建議統一轉成 44.1kHz 再處理。
第三,檢查音量。如果素材本身已經過度壓縮、削波(clipping)嚴重,分離出來的結果會很糟。可以先用 DAW 看一下波形,如果滿是平頂,考慮先做一點降增益處理。
第四,處理掉開頭與結尾的靜音或雜訊。這能省下不少運算時間,也避免模型把雜訊誤判成樂器。
五、Stem 音軌提取實戰:從一個 WAV 到四個可混音軌道
環境準備好之後,就可以進入實際操作了。以下流程不論你用雲端、本機還是 DAW 內建,邏輯都一樣,只是按鈕位置不同。
5-1 步驟一:素材健檢
把檔案放進工具之前,先做三件事。第一,聽一遍,確認檔案沒有損壞、沒有奇怪的跳音或中斷。第二,用 DAW 或頻譜軟體看一下頻譜圖,了解這首歌的頻率分佈——例如它有沒有很低的 sub bass、人聲大概落在哪個頻段、鼓的低頻有沒有跟貝斯打架。這會影響你後面選模型與調參數的判斷。第三,確認歌曲的動態範圍,如果整首歌從頭到尾都很大聲、沒有什麼起伏,那分離時殘留會比較明顯。
5-2 步驟二:模型與參數選擇
這是整個流程裡最容易被忽略、但影響最大的一步。以下是幾個實務上的判斷原則。
看用途選模型。如果你只要人聲,那就選專門做人聲分離的模型,它對人聲的處理會比通用四軌模型更細緻。如果你需要全部樂器,那就選六軌或更多軌的模型。不要用一個模型打天下。
看樂風調參數。電子音樂、嘻哈、搖滾、古典樂的最佳參數不一樣。有些工具提供「重疊率」(overlap)或「分段長度」(segment length)的設定;重疊率高一點可以減少接縫處的瑕疵,但會增加運算時間。對於節奏強烈的電子樂,通常預設值就很好;對於編制複雜的古典樂,建議把重疊率調高。
善用「去殘響」功能。2026 年許多工具都有專門處理殘響的模組,可以把人聲或鼓的空間感抽掉,讓結果聽起來更乾、更適合放進新專案裡。如果你的用途是 Remix,這個功能非常重要。
5-3 步驟三:分離執行與後處理
執行分離之後,先不要急著匯入 DAW。花幾分鐘做以下檢查:
5-4 步驟四:匯入 DAW 的檢查清單
匯入時有幾個小細節會影響後續作業。第一,確認取樣率與專案一致,避免 DAW 自動重取樣造成音質損失。第二,把所有軌道命名清楚,並且統一從同一個時間點開始,方便對齊。第三,建議在專案裡建立一個「參考軌」放原曲,隨時可以 A/B 對照。第四,如果你要繼續做 MIDI 轉換,記得保留一份未經任何處理的乾淨 Stem,因為加過效果器之後會影響轉換準確度。
六、MIDI 轉換實戰:把聲音變成可以按的琴鍵
拿到乾淨的 Stem 之後,接下來就是重頭戲:Audio-to-MIDI。這一段的難度落差非常大,取決於素材的複雜度。我把常見的四種情況分開來講。
6-1 單音素材:人聲與旋律線
單音素材是最好處理的,準確率通常可以到九成以上。流程上,先把人聲軌做一點前處理:用輕度的降噪、稍微壓縮一下動態,讓音高偵測更穩定。然後選擇標示為「monophonic」的轉換模式,避免模型去做複音猜測。
轉換完成後,進 DAW 檢查三件事:第一,滑音與轉音有沒有被過度量化,導致聽起來很機械;第二,氣音與齒音有沒有被誤判成音符;第三,長音的尾端有沒有被截斷。這三類問題都很常見,通常需要手動修一點,但整體來說,單音轉換已經是非常成熟的自動化流程。
6-2 貝斯:最容易成功也最容易做壞
貝斯是四軌裡面最適合做 MIDI 轉換的一軌,因為它通常是單音、頻率範圍固定、而且節奏明確。但也因為這樣,很多人做出來的貝斯 MIDI 一聽就很假——問題出在「力度」與「音長」被過度簡化。
實務上的建議是:轉換時保留原始的力度資訊(velocity),不要全部量化成同一個數值;音長也不要全部對齊到格線,留一點人性化的差異。另外要注意低頻的偵測容易受到鼓的殘留影響,所以務必確認貝斯軌足夠乾淨。如果你用的是合成器音源,記得把 MIDI 的力度對應到 filter cutoff 或音量,否則聲音會很平板。
6-3 鼓組:打擊樂轉 MIDI 的取捨
鼓組的 MIDI 轉換在 2026 年已經做得相當好,尤其是對「鼓點位置」的偵測,幾乎可以說是精準。真正麻煩的是「音色分類」——模型要把偵測到的打擊聲對應到正確的 MIDI 音符(大鼓、小鼓、hi-hat、tom 等),這個部分在電子鼓上表現很好,但在真實鼓組錄音上就會有一些誤判。
我的建議是:把鼓的 MIDI 轉換當成「打底」而不是「成品」。用它來抓到所有鼓點的時間位置,然後手動修正音色分類。這樣做比從頭用手點快上十倍,而且不會漏掉細節。另外要注意的是 hi-hat 的開合與 ghost note,這些細節通常需要手動補。
6-4 鋼琴與複音:2026 年真正的分水嶺
複音素材——尤其是鋼琴——一直是 Audio-to-MIDI 最難的題目。原因很簡單:鋼琴同時有十個手指在動,每個音有獨立的起音與衰減,加上踏板造成的共鳴,整個頻譜非常複雜。2024 年之前的工具在這方面只能做到「大概抓到主旋律」,內聲部經常整片消失或變成錯誤的音。
2026 年的新一代模型有了明顯進步,尤其是針對鋼琴訓練的專用模型,在標準測試資料上的音符準確率已經可以到八成五以上。但實際應用時,我建議把它當成「幫你打好七成草稿」的工具,剩下的三成靠自己修。修的時候有幾個技巧:先把轉換結果的力度做一次平滑處理,避免不自然的跳動;然後檢查和弦的內聲部有沒有漏音;最後對照原曲,把明顯錯誤的音修掉。這個過程聽起來很累,但比起從頭抓歌,還是快得多。
七、常見問題與排錯手冊
接下來整理幾個論壇上最常出現的問題,以及實際的解法。
7-1 分離後出現水聲、殘響與金屬感
這是最經典的問題。「水聲」通常是模型在處理頻率重疊區域時的相位錯誤造成的,聽起來像水下廣播。解法有三個:換用波形域模型(通常比頻譜域模型少這個問題);提高重疊率參數;或者對結果做輕度的頻譜修補。
殘響殘留則是因為模型沒有把空間資訊完全分離。如果你的工具有「去殘響」模組,直接開下去;沒有的話,可以對結果做輕度的 gate 或 expander,把尾巴的殘響壓低,但要小心不要讓聲音聽起來太乾太死。
金屬感通常發生在鼓軌,特別是 hi-hat 與 cymbal。這是因為高頻的分離比較困難,模型容易把其他樂器的高頻殘留一起抓進來。解法是對鼓軌做一次高通濾波,把不必要的低頻殘留清掉,然後檢查是不是有其他軌的能量滲進來。
7-2 MIDI 節拍與音準對不上
節拍對不上通常是兩個原因:一是工具的偵測有誤差,二是轉換時用了錯誤的量化設定。建議先關掉自動量化,看看原始轉換結果的節奏對不對;如果原始結果就有偏移,那就是偵測問題,可以嘗試先對音訊做節拍對齊再轉換。如果原始結果是對的、只有量化後跑掉,那就是量化格線設錯了,改成對應的拍號與細分即可。
音準對不上則通常是因為音訊本身有滑音、顫音或微分音。這種情況下,強制轉成平均律的 MIDI 就會聽起來怪。解法是保留原始的 pitch bend 資訊,或者手動修飾這些裝飾音。如果你的音源不支援 pitch bend,那就得接受一定程度的失真,或者自己重新演奏。
7-3 算力不足與中斷
跑大型模型時,如果 VRAM 不夠,程式可能會崩潰或跑到一半中斷。解法有幾個:把音訊切成小段分別處理,再把結果接起來;降低模型的批次大小;關閉其他佔用 GPU 的程式;或者改用比較輕量的模型。如果用的是 CPU 模式,記得把電源管理設定成高效能,並且確認散熱正常,避免過熱降頻導致處理時間失控。
八、版權、授權與倫理:拆解別人作品前必須知道的事
這一節非常重要,但也是最容易被忽略的。技術上你能做,不代表法律上你可以做。
首先,分離出來的 Stem 仍然受到原曲的著作權保護。它只是原曲的另一種形式,不會因為你拆開了就變成你的作品。如果你沒有取得授權,就不能把這些 Stem 用在公開發表的作品裡,包括上傳到串流平台、放在 YouTube 上營利、或者做成實體商品販售。
其次,不同用途的法律風險不一樣。純粹個人學習、私下練習、在自己的房間裡聽,通常屬於合理使用或低風險範圍。但一旦涉及公開傳播、商業使用、或者二次創作發表,風險就會大幅上升。尤其是拿別人的原曲做 Remix 之後上架,這在大多數國家都需要取得原著作權人的授權,否則可能面臨下架甚至法律責任。
第三,有些平台會偵測 AI 分離的內容。2026 年各大串流與影音平台都已經部署了辨識技術,能夠偵測出使用未授權 Stem 的內容。不要抱著僥倖心態。
那實務上該怎麼辦?有幾個安全的做法:使用自己有版權的素材、使用明確標示為可商用或 CC 授權的音樂、取得原作者的書面授權、或者把分離出來的東西當成學習與分析的參考,而不是直接發表。論壇上常常有人問「我只是自己做爽的,可以嗎」,答案是「自己聽通常沒問題,但放上網路就有風險」。
九、完整工作流示範:從一首歌到一個可重編的專案
最後,我把整篇文章的流程串成一個具體的示範,讓你可以照著做一遍。
第一步,取得高品質素材。用無損格式,確認取樣率為 44.1kHz,音量沒有削波。先聽一遍,了解歌曲結構。
第二步,執行 Stem 分離。選擇適合的模型,設定適當的重疊率,執行分離。如果是複雜編制,考慮用六軌模型。
第三步,後處理與檢查。獨聽每一軌,清掉明顯殘留,做去殘響處理,確認相位與時間對齊正確。
第四步,匯入 DAW。建立專案,命名軌道,設定參考軌,調整增益。
第五步,針對需要的軌道做 MIDI 轉換。貝斯與旋律用單音模式,鼓用打點模式,鋼琴用複音模式。轉換後手動修正明顯錯誤。
第六步,重新編曲。用轉換出來的 MIDI 配上新的音色,或者保留部分原始 Stem,混搭出新的版本。
第七步,混音與母帶。注意分離後的軌道通常動態比較大、音色比較薄,需要一點補償處理。最後做整體響度與頻率平衡。
這個流程跑一遍大概需要一到三小時,取決於素材複雜度與你手動修正的程度。熟練之後會快很多,但不要為了快而跳過檢查步驟,那些時間省下來,最後都會用「重做」的方式還回去。
十、結語:工具會變,耳朵不會
2026 年的 AI 音軌拆解技術,已經強到讓很多人開始擔心「音樂創作是不是要完蛋了」。但實際上,工具再強,它做的事情也只是「把已經存在的聲音拆開」。真正的創作——決定要寫什麼和弦、要用什麼音色、要怎麼安排段落、要讓聽眾感受到什麼情緒——這些還是人的工作。
把 AI 拆解當成一個放大器:它讓你學得更快、做得更多、嘗試得更勇敢。你可以用十分鐘拆解一首歌,然後花十個小時研究它的編曲邏輯;你也可以用三十分鐘把一段旋律轉成 MIDI,然後花一整個晚上打磨它的音色。這才是這套技術真正的價值。
最後回到實務面:不要迷戀最新的模型,也不要輕視基礎的素材處理。一個乾淨的 WAV 檔案加上正確的參數,比一個爛檔案配上最先進的模型,結果永遠比較好。工具會一直換,但耳朵、判斷力、以及對音樂的理解,才是真正會跟著你走一輩子的東西。
希望這篇長文能幫到「雅寶社區 · 頂客論壇」音樂創作版的朋友們。如果你在實作過程中遇到什麼怪問題,歡迎在底下留言,把你的素材狀況、使用的工具、以及遇到的現象描述清楚,大家一起來排錯。畢竟這種東西,實戰經驗比什麼都重要。
```