虛擬歌手 Voice Bank 訓練技術與音色複製版權倫理
第二世代(2010 年代)引入 HMM(隱馬可夫模型)與統計參數合成,例如 CeVIO、VOCALOID 4 之後的改版。聲音變得平滑,但「人味」仍然不足,尾音與換氣常常需要人工修補。
第三世代(2015 年後)是深度學習正式介入的階段。DNN(深度神經網路)開始取代部分拼接與參數模組,Synthesizer V 與 NEUTRINO 是此期的代表,自然度有跳躍式提升,且訓練所需資料量開始下降。
第四世代(2020 年後)則是擴散模型(Diffusion)、Flow Matching 與自我監督語音模型(如 HuBERT、ContentVec)的天下。這一代最大的特徵是「零樣本」(Zero-shot)與「少樣本」(Few-shot):只要幾秒到幾分鐘的參考音訊,就能複製出相當逼真的音色。RVC、So-VITS-SVC、GPT-SoVITS 都是這個脈絡下的產物。
這條演進線的關鍵意義在於:技術門檻的下降速度,遠遠快於法律與倫理規範的建立速度。當一個國中生都能在自己房間訓練出偶像的聲庫時,我們需要的已經不只是技術教學,而是一套能夠被社群共同接受的規範。
二、Voice Bank 訓練技術全解析
接下來我們進入技術核心。這裡會從傳統方法一路講到最新的神經網路架構,並且說明每一種方法的優缺點與適用場景。
傳統拼接合成:從單音取樣到連續錄音
拼接合成的邏輯非常直觀:把聲音切成最小的單位,需要的時候再拼起來。最早期甚至是逐音錄製(每個音高、每個母音各錄一次),後來演進為「連續錄音」(Continuous Recording),也就是讓配音員用固定音高連續唱出一串音節,再由工程師切分。
拼接合成的優勢是「保真度極高」——因為每一段聲音都是真人實際發出的,不存在模型幻聽或音質劣化的問題。缺點則是:
資料量龐大,一個完整日文聲庫動輒需要數千個取樣檔。
跨音域與跨力度時,接縫處容易出現音色斷層。
無法產生錄音時沒有錄到的聲音(例如從未錄過的特殊換氣或假音)。
UTAU 這個免費引擎至今仍大量使用拼接式聲庫,原因就在於它的門檻極低、可控性極高,而且對硬體要求不嚴苛。
統計參數合成與 HMM/DNN 的演進
參數合成的核心思想是:不要儲存聲音波形,而是儲存「產生這段聲音的參數」。HMM 會把聲音拆解成頻譜包絡、基頻、非週期性成分等參數,並建立狀態轉移模型。合成時,模型根據輸入的樂譜與歌詞,推算出最可能的參數序列,再交由聲碼器(Vocoder)還原成波形。
這種方法的最大好處是「可控性」與「資料效率」:因為儲存的是統計模型而非原始音檔,聲庫體積可以大幅縮小,而且能透過參數調整產生錄音時沒有的音高或語氣。缺點則在於聲碼器的品質限制——早期 HMM 聲碼器常常被批評「像在講電話」。
DNN 的介入改變了這一切。以 DNN 取代 HMM 後,模型對頻譜的預測能力大幅提升,加上 WaveNet、HiFi-GAN、Parallel WaveGAN 等神經聲碼器的出現,參數合成的自然度在短短幾年內追上甚至超越拼接合成。這也是 Synthesizer V 能夠在 2019 年造成轟動的技術基礎。
神經網路聲碼器與擴散模型時代
現代聲庫訓練的核心架構,通常可以拆成三個模組:
1. 內容編碼器(Content Encoder):負責從輸入的文字或音素序列中提取「要唱什麼」。近年主流做法是使用自我監督學習模型(Self-Supervised Learning, SSL),例如 HuBERT、WavLM、ContentVec,因為這些模型在大規模語音資料上預訓練過,能夠提取出與說話者無關的語言內容表徵。
2. 音高與風格編碼器(Pitch / Style Encoder):負責控制「怎麼唱」。這部分包含 F0(基頻)曲線、能量、顫音、換氣時機等。擴散模型與 Flow Matching 在此扮演關鍵角色,因為它們能透過迭代去噪的過程,生成極度自然且帶有細微變化的音高曲線。
3. 解碼器與聲碼器(Decoder / Vocoder):負責把前面的表徵還原成波形。HiFi-GAN 是目前的業界標準之一,而擴散式聲碼器則在音質上更進一步,但推論速度較慢。
這種架構的關鍵突破在於「解耦」(Disentanglement):把「內容」與「音色」分離開來。一旦分離成功,理論上就可以做到「用 A 的聲音唱 B 的歌」,而且不需要 A 錄過那首歌。這正是 AI 翻唱技術的技術本質。
音色轉換(SVC)與 RVC/So-VITS-SVC 的興起
語音轉換(Voice Conversion, VC)與歌聲轉換(Singing Voice Conversion, SVC)是近幾年最受關注的分支。與傳統聲庫訓練不同,SVC 不需要從零開始訓練一個完整聲庫,而是直接把一段既有的歌聲,轉換成目標音色。
RVC(Retrieval-based Voice Conversion)是其中的代表。它的核心概念是:在轉換時,從目標音色的資料庫中「檢索」最相似的音素特徵,用以修正轉換結果,藉此降低資料需求並提升相似度。So-VITS-SVC 則結合了 SoftVC 與 VITS 架構,在音質與穩定度上表現優異。更近期的 GPT-SoVITS 則進一步引入語言模型,讓少樣本訓練(1 分鐘語音即可)成為可能。
SVC 技術的普及,直接導致了「AI 翻唱」在 2023 年後的爆炸性成長。它的技術門檻低、訓練時間短、效果立竿見影,卻也因為素材來源經常是未經授權的商業錄音,成為版權爭議的最前線。
三、訓練一個 Voice Bank 的實務流程
理解原理之後,我們來看實作。以下流程適用於多數現代聲庫訓練,包含開源工具鏈與商業引擎。
資料採集與錄音規範
資料是聲庫的靈魂。無論你用的是傳統拼接還是神經網路訓練,素材的品質都會決定最終上限。實務上的建議如下:
位元深度:24-bit 為佳,避免錄音時的量化雜訊。
錄音完成後,務必保留未經任何後製的原始檔。因為降噪、壓縮、EQ 等處理一旦寫入檔案,就會被模型當成「原始音色」學習,反而降低聲庫的可塑性。
標註、音素切分與對齊
標註是整個流程中最耗時、也最容易被低估的環節。標註的目標是告訴模型「這段波形對應到哪個音素、音高多少、何時開始何時結束」。
常見做法是先使用自動對齊工具(如 Montreal Forced Aligner、WhisperX、SOFA)產生初始標註,再由人工校正。校正的重點包括:
音素邊界:尤其是塞音、塞擦音的閉合段,自動工具經常抓不準。
若使用神經網路訓練,標註的精度要求可以稍微放寬,因為模型具備一定的容錯能力;但若採用拼接式聲庫,一個音素的邊界錯誤就可能造成明顯的爆音或吃字。
訓練、微調與超參數
進入訓練階段後,你需要決定幾件事:
架構選擇:若目標是完整聲庫(可唱任意歌曲),通常需要數小時到數十小時的資料,並採用較大的模型;若只是要做到特定音色的風格轉換,SVC 架構(RVC、So-VITS-SVC)會是更有效率的選擇。
訓練資料量:擴散模型與 VITS 類架構通常需要至少 1 小時以上的乾淨語音才能穩定收斂,而 GPT-SoVITS 等少樣本方案則可低至 1 分鐘。但資料越少,模型的泛化能力越差,容易出現咬字不穩或音色漂移。
超參數:學習率(Learning Rate)、批次大小(Batch Size)、訓練輪數(Epoch)與音高提取演算法(F0 Extractor)都會顯著影響結果。以音高提取為例,RMVPE 在多數歌聲資料上表現優於 CREPE,但運算成本較高。
微調(Fine-tuning):若已有基礎模型,可以透過微調快速產出特定音色版本。這是目前最常見的做法,也能大幅降低訓練成本。
推論部署與即時化
訓練完成後,模型需要被部署成可用的形式。常見應用包括:
離線渲染:適用於音樂製作,追求最高音質。
即時合成:用於虛擬主播、直播互動,需要低延遲與高穩定性。
API 服務:供應用程式或網站呼叫,需考量併發量與成本。
即時化通常需要模型量化、ONNX 轉換、快取機制等工程手段。此外,也要注意授權條款是否允許商業使用與再散布,這部分我們會在下一節詳細討論。
四、音色複製的版權與倫理爭議
技術講完了,接下來是最棘手的部分。音色複製的問題之所以複雜,是因為它同時牽涉著作權、人格權、契約法與倫理規範四個層面,而不同國家的處理方式差異極大。
聲音是否受著作權保護?
這是所有爭議的起點。答案取決於你問的是哪一國的法律。
在台灣,《著作權法》保護的是「著作」,也就是文學、科學、藝術等具有原創性的表達。單純的「聲音」或「音色」本身,並不被視為著作。但若聲音被錄製成「錄音著作」,則錄音本身受著作權保護,權利人通常是唱片公司或錄音製作人。這意味著:未經授權使用他人錄音來訓練模型,可能侵害錄音著作權。
在日本,情況較為特殊。日本《著作權法》第 30-4 條(2019 年新增)允許在「非享受著作本身表達」的前提下進行資料分析與機器學習,這使得模型訓練階段的行為有較大的合法空間。但這並不代表可以隨意生成與原唱幾乎一致的翻唱——若生成物被認為是「改作」或「同一性保持權」的侵害,仍可能違法。
在歐美,錄音同樣受著作權保護,且美國部分州(如田納西州、加州)開始出現專門保護「聲音肖像權」的立法。田納西州的 ELVIS Act(2024 年生效)就明確禁止未經授權使用 AI 複製聲音,被視為全球第一個針對 AI 聲音複製的專項立法。
簡單來說:聲音本身未必是著作,但「錄音」是;而「訓練資料」通常就是錄音。這是最容易被忽略的法律陷阱。
人格權、肖像權與聲音權
除了著作權之外,另一個關鍵是「人格權」。在台灣,《民法》第 18 條保障人格權,而第 195 條則涉及名譽與隱私的損害賠償。雖然台灣目前沒有明文規定「聲音權」,但在實務上,若未經同意使用他人聲音進行商業宣傳或造成誤認,仍可能構成侵權。
日本的處理更為明確。日本《民法》第 710 條與 723 條保障名譽與信用,而知名藝人的聲音被視為「商業價值的一部分」,未經授權使用可能構成不當得利或侵權行為。過去就有藝人對聲音模仿提起訴訟的案例。
中國則在《民法典》第 1023 條中明確規定:「對自然人聲音的保護,參照適用肖像權保護的有關規定。」這是全球少數將聲音權明文入法的例子,也讓中國在 AI 聲音複製的法律定位上相對清晰。
這對創作者的實務意義是:即使你沒有使用任何有版權的錄音,只要你模仿的是「可辨識的特定人物聲音」,就仍可能踩到人格權的紅線。
訓練資料的合法性:日本、台灣與國際比較
下表整理了不同法域對「使用他人錄音訓練模型」的態度差異:
對一般創作者的建議是:若你想訓練的對象不是你自己,請取得明確授權,並且保留授權證明。所謂「網路上公開的影片就可以拿來訓練」是錯誤觀念——公開展示不等於授權重製與改作。
深偽(Deepfake)與冒用風險
音色複製最直接的風險,是「冒用」。2023 年以來,全球已出現多起利用 AI 複製聲音進行詐騙的案例:冒充企業高層指示匯款、冒充家人求助、冒充名人代言產品。這些行為不僅涉及民事侵權,在多數國家也已構成刑事詐欺。
對創作者而言,即使你沒有惡意,也可能因為「未標示 AI 生成」而讓聽眾誤以為是本人演唱,進而構成不實廣告或名譽侵害。因此,主動標示「本作品使用 AI 聲庫訓練/語音轉換技術」已是國際社群的普遍共識,也是降低法律風險最簡單的方法。
五、倫理框架與實務建議
法律是最低標準,倫理才是社群能否長久發展的關鍵。以下提供一套實用的判斷框架。
取得授權的層級
授權不是「有或沒有」的二元問題,而是有層級的。實務上可以分為四級:
第一級:完全自製。使用自己的聲音,或與配音員簽訂完整授權合約。風險最低,也是商業專案的首選。
第二級:明確授權。取得聲音本人的書面同意,並載明使用範圍(是否可商用、是否可再授權、是否可修改)。
第三級:推定同意但範圍不明。例如對方在公開場合表示「歡迎大家做 AI 翻唱」,但沒有正式合約。這種情況下建議主動聯繫確認,並保留溝通紀錄。
第四級:未經授權。直接使用他人錄音或模仿可辨識人物。風險最高,不建議用於任何公開發布或商業用途。
社群自律與標示義務
台灣與華語圈的虛擬歌手社群,近年已逐漸形成一些自律規範,例如:
在作品說明欄明確標示使用的聲庫、訓練資料來源與技術工具。
不將 AI 翻唱作品營利,或至少先取得權利人同意。
不製作涉及政治、色情、誹謗等敏感內容的 AI 語音。
尊重原聲優/歌手的意願,若對方明確反對 AI 複製,應立即停止相關創作。
這些規範雖然沒有法律強制力,但它们是社群信任的基礎。一旦多數創作者都能遵守,整體環境才會對新技術更友善。
創作者與使用者的自保清單
最後,提供一份實用的自保清單:
確認你的訓練資料來源是否合法,並保留取得過程的紀錄。
若使用開源模型,詳讀其授權條款(例如 CC BY-NC 4.0 禁止商用)。
在作品頁面標示 AI 生成與技術細節。
避免使用與真實人物過度相似的聲庫進行商業代言或誤導性內容。
若收到權利人反對通知,應立即下架並停止使用。
考慮為自己的自製聲庫建立授權條款,明確規範他人如何使用。
六、結語與未來展望
虛擬歌手的 Voice Bank 訓練技術,從早期的拼接合成走到今天的擴散模型與少樣本學習,本質上是一場「聲音所有權」的重新定義。過去,聲音是跟著人走的;現在,聲音可以被錄製、被拆解、被建模、被複製,甚至被生成。這帶來前所未有的創作自由,也帶來前所未有的倫理挑戰。
我們可以預見,未來幾年會出現幾個明確趨勢:第一,各國將陸續立法明確規範 AI 聲音複製,日本與歐盟的動向尤其值得關注;第二,技術工具會更加強調「授權追蹤」與「生成標示」,例如在模型檔案中嵌入來源資訊;第三,社群自律機制會逐漸成熟,形成類似創用 CC 的授權生態。
對創作者而言,最重要的心態轉變是:把「聲音」當成一種需要被尊重的人格延伸,而不只是可以自由取用的資料。技術本身沒有善惡,但使用技術的方式有。當我們能夠在創新與尊重之間找到平衡,虛擬歌手這條路才能走得又遠又穩。
無論你是剛入門的新手,還是已投入多年的老手,希望這篇文章能成為你在這條路上的一盞路燈。技術會變,法律會變,但對創作的熱情與對他人的尊重,永遠是這個社群最珍貴的資產。