如何利用 AI 生成影片字幕與跨語言翻譯腳本
在進入實戰步驟之前,先把工具地圖攤開來看。字幕工作流可以粗分成三層:語音辨識層負責把聲音變成文字與時間戳;翻譯與改寫層負責語言的轉換與潤飾;格式與時間軸層負責讓字幕在播放器上好看、好讀、對得上畫面。三層各有一批成熟的工具可以選。
語音辨識引擎怎麼選:Whisper 系與商用 API 的取捨
目前社群最主流的選擇是 Whisper 系列,包含原始版 OpenAI Whisper、速度更快的 faster-whisper、以及專門強化時間軸對齊的 WhisperX。它們的共同優點是開源、可離線執行、支援多語言,而且能透過 initial prompt 餵入專有名詞來提升辨識率。
工具類型適合情境注意事項
選擇的關鍵有三個。第一是素材語言與口音:Whisper 對中英夾雜的處理不算完美,如果你的影片常常中英混用,建議先用 large 級別模型跑一次,再人工修掉明顯錯誤。第二是是否需要說話者分離:訪談型、座談型影片需要標註「誰在說話」,這時 WhisperX 搭配 pyannote 這類說話者分段模型會比純 ASR 實用。第三是成本與隱私:如果是客戶委託的未公開素材,離線執行會比上傳雲端安心。
翻譯層:為什麼「先轉錄再翻譯」比「直接聽譯」可靠
有些模型標榜能「一邊聽一邊翻」,直接輸出目標語言字幕。聽起來很省事,但實務上筆者建議避開,原因有三個。
第一,錯誤無法攔截。直接聽譯時,辨識錯誤會被翻譯層「順著」翻成目標語言,你根本看不出原始語音是什麼,也就無從修正。先轉錄再翻譯,至少你手上有一份可校對的原文稿。
第二,術語無法控管。先有原文稿,你才能建立術語對照表,確保同一個詞在整支影片裡翻法一致。直接聽譯時,模型每一段都可能自由發揮,結果同一支影片出現三種譯名。
第三,資產無法重用。逐字稿本身就是有價值的資產,可以拿去做部落格文章、社群貼文、章節摘要。直接聽譯的產物只有字幕檔,價值單薄。
翻譯引擎的選擇上,LLM(例如 GPT、Claude、Gemini 等系列模型)在字幕場景的表現通常優於傳統翻譯 API,因為它們能理解上下文、接受風格指令、處理省略主詞的口語。但傳統翻譯 API 在「穩定、便宜、快速」這三點上仍有優勢,特別是當你的內容是技術文件型的獨白時,兩者可以混用:先用 LLM 翻一遍,再用傳統 API 做交叉比對。
字幕格式與時間軸工具:SRT、VTT、ASS 的差異
輸出格式會影響你的後續流程,先搞清楚各自的用途:
時間軸處理的工具鏈通常是 ffmpeg 抽音訊、Python 的 srt 或 pysubs2 函式庫做批次修改、Subtitle Edit 做人工微調。如果你完全不想碰程式碼,Subtitle Edit 內建 Whisper 整合,圖形介面就能跑完整條流程,是很划算的入門選擇。
三、實戰流程:從原始影片到多語字幕檔的六個步驟
接下來是具體操作。以下流程以「一支中文談話型影片,要輸出中文與英文雙語字幕」為例,其他語言組合只需替換翻譯階段的設定。
步驟一:音訊前處理與降噪
語音辨識的品質,八成取決於音訊品質。建議先把影片音軌抽出來,轉成 16 kHz 單聲道 WAV,這是 Whisper 系列的標準輸入格式。指令大致如下:
ffmpeg -i input.mp4 -vn -ac 1 -ar 16000 -c:a pcm_s16le audio.wav
如果原始錄音有背景噪音、冷氣聲、鍵盤聲,建議先過一輪降噪。工具方面,RNNoise 這類輕量方案適合批次處理,Adobe Podcast 的線上降噪效果更好但要上傳。要注意的是,降噪過度會讓語音變得「悶」,反而降低辨識率,建議保留一點原始檔作為對照。
另外,如果影片裡有純音樂段落、片頭動畫、無聲段落,可以事先標記時間範圍,讓後續流程跳過,避免模型對著音樂硬轉出一堆幻覺文字。
步驟二:生成主語言逐字稿
這是整條流程的核心。以 faster-whisper 為例,基本呼叫會指定模型大小、語言、以及是否啟用 VAD(語音活動偵測)來切段。模型大小的選擇上,large 系列準確率最好但吃資源,medium 或 small 在清晰錄音下也夠用,可以先跑 small 出一版草稿,再決定要不要升級。
有兩個參數特別值得注意。一個是 initial_prompt:你可以把影片中的專有名詞、人名、品牌名塞進去,模型會傾向輸出這些詞。例如你做的是攝影教學,可以把「光圈、快門、感光度、景深」寫進提示,能明顯降低錯字率。另一個是 temperature:設為 0 會讓輸出更穩定,但遇到含糊語音時可能卡住;保留一點隨機性有助於模型「猜」出合理內容,但代價是偶爾會幻覺。
轉出來的結果通常包含每一段的開始時間、結束時間、以及文字。建議存成 JSON 保留完整結構,再另外輸出 SRT 供校對用。這樣後續做格式轉換或重新對齊時,不用重跑辨識。
步驟三:人工校對與術語表建立
這一步是整條流程裡最不能省的人工環節。AI 逐字稿的錯誤型態很固定,大致是:同音異字、專有名詞拼錯、數字與單位誤判、語助詞過多、標點缺失。校對時不必逐字重聽,只要「聽關鍵句、看整體邏輯」,通常能在一小時內處理完三十分鐘的影片。
校對的同時,請順手建立術語表(glossary)。格式可以很簡單,一張 CSV 就好:
原文,目標語言,備註
時間軸,timeline,不要翻成 time line
業配,sponsored segment,社群用語
開箱,unboxing,產品類影片常用
這張表在翻譯階段會發揮巨大作用。它不只確保譯名一致,還能阻止模型把社群慣用語翻成字面意思。當你累積了五支、十支影片的術語表,就會形成自己頻道的「語言資產」,新影片的翻譯品質會越來越高。
步驟四:AI 翻譯與文化在地化
翻譯階段最重要的一個技術觀念是分塊策略。不要把整篇逐字稿一次丟給模型,也不要一句一句翻。前者會讓模型「偷懶」省略內容、或因為上下文太長而失去時間軸對應;後者則因為缺乏上下文,導致代名詞與語氣判斷錯誤。
實務上建議以 10 到 30 個字幕段為一批,每批附上術語表與風格指令,並要求模型以固定格式輸出(例如保留原本的 cue 編號)。這樣即使某批翻譯有問題,也只需重跑那一批,不會整支影片重來。
文化在地化則是 AI 翻譯之後的必要加工。舉幾個常見例子:中文的「辛苦了」在英文裡沒有對應的固定說法,要依情境改成「Thanks for your hard work」或「Great job today」;台灣觀眾熟悉的品牌暱稱,翻成日文時可能要用正式名稱;反諷語氣在跨語言時最容易走味,需要改寫成目標語言能理解的幽默。這部分建議保留給人工,或至少做一次人工複審。
步驟五:時間軸壓縮、分行與閱讀速度檢查
字幕不是逐字稿。逐字稿給人閱讀,字幕給人「邊看畫面邊掃過」。因此時間軸必須經過壓縮與重排,通常會做三件事:合併過短的 cue、拆開過長的 cue、調整每行的字數。
業界常用的可讀性指標有兩個。第一個是每行字數上限:拉丁字母語言約 42 字元,中日韓文字約 16 到 20 字。第二個是每秒字元數(CPS):一般建議落在 15 到 20 之間,兒童節目或教學內容可以再低一點。超過這個速度,觀眾會來不及讀。
項目建議值說明
單一字幕最長顯示時間6 秒超過就該拆成兩段
單一字幕最短顯示時間1 秒太短會閃爍,建議合併
這些檢查可以寫成腳本自動跑。例如用 pysubs2 讀入 SRT,計算每一段的 CPS,把超過門檻的段落標記出來,再人工決定要拆句還是縮短用詞。這比逐段目測快得多。
步驟六:輸出與嵌入
最後一步是把字幕檔輸出成各平台需要的格式,並確認編碼。中文與日文建議使用 UTF-8,避免亂碼。YouTube 上傳時可以直接吃 SRT 與 VTT,如果要雙語字幕,實務上有兩種做法:一是每個語言各上一個軌道,讓觀眾自己切換;二是把雙語合併在同一份字幕裡,通常上排原文、下排譯文,這種做法在 ASS 格式下最容易控制樣式。
社群平台的部分要注意字數限制。短影音平台的自動字幕常常無法調整,建議直接把字幕燒進畫面(burn-in),或使用平台支援的上傳字幕功能。燒進畫面的缺點是無法關閉,但對於靜音瀏覽比例極高的短影音來說,這通常是可以接受的取捨。
四、提示詞工程:讓 AI 翻譯出「能上字幕」的腳本
很多人用 AI 翻譯字幕失敗,問題不在模型不夠強,而在提示詞太隨便。丟一句「把下面翻成英文」,得到的通常是「能讀、但不能上字幕」的產物:句子太長、語氣太正式、專有名詞亂翻、格式跑掉。以下提供一套可直接套用的提示詞骨架。
翻譯提示詞的基本骨架
一個好的字幕翻譯提示詞,應該包含六個元素:角色設定、任務描述、語域與風格、格式約束、術語表、以及輸出範例。實際長相大致如下:
你是一位專業的字幕翻譯師,專門處理 YouTube 談話型影片。任務:將以下編號字幕從繁體中文翻譯成自然的美式英文。
風格要求:
- 口語、簡潔,符合影片講者輕鬆但有專業度的語氣。
- 每條字幕不超過 42 個字元,超過時請縮短用詞,不要硬塞。
- 不要逐字直譯,以目標語言的自然說法為優先。
- 保留所有專有名詞與品牌名稱的原文。
術語表(必須遵守):
- 時間軸 → timeline
- 業配 → sponsored segment
- 開箱 → unboxing
輸出格式:嚴格保留原本的編號與時間碼,只替換文字內容。
不要輸出任何說明文字或註解。
字幕內容如下:
[編號字幕內容]
幾個細節值得強調。「不要輸出說明文字」這句一定要加,否則模型很喜歡在開頭寫一段「好的,以下是翻譯」,讓你還得手動刪。「保留編號與時間碼」則確保你能直接把輸出貼回字幕檔,不用重新對齊。
另外,如果你的影片有強烈的個人風格,例如大量網路用語、反諷、自嘲,建議在提示詞裡補上一到兩個「風格範例句」,告訴模型「這種感覺」。LLM 對範例的模仿能力遠強於對形容詞的理解。
常見錯誤與修正對照
以下是字幕翻譯最常出現的幾種失誤,以及對應的修正方式:
五、品質控管與常見地雷
AI 字幕最大的風險不是「翻錯」,而是「翻得很順但錯得不明顯」。觀眾不會回報每一句錯誤,但累積起來就會影響信任感。因此品質控管必須制度化,而不是靠感覺。
機器翻譯的六種典型錯誤
第一,幻覺。當音訊有噪音或語意不清時,模型可能「發明」一段不存在的內容。這在純音樂段落特別常見。解法是加入 VAD 過濾,並在人工校對時留意「講者根本沒說過的話」。
第二,時間軸漂移。翻譯後句子變長,如果直接套用原時間軸,會出現字幕提前消失或延遲出現。解法是翻譯完成後重新做一次對齊,或使用字級時間戳重新分配。
第三,譯名不一致。同一個角色或產品在不同段落有不同翻法。解法是術語表加上全域搜尋替換。
第四,標點與斷句錯誤。中文的逗號密度與英文不同,直接沿用會讓英文句子過長。解法是要求模型重新標點,而非保留原標點。
第五,過度書面化。把口語翻成書面語,觀眾會覺得「這不是他講的話」。解法是明確要求口語風格,並提供範例。
第六,敏感內容誤判。某些詞在目標語言有貶義或政治敏感,機器不會自動迴避。這在跨文化上架時特別重要,建議在輸出前做一次人工複審。
字幕閱讀節奏與字數的真實感受
很多創作者會忽略一件事:字幕的閱讀速度跟「看得懂」是兩回事。同樣一句話,寫在文章裡讀者可以停下來想,但在影片裡,字幕只停留兩秒。這就是為什麼 CPS 檢查這麼重要。
實務建議是:先確保 CPS 達標,再談翻譯的優雅程度。一句完美的翻譯如果超過閱讀速度,觀眾只會看到殘影。反過來說,一句稍微簡化但能在時間內讀完的翻譯,對觀眾的體驗更好。這也是字幕翻譯與一般筆譯最大的差異所在。
另外要提醒的是,不同語言的「資訊密度」不同。中文一句十個字能表達的內容,翻成英文可能要十五個單詞,時間軸卻沒有變長。實務上的處理方式有兩種:一是允許譯文適度精簡(只保留核心訊息),二是把原 cue 拆成兩段並延長顯示時間。兩者都可以用腳本輔助判斷。
六、成本、版權與自動化:長期經營的考量
當你把 AI 字幕流程跑順之後,接下來要思考的是「怎麼規模化」與「怎麼避開風險」。
成本估算
自架 Whisper 的成本主要是硬體與電費。如果你已經有支援 CUDA 的顯卡,邊際成本接近零;如果租雲端 GPU,一小時影片的辨識成本大約落在幾美分到幾十美分之間,視機型而定。
翻譯階段的成本則取決於 token 用量。以一小時的談話型影片來說,逐字稿大約八千到一萬兩千字,換算成 token 約一萬五到兩萬,加上提示詞與輸出,來回一趟大約三萬到五萬 token。如果使用中高階模型,一支影片的翻譯成本大約在幾美分到一美元之間;若改用較便宜的模型或傳統翻譯 API,還能再壓低。相較於外包翻譯的報價,這個差距是數量級的。
版權與授權的注意事項
有幾點必須留意。第一,你上傳到雲端服務的音訊與文字,要先確認該服務的使用條款是否允許用於訓練或保存,涉及客戶機密時尤其重要。第二,字幕本身也是著作物,如果你是翻譯別人的影片,沒有授權就發布翻譯字幕,可能涉及改作權的問題。第三,背景音樂:即使畫面是你自己的,若影片中有版權音樂,字幕翻譯不會改變音樂的授權狀態,上架前仍要處理。
還有一個常被忽略的點:AI 生成內容的標示。部分平台已要求揭露 AI 生成的內容,雖然字幕翻譯通常不在強制範圍,但若你的影片有大量 AI 生成素材,建議主動標註,避免爭議。
用腳本把整條流水線串起來
當流程穩定之後,強烈建議寫一支自動化腳本。典型的骨架是:
用 ffmpeg 抽出音訊並標準化格式
呼叫 faster-whisper 產生帶時間戳的 JSON
依術語表做前置替換(把容易錯的詞先鎖定)
分批呼叫 LLM API 做翻譯,附上提示詞與術語表
把回傳結果合併回字幕結構,重新計算時間軸
跑 CPS 與行長檢查,輸出報告供人工複審
輸出 SRT、VTT、ASS 三種格式
這支腳本不需要寫得很漂亮,能跑就好。重點是每一步都留下中間檔案(音訊、逐字稿 JSON、翻譯結果、檢查報告),這樣出問題時可以從失敗的那一步重跑,不用整支影片重來。對於每週固定出片的創作者來說,這套工具鏈的投資報酬率極高。
結語:AI 負責量產,人負責判斷
回到最開始的問題:AI 到底能不能取代字幕師?答案是「能取代流程,不能取代判斷」。AI 可以在幾分鐘內產出八成正確的逐字稿與翻譯,但剩下那兩成,決定了你的影片是「有字幕」還是「看得舒服」。語氣對不對、笑點有沒有到位、專有名詞是否一致、字幕會不會太挤——這些都需要人來看、來決定。
建議的實作順序是:先從單一語言的字幕自動化開始,把 Whisper 與格式轉換跑順;接著建立自己的術語表;最後才導入 LLM 翻譯,並從「少量語言、人工把關」開始,逐步擴展到多語版本。不要一開始就追求全自動,因為你還沒建立判斷標準之前,自動化只會放大錯誤。
如果你在雅寶社區 · 頂客論壇的影音創作版有實作上的問題,歡迎把流程卡住的環節提出來討論。字幕這件事沒有標準答案,只有適不適合你的頻道節奏的做法。把工具用熟,把品質守住,剩下的就是持續產出而已。