NotebookLM 音訊 Podcast 轉影音腳本實作教學
二、前置作業:資料來源的整理決定成品品質
大部分人失敗的地方不在剪輯,而在最開始的那一步。你丟什麼進去,NotebookLM 就還你什麼。丟三篇內容重複的新聞,你會得到一段廢話連篇的對話;丟一份結構完整的報告加上兩個補充案例,你會得到一段有來有往的深度討論。
2-1 建立 Notebook 與資料來源配置
我的建議配置是「一份主來源 + 兩到三份補充來源」。主來源是你希望這次討論的主軸,例如一份 20 頁的研究報告或一篇長文;補充來源則用來提供對比觀點、實際案例或數據佐證。
舉個實際例子。假設你要做一集講「訂閱制電商的留存策略」,主來源可以放一份產業白皮書,補充來源放一篇競品拆解文章、一份自家後台的留存數據摘要(記得去識別化)、以及一段相關的訪談逐字稿。這樣生成出來的對話,會自然出現「報告說 A,但實際案例顯示 B」這種張力,聽起來就有內容。
另外提醒兩件事:第一,來源數量不要超過十份,太多會讓模型抓不到重點,產出變得平鋪直敘。第二,來源裡的表格與圖表,模型讀取效果通常不好,重要數據建議你手動寫成文字段落再上傳。
2-2 用自訂提示詞控制對話方向
NotebookLM 的音訊生成有一個「自訂」欄位,這是整段流程裡最容易被忽略、卻最有價值的地方。你可以用一段提示詞告訴它:這場對話的定位是什麼、要聚焦哪些問題、語氣要多正式或多輕鬆。
一個實際可用的中文提示詞範例:
請用繁體中文生成一段約 12 分鐘的對談。
聽眾設定:已經在做訂閱制電商、但留存率卡在 30% 以下的經營者。
討論重點:
- 為什麼折扣促銷對長期留存反而是傷害
- 前 90 天的 onboarding 設計要抓哪三個節點
- 如何用數據判斷哪一群人「本來就會留下來」,避免把預算花在他們身上
語氣:像兩個有實戰經驗的顧問在聊天,不要念稿感,可以有適度的反駁與疑問。
請避免使用「賦能」「閉環」「抓手」這類空泛詞彙。
把這段提示詞餵進去,產出的品質通常會比預設值好上一個檔次。特別是「避免使用某些詞彙」這條,非常有用,因為 AI 很愛用企業黑話,那會讓整段對話聽起來很假。
2-3 生成、試聽與重新生成
按下生成之後,通常要等幾分鐘。第一版出來先完整聽一遍,邊聽邊記下三個東西:哪些段落很好可以留、哪些段落鬼打牆要砍、哪些地方資訊有誤要修正。
如果有明顯問題,可以直接按重新生成,或者回去調整提示詞。同一個 Notebook 可以反覆生成不同版本,這是免費的,不要客氣。我自己的習慣是至少生成兩版,取兩版裡面最好的段落來拼。
三、音訊轉腳本:把對話變成可編輯的文字
接下來是本文的核心技術段落。你需要把音訊變成文字,而且不只是流水帳的文字,而是帶有時間碼、可對應剪輯的逐字稿。
3-1 方法一:直接從 NotebookLM 取得逐字稿
NotebookLM 的音訊播放介面提供了逐字稿顯示功能,通常可以展開看到整段對話的文字內容,並且可以選取複製。這是最省事的方法,準確度也最高,因為它直接對應 TTS 唸出來的文字,不會有語音辨識錯誤。
實際操作上,建議你把逐字稿貼進 Google Docs 或 Notion,然後做這幾件事:
標記講者:把兩人分別標成「主持 A」與「主持 B」,後續改寫比較好處理。
切分段落:依照話題轉換切成若干段落,每段給一個小標。
標註時間點:如果播放器有顯示時間,順手記下每段開始的時間,剪輯時可以直接對齊。
3-2 方法二:用語音轉文字工具取得帶時間碼的逐字稿
如果你需要更精確的時間碼,或者你手上是已經下載下來的音訊檔(例如你已經重新剪輯過),那就得靠外部工具。常見的選擇有幾類:
付費專業工具:像 Descript、MacWhisper 這類,優點是能直接匯出 SRT 字幕檔,時間碼精準,缺點是要錢。
開源方案:Whisper 系列模型,準確度對中文已經相當可用,缺點是需要一點技術門檻或找到現成的線上服務。
剪輯軟體內建:CapCut、DaVinci Resolve 都有自動字幕功能,好處是直接在剪輯流程裡完成,壞處是中文辨識的斷句偶爾會怪。
不管你用哪一種,記得一個原則:自動字幕永遠要人工校對一遍。尤其人名、專有名詞、數字,AI 幾乎必錯。曾經有一次我把「留存率 32%」聽成「留存率三十二 percent」然後又被辨識成「三十二啪」,字幕上就變成了一串笑話。
3-3 逐字稿改寫成腳本的編修原則
拿到逐字稿之後,千萬不要直接拿去做字幕。口語和書面語的資訊密度差很多,直接照搬會讓觀眾看得很累。編修時請抓住這幾個原則:
第一,砍掉所有寒暄與贅詞。「對對對」「沒錯沒錯」「那我們就來看下一個部分」這類句子,在音訊裡是節奏潤滑劑,在字幕裡就是雜訊。整段刪掉不會影響理解。
第二,把長句拆短。口語一句話可以講四十個字不斷句,字幕一行超過十五個字就很難讀。改寫時把長句切成兩到三個短句,每句一個字幕卡。
第三,補上主詞與邏輯連接詞。對話裡常常省略主詞(「所以就會變成那樣」),觀眾如果只看字幕會不知道「那樣」是什麼。改寫時把主詞補回來。
第四,把數字與專有名詞視覺化。凡是提到數字、比例、名詞,都應該在畫面上用字卡呈現,而不是只靠聽。這是影音版本相對純音訊最大的優勢。
3-4 腳本編修前後對照範例
來看一下實際的差異。原始逐字稿可能是這樣:
主持A:對,所以我覺得就是說,如果我們今天講的那個留存這件事情,其實它不是單獨存在的,就是它會跟你的獲客成本,然後跟你後面的那個 LTV 就是那個終身價值,其實是綁在一起的,所以你如果只是盯著留存率那個數字看,可能就會有點,嗯,有點見樹不見林這樣。
改寫成腳本之後:
【主持人 A · 畫面:講者字卡】
留存率不能單獨看。
【字幕卡:留存率 × 獲客成本 × LTV】
它跟兩個數字綁在一起:
一個是你的獲客成本,一個是顧客終身價值。
【主持人 A】
只盯著留存率,
很容易見樹不見林。
同樣一段意思,改寫後長度差不多,但可讀性完全不同。這就是腳本存在的意義。
四、從腳本到分鏡:讓畫面真的有東西可以動
腳本有了,接下來要決定畫面。很多人卡在這裡,因為他們覺得「我沒有素材」。其實你不需要拍到實景,用對方法一樣可以做出一支看起來很完整的影片。
4-1 分鏡表的欄位設計
我慣用的分鏡表只有六個欄位,用 Google Sheets 就能開:
時間碼
旁白/對話
字幕
畫面內容
音效
備註
00:00–00:08
開場提問
留存率卡住是因為你搞錯順序
黑底白字標題 + 緩慢放大
低頻鋪底
前 8 秒定生死
00:08–00:35
主持 A 說明痛點
逐句字幕
主持 A 頭像 + 波形動畫
波形可用免費素材
00:35–01:10
主持 B 反駁
逐句字幕
主持 B 頭像 + 關鍵字卡
轉場音
切換視覺重心
這個表格不需要一次填滿。我的做法是先填「時間碼」與「對話」兩欄,這兩欄可以直接從逐字稿剪貼;然後再填「字幕」與「畫面」。填畫面的時候,問自己一個問題:「這句話的重點是什麼名詞?」把那個名詞做成字卡,畫面問題就解決一半了。
4-2 沒有素材怎麼辦:五種低成本視覺方案
以下這五種是我實際用過、成本最低、效果也不差的方案,依製作難度排序:
方案一:動態字卡。黑底或深色底,配上大字標題與逐句字幕。CapCut 內建的文字動畫就夠用了。這種風格的優點是製作極快、閱讀性極高,缺點是比較單調,適合知識型內容。
方案二:波形 + 頭像。用一張 AI 生成的主持人頭像(或用品牌吉祥物),搭配即時跳動的音訊波形動畫。波形素材在網路上有很多免費的,或者用 CapCut 的音訊視覺化功能直接生成。這是最接近「Podcast 視覺化」的做法。
方案三:AI 生成情境圖。把腳本裡每個段落的關鍵概念丟給圖像生成工具,產出對應的插圖。注意要統一風格(例如全部用水彩風、或全部用扁平插畫風),不然整支影片會很像拼貼。
方案四:數據圖表動畫。如果你的內容涉及數字,用簡單的長條圖、折線圖動畫會大幅提升專業感。用 Canva 或 Flourish 做靜態圖,再進剪輯軟體加上出現動畫就好。
方案五:螢幕錄影。如果是教學類內容,直接錄製操作畫面,把 AI 對話當作旁白,這種做法對觀眾來說資訊量最扎實。
實務上我會混用。例如開場用方案一、主體用方案二加方案三交替、數據段落用方案四、結論回到方案一。這樣一支十分鐘的影片大概需要 15 到 20 個視覺元素,製作時間約兩到三小時。
4-3 字幕與字卡的排版細節
字幕這件事,細節決定質感。幾個一定要守的規則:
每行不超過 15 個中文字,一次最多兩行。超過就會擠壓畫面,觀眾讀得很痛苦。
字級至少佔畫面高度的 5%。手機上看的觀眾比你想像的多很多。
字幕背景要加半透明遮罩。不然遇到淺色畫面會完全看不到字。
避免純白字配純黑底。對比太強會刺眼,用 #F5F5F5 配 #1A1A1A 這類柔和一點的組合。
關鍵字用顏色或放大標記。一行字幕裡只標一個重點,標太多等於沒標。
五、實際剪輯流程:以 CapCut 與 Premiere 為例
工具沒有絕對的好壞,看你的產出頻率。如果是一週一支,CapCut 的效率很高;如果要做系列、需要模板化,Premiere 或 DaVinci 的專案管理會更省事。這裡提供兩條流程。
5-1 快速路線:CapCut 三十分鐘出片
這個流程適合「內容為主、視覺為輔」的知識型頻道。步驟如下:
把 NotebookLM 下載的音訊檔丟進時間軸。
用「自動字幕」功能生成字幕,語言選繁體中文。
手動校對字幕錯字,這步最花時間,大概十分鐘。
在音訊軌下方加一條背景音樂軌,音量壓到 -20dB 左右,不要蓋過人聲。
在每個話題轉換處,插入一張關鍵字卡(用內建文字模板)。
加上開場三秒的標題動畫與結尾的訂閱提示。
輸出 1080p,位元率設 10–15 Mbps。
這個流程的成品大概可以做到「有字幕、有字卡、有背景音樂」的水準,對剛起步的頻道已經夠用。
5-2 精緻路線:Premiere 加上分鏡腳本
如果你要做的是一支有完整視覺設計的影片,那就要照分鏡表來。流程是:
依照分鏡表的時間碼,先把所有視覺素材排上時間軸(此時還沒有聲音)。
匯入音訊,對齊每個段落的起點。
用 Essential Graphics 面板做字幕模板,設定好樣式後批次套用。
逐段微調:哪邊該加轉場、哪邊該放慢、哪邊該加速。
上音效:轉場音、字卡出現音、重點提示音。
做混音,確認人聲始終在 -6dB 到 -3dB 之間。
輸出。建議同時輸出一份 SRT 字幕檔,上傳 YouTube 時會用到。
這條路線一支十分鐘的片子大概要四到六小時,但成品的質感差異很明顯。建議的做法是:前五支用快速路線練手感,等到流程熟了再轉精緻路線。
六、進階:用 AI 工具加速後製環節
既然源頭已經是 AI 生成的內容,後製環節其實也可以讓 AI 帮忙。以下是幾個實測有效率的用法。
6-1 用語言模型把逐字稿轉成分鏡表
你不需要手動填分鏡表。把逐字稿貼給語言模型,附上這樣的指令:
以下是一段 Podcast 逐字稿。請幫我轉成影片分鏡表,欄位包含:
時間碼(以每 8 秒為單位估算)、旁白摘要、字幕文字、畫面建議、音效建議。
畫面建議請具體描述,例如「深色底 + 白色大字標題:留存率不是單一數字」,
不要只寫「字卡」。
逐字稿如下:(貼上)
產出的表格可以直接匯入 Google Sheets,你再手動調整時間碼即可。實測可以省下大概一半的規劃時間。
6-2 批次生成視覺素材
把分鏡表裡的「畫面建議」欄位整理成一份清單,逐條丟給圖像生成工具。重點是固定提示詞的前綴,例如統一加上「扁平插畫風格、深藍與橘色配色、無文字」,這樣產出的圖才會有系列感。
6-3 自動產生章節時間戳
YouTube 的章節功能對觀看時長有正面幫助。你可以把分鏡表裡每個話題的起始時間整理成這樣的形式,直接貼進影片說明欄:
00:00 開場:為什麼留存率不能單獨看
01:12 折扣促銷其實在趕走你的好客戶
03:45 onboarding 的三個關鍵節點
06:20 用數據找出「本來就會留下」的人
08:50 本集重點整理
只要第一行是 00:00、至少三個章節、每個章節間隔超過 10 秒,YouTube 就會自動啟用章節功能。
七、上架與 SEO:讓影片被找到
影片做好只是完成一半,能不能被看見才是關鍵。NotebookLM 轉出來的內容通常有很強的長尾潛力,因為它處理的是具體主題,而不是泛泛而談。把這些長尾關鍵字餵進標題與描述,效果會比你想的好。
7-1 標題與縮圖的搭配邏輯
標題要包含「具體名詞 + 具體數字或結果」。例如「NotebookLM 音訊轉影片教學」不如「我用 NotebookLM 把 20 頁報告變成 10 分鐘影片,完整流程公開」。後者包含工具名、輸入、輸出、以及「完整流程」這個承諾。
縮圖不要放滿版文字。有效的縮圖通常是「一個具體畫面 + 三到五個字的關鍵詞」。如果是知識型內容,可以放一個表情明確的人物頭像,加上一行大字。字級要大到你用手機縮到最小還看得清楚。
7-2 說明欄與標籤的撰寫
說明欄的前兩行會被摺疊,所以最重要的資訊要放最前面。建議結構是:一句話說明這支影片在講什麼、然後放章節時間戳、再放相關連結、最後放一段 200 字左右的內容摘要(這段摘要同時也是給搜尋引擎看的)。
標籤的效益已經不如從前,但還是加個五到八個,包含核心主題詞、工具名、以及受眾可能會搜尋的長尾詞。
7-3 把逐字稿變成部落格文章
最後一招,也是我最推薦的一招:把整理好的腳本再改寫成一篇部落格文章,放在你的網站上,然後在影片說明欄放連結。這樣同一份內容就在 YouTube 和搜尋引擎兩個渠道同時曝光,而且部落格文章可以埋 email 訂閱表單,把流量變成你自己的名單。
改寫的時候注意一件事:不要直接把逐字稿貼上去。書面和口語的閱讀習慣不同,你需要重新組織段落、加上小標、補上影片裡來不及講的細節。這一步大概要花一到兩小時,但帶來的長期流量通常比影片本身更穩定。
八、常見問題與踩坑提醒
8-1 NotebookLM 生成的音訊可以商用嗎?
這要分兩層看。第一層是你上傳的資料來源本身有沒有版權問題,如果你上傳的是別人的付費報告,那你拿它生成的內容就有風險。第二層是 Google 對 NotebookLM 輸出的使用條款,建議直接去看最新的服務條款,這類規定會變動。實務上的安全做法是:只上傳你有權使用的資料,並且在內容裡加入你自己的觀點與經驗,讓成品具備足夠的原创性。
8-2 音訊聽起來很假怎麼辦?
三個調整方向。第一,在自訂提示詞裡明確要求「像真人聊天,可以有打斷、有語氣詞、有不同意見」。第二,控制長度在 10 到 12 分鐘,太長會稀釋密度。第三,重新生成,不同版本的自然度差異其實不小,多試幾次會找到比較好的那一版。
8-3 中文發音怪怪的怎麼辦?
如果你的來源是中英夾雜,AI 唸英文專有名詞時偶爾會怪。解法是在提示詞裡要求「英文專有名詞請用中文說明後再附上原文」,或者把來源裡的英文名詞統一改成中文譯名。另外提醒,生成語言有時會被來源語言帶偏,記得在自訂提示詞第一句就寫明「請用繁體中文」。
8-4 一支影片大概要花多少時間?
以我自己的流程估算:資料整理 30 分鐘、生成音訊與試聽 20 分鐘、逐字稿整理與改寫 60 分鐘、分鏡規劃 40 分鐘、剪輯與上字 90 分鐘、上架與 SEO 30 分鐘。全部加起來大約 4.5 小時。熟練之後可以壓到 3 小時左右。這是一支十分鐘影片的成本,做好模板之後會再快一些。
結語:把 AI 輸出當原料,不當成品
NotebookLM 的音訊功能,最大的價值不是「幫你做出一集 Podcast」,而是「幫你把一份資料快速轉成有對話感的初稿」。這個初稿省下的是你從零開始構思的時間,但它終究只是初稿。真正讓內容有價值的,是你加進去的判斷、你補上的案例、你重新組織的敘事節奏。
所以整個流程的核心心法只有一句話:把 AI 輸出當原料,不當成品。你餵進去的資料越扎實、你給的提示詞越具體、你在改寫階段投入的心思越多,最後成品的落差就越明顯。同樣一個工具,有人做出聽起來像機器人念稿的內容,有人做出觀眾會留言討論的影片,差別就在這幾個環節。
如果你照著這篇的流程跑過一遍,歡迎回來分享你的成品。第一次一定不會完美,但只要你把流程走完一次,第二次就會快很多,第三次就能開始優化細節了。開始動手吧。