自動化影音腳本大綱生成:分鏡腳本 (Storyboard) Prompt 設計
| S02 | 00:08-00:14 | Verse 1 | 我獨自走過街口 | MS | 手持跟拍背影 | 主角穿越無人騎樓,路燈忽明忽暗 | 壓抑 4/10 | 硬切 |
壞的範例(禁止這樣寫):
| S02 | 00:08-00:14 | Verse 1 | 我獨自走過街口 | 中景 | 鏡頭移動 | 主角孤獨地走著,畫面很美 | 悲傷 | 自然轉場 |
下面提供四個模板,分別對應不同場景。你可以直接複製,把中括號的部分替換成自己的資料。
4-1 模板 A:單曲 MV 分鏡(3 分鐘流行歌)
【角色】
你是一位擁有 15 年經驗的 MV 導演與分鏡師,擅長華語流行音樂。
你熟悉鏡頭語言(景別、運鏡、焦段、光線、色彩),
擅長將音樂段落結構轉譯為視覺敘事。
【任務】
根據以下歌曲資訊,產出一份完整 MV 分鏡腳本。
總長 [3:28],需產出 [35 至 50] 顆鏡頭。
【歌曲資訊】
曲名:[深夜便利商店]
曲風:[City Pop / Lo-fi]
BPM:[86]
段落結構:
[貼上段落與時間碼]
歌詞:
[貼上逐段歌詞]
【視覺方向】
風格參考:[王家衛《重慶森林》的霓虹與手持感]
色彩計畫:[主歌青藍冷調、副歌橘黃暖調]
整體氛圍:[都市孤獨、懷舊、夜晚]
【輸出格式】
以 Markdown 表格輸出,欄位依序為:
鏡號 | 時間碼 | 段落 | 歌詞 | 景別 | 運鏡 | 畫面描述 | 情緒強度 | 轉場
【硬性規則】
- 景別只能使用:ELS / LS / MS / MCU / CU / ECU
- 運鏡只能描述:固定、推、拉、搖、移、跟、升降、手持、穩定器
- 情緒強度為 1-10 的整數
- 轉場只能是:硬切、疊化、匹配剪輯、淡入、淡出、黑場
- 每顆鏡頭的畫面描述必須包含「主體 + 動作 + 環境細節」
- 副歌段落的平均情緒強度必須高於主歌至少 2 分
- 禁止使用「唯美」「震撼」等無法執行的形容詞
- 同一景別不得連續出現超過三顆
【輸出範例】
[貼上 1-2 顆示範鏡頭]
現在開始輸出整份分鏡表。
4-2 模板 B:純音樂/Lo-fi 長影片
純音樂影片的分鏡邏輯跟 MV 完全不同。它沒有歌詞可以對位,重點變成「氛圍變化」與「視覺節奏」。而且這類影片通常很長(30 分鐘到 2 小時),分鏡顆粒度要更粗。
【角色】
你是專門製作 Lo-fi / Chillhop 長時影片的視覺總監,
擅長用循環動畫 (loop animation) 與細微動態營造沉浸感。
【任務】
為一支 [60 分鐘] 的純音樂合輯,產出分鏡大綱。
不需要逐秒對應,以「場景區塊」為單位,每 [4 至 6 分鐘] 一個區塊。
【音樂資訊】
合輯主題:[深夜讀書電台]
曲目數量:[15 首]
整體氛圍:[安靜、專注、微憂鬱但不悲傷]
【輸出格式】
Markdown 表格:
區塊 | 時間範圍 | 對應曲目 | 主場景 | 動態元素 | 色彩 | 切換方式
【硬性規則】
- 每個區塊的主場景必須不同,但風格需一致
- 動態元素需具體(例如:窗外的雨、唱片機緩慢旋轉、蠟燭火光閃爍)
- 色彩需維持在同一色系內變化
- 禁止出現人物特寫(純音樂影片應避免觀眾分心)
- 切換方式只能是:疊化、漸暗漸亮、移動遮罩
開始輸出。
4-3 模板 C:短影音(Reels / Shorts / TikTok)15–60 秒
短影音的分鏡邏輯又是另一回事。它的核心是「前 3 秒必須抓住注意力」,所以鏡頭密度極高,而且要有明確的「鉤子」。這個模板我會特別強調開頭設計。
【角色】
你是專攻短影音演算法的內容導演,
熟悉 TikTok / Reels / Shorts 的留存率機制,
知道前 3 秒決定 80% 的完播率。
【任務】
為以下歌曲片段,產出一支 [30 秒] 短影音分鏡。
總共 [8 至 12] 顆鏡頭。
【素材】
歌曲段落:[副歌 1:04-1:36 的其中 30 秒]
歌詞:[貼上]
視覺風格:[手持、自然光、生活感]
【輸出格式】
Markdown 表格:
鏡號 | 秒數 | 畫面 | 字幕 | 音效 | 剪點節奏
【硬性規則】
- 第 1 顆鏡頭必須是「動態 + 高對比」,禁止靜態開場
- 前 3 秒至少要有 2 次剪點
- 每顆鏡頭不得超過 3 秒
- 字幕每行不得超過 12 字
- 剪點必須對齊歌曲重拍
- 最後一顆鏡頭需留 0.5 秒黑畫面,方便平台循環播放
- 禁止使用 Logo 開場
開始輸出。
4-4 模板 D:AI 繪圖/影片生成用的逐鏡 Prompt 擴寫
這個模板是「第二階段」用的。當你有了分鏡大綱之後,可以再跑一次 Prompt,把每一顆鏡頭的「畫面描述」擴寫成可以直接餵給 Midjourney、Stable Diffusion、Runway、Kling 的英文 Prompt。
【角色】
你是 AI 影像生成的 Prompt 工程師,
熟悉 Midjourney、Runway Gen-3、Kling 的提示詞規則。
【任務】
將以下分鏡表,逐顆擴寫為英文生成 Prompt。
每一顆需輸出:
- 靜態圖像 Prompt(給 Midjourney)
- 動態影片 Prompt(給 Runway / Kling)
【分鏡表】
[貼上你的分鏡表格]
【輸出格式】
S01
- 靜態:[英文 Prompt]
- 動態:[英文 Prompt]
【Prompt 組成規則】
每個 Prompt 必須包含:
主體 + 動作 + 環境 + 光線 + 鏡頭 + 焦段 + 底片質感 + 色調
【硬性規則】
- 每個 Prompt 不超過 60 個英文單詞
- 必須使用具體的鏡頭術語(如 35mm, shallow depth of field, dolly in)
- 禁止使用 "beautiful", "amazing" 等主觀形容詞
- 風格關鍵字需全片統一(如 cinematic, 35mm film grain, neon noir)
- 人物特徵需保持一致,請在每個 Prompt 中重複描述
開始逐顆輸出。
五、從大綱到可執行:多階段生成工作流
看完上面的模板,你可能會想:「為什麼要拆這麼多階段?我一次叫 AI 做完不行嗎?」
答案是:可以,但品質會差很多。原因很簡單,語言模型的注意力有限。你一次要它同時處理音樂結構分析、鏡頭設計、英文 Prompt 擴寫,它會每樣都做一點,每樣都不精。
下面是我實際在用的四階段工作流。
5-1 第一階段:歌曲結構分析
這階段不需要創意,只需要邏輯。把歌詞與音檔丟給 AI,請它輸出結構化的段落分析。
請分析以下歌詞,判斷其歌曲結構(Intro / Verse / Pre-Chorus / Chorus / Bridge / Outro),
並標註每個段落的:
- 情緒基調(3 個形容詞)
- 情緒強度(1-10)
- 建議的視覺關鍵字(3 個)
以 JSON 陣列輸出。
這一步的產出,會成為第二階段的輸入。你會發現,光是這一步,就能讓後面所有階段穩定很多。
5-2 第二階段:分鏡大綱生成
用模板 A 或 B,產出完整的分鏡表格。這個階段最容易出問題,建議跑兩到三次,比較不同版本,然後手動合併最好的部分。
我自己的習慣是:第一次跑,看整體結構對不對;第二次跑,調整情緒曲線;第三次跑,只針對不滿意的段落重新生成。
5-3 第三階段:逐鏡細化與圖像 Prompt
用模板 D,把每一顆鏡頭擴寫成生成工具可用的 Prompt。這階段建議分批做,一次 10 顆,避免 AI 品質衰減。
如果你用的是 Claude 或 GPT-4 等級的模型,可以要求它「每輸出 10 顆就暫停,等我說繼續」。這樣可以有效控制輸出品質。
5-4 第四階段:人工校稿與一致性檢查
這一步絕對不能省。AI 生成的分鏡,一定有幾個常見問題:
角色外型在不同鏡頭之間不一致(例如一下穿黑衣一下穿白衣)
場景跳躍不合理(上一顆在室內,下一顆突然在海邊)
情緒強度曲線有斷層(例如副歌突然從 8 掉到 3)
景別重複(連續五顆都是特寫)
時間碼加總不等於總長
建議做一張檢查清單,逐項打勾。這大概會花你 10 到 15 分鐘,但能省下後續拍攝或生成的大量時間。
六、常見錯誤與優化技巧
6-1 常見錯誤清單
這是我看過最多人踩的坑,列出來給大家避雷:
沒給時間碼,只給歌詞。AI 會用自己想像的節奏分配鏡頭,結果整首對不上。
沒限制景別與運鏡的選項。AI 會發明一堆不存在的術語,例如「環繞式推進凝視」。
一次要它生成太多鏡頭。超過 60 顆,後半段品質會明顯下滑。
沒有給視覺參考。AI 會預設「電影感」,結果整份分鏡都是好萊塢套路,跟你的獨立音樂氣質不合。
沒有要求輸出格式。AI 會用段落式散文回應,你還得自己整理成表格。
沒有檢查一致性。最常見的是主角造型前後不一,或色調突然斷裂。
Prompt 寫得太長太雜。超過 1500 字的 Prompt 反而會讓模型抓不到重點。
沒有迭代。跑一次就定稿,等於放棄了 80% 的優化空間。
6-2 提升穩定性的技巧
最後分享幾個讓輸出更穩定的實戰技巧:
技巧一:使用術語表。在 Prompt 開頭定義清楚你的專業詞彙。例如明確寫出「景別一律使用 ELS/LS/MS/MCU/CU/ECU 六級制,不得使用其他描述」。這樣可以大幅降低 AI 自由發揮的空間。
技巧二:分段生成。不要把整首歌一次丟進去。先做 Intro 到 Verse 1,確認風格對了,再繼續往下。這樣可以在早期就修正方向,避免整份重做。
技巧三:控制生成溫度。如果你用的是 API,把 temperature 設在 0.6 到 0.8 之間。太低會很死板,太高會很發散。分鏡這種需要創意但又要結構的任務,中間值最適合。
技巧四:用負面清單。前面提過,明確列出「禁止事項」比只列「要求事項」更有效。因為模型的預設傾向很難靠正面指令完全覆蓋。
技巧五:要求 AI 自我檢查。在 Prompt 最後加一句「輸出後,請自行檢查時間碼是否連續、景別是否重複、情緒曲線是否合理,若有問題請修正後再輸出」。這招意外地有效。
技巧六:保留人類的品味。AI 生成的分鏡,結構和技術層面通常沒問題,但「這顆鏡頭到底好不好看」這件事,還是得靠你。我的習慣是,AI 產出後,挑出我最有感覺的 10 顆,然後親手改寫另外 5 顆,讓整份分鏡有人的味道。完全 AI 生成的分鏡,看久了會有一種「標準化」的無聊感。
七、結語:分鏡不是終點,是溝通的起點
寫到這裡,我想回到一個更根本的問題:為什麼我們要做自動化分鏡?
不是為了取代導演,也不是為了讓創作變得更機械。恰恰相反,是為了把音樂人從「不知道怎麼把腦中的畫面說出來」這個困境中解放出來。
分鏡腳本本質上是一種溝通工具。它溝通的是你的音樂想傳達什麼樣的視覺想像,以及你要如何把它交給攝影師、剪輯師、AI 工具。當這份工具做得夠好,你的音樂就更容易被「看見」。
自動化 Prompt 的價值,在於它降低了這份工具的製作門檻。以前你需要懂影視語言、需要花好幾天,現在你只需要會寫 Prompt、花幾個小時。這中間省下的時間,你可以拿去寫下一首歌,或者好好睡一覺。
最後,我想說的是:工具會一直變,但對音樂的想像不會。Prompt 再厲害,也只是把你腦袋裡的畫面翻譯出來的輔助。真正決定作品好壞的,永遠是你對那首歌的理解,以及你想讓聽眾感受到什麼。
希望這篇指南對頂客論壇的朋友們有幫助。如果你試了這些模板,歡迎在下方回覆分享你的成果,或者把 Prompt 改得更進化,再貼回來讓大家一起學習。音樂創作這條路,一個人走很孤單,一群人走會有趣得多。
我們下篇文章見。
```