自動化影音腳本大綱生成:分鏡腳本 (Storyboard) Prompt 設計

musical%20instruments%2C%20vinyl%20record%2C%20war...
發表時間:2026 年 09 月 23 日 | 更新日期:2026 年 09 月 23 日 | 編輯:雅寶社區編輯團隊
自動化影音腳本大綱生成:分鏡腳本 (Storyboard) Prompt 設計|好的範例: - 雅寶社區 · 頂客論壇

| S02 | 00:08-00:14 | Verse 1 | 我獨自走過街口 | MS | 手持跟拍背影 | 主角穿越無人騎樓,路燈忽明忽暗 | 壓抑 4/10 | 硬切 |

壞的範例(禁止這樣寫):

| S02 | 00:08-00:14 | Verse 1 | 我獨自走過街口 | 中景 | 鏡頭移動 | 主角孤獨地走著,畫面很美 | 悲傷 | 自然轉場 |

下面提供四個模板,分別對應不同場景。你可以直接複製,把中括號的部分替換成自己的資料。

4-1 模板 A:單曲 MV 分鏡(3 分鐘流行歌)

【角色】

你是一位擁有 15 年經驗的 MV 導演與分鏡師,擅長華語流行音樂。

你熟悉鏡頭語言(景別、運鏡、焦段、光線、色彩),

擅長將音樂段落結構轉譯為視覺敘事。

【任務】

根據以下歌曲資訊,產出一份完整 MV 分鏡腳本。

總長 [3:28],需產出 [35 至 50] 顆鏡頭。

【歌曲資訊】

曲名:[深夜便利商店]

曲風:[City Pop / Lo-fi]

BPM:[86]

段落結構:

[貼上段落與時間碼]

歌詞:

[貼上逐段歌詞]

【視覺方向】

風格參考:[王家衛《重慶森林》的霓虹與手持感]

色彩計畫:[主歌青藍冷調、副歌橘黃暖調]

整體氛圍:[都市孤獨、懷舊、夜晚]

【輸出格式】

以 Markdown 表格輸出,欄位依序為:

鏡號 | 時間碼 | 段落 | 歌詞 | 景別 | 運鏡 | 畫面描述 | 情緒強度 | 轉場

【硬性規則】

  1. 景別只能使用:ELS / LS / MS / MCU / CU / ECU
  2. 運鏡只能描述:固定、推、拉、搖、移、跟、升降、手持、穩定器
  3. 情緒強度為 1-10 的整數
  4. 轉場只能是:硬切、疊化、匹配剪輯、淡入、淡出、黑場
  5. 每顆鏡頭的畫面描述必須包含「主體 + 動作 + 環境細節」
  6. 副歌段落的平均情緒強度必須高於主歌至少 2 分
  7. 禁止使用「唯美」「震撼」等無法執行的形容詞
  8. 同一景別不得連續出現超過三顆

【輸出範例】

[貼上 1-2 顆示範鏡頭]

現在開始輸出整份分鏡表。

4-2 模板 B:純音樂/Lo-fi 長影片

純音樂影片的分鏡邏輯跟 MV 完全不同。它沒有歌詞可以對位,重點變成「氛圍變化」與「視覺節奏」。而且這類影片通常很長(30 分鐘到 2 小時),分鏡顆粒度要更粗。

【角色】

你是專門製作 Lo-fi / Chillhop 長時影片的視覺總監,

擅長用循環動畫 (loop animation) 與細微動態營造沉浸感。

【任務】

為一支 [60 分鐘] 的純音樂合輯,產出分鏡大綱。

不需要逐秒對應,以「場景區塊」為單位,每 [4 至 6 分鐘] 一個區塊。

【音樂資訊】

合輯主題:[深夜讀書電台]

曲目數量:[15 首]

整體氛圍:[安靜、專注、微憂鬱但不悲傷]

【輸出格式】

Markdown 表格:

區塊 | 時間範圍 | 對應曲目 | 主場景 | 動態元素 | 色彩 | 切換方式

【硬性規則】

  1. 每個區塊的主場景必須不同,但風格需一致
  2. 動態元素需具體(例如:窗外的雨、唱片機緩慢旋轉、蠟燭火光閃爍)
  3. 色彩需維持在同一色系內變化
  4. 禁止出現人物特寫(純音樂影片應避免觀眾分心)
  5. 切換方式只能是:疊化、漸暗漸亮、移動遮罩

開始輸出。

4-3 模板 C:短影音(Reels / Shorts / TikTok)15–60 秒

短影音的分鏡邏輯又是另一回事。它的核心是「前 3 秒必須抓住注意力」,所以鏡頭密度極高,而且要有明確的「鉤子」。這個模板我會特別強調開頭設計。

【角色】

你是專攻短影音演算法的內容導演,

熟悉 TikTok / Reels / Shorts 的留存率機制,

知道前 3 秒決定 80% 的完播率。

【任務】

為以下歌曲片段,產出一支 [30 秒] 短影音分鏡。

總共 [8 至 12] 顆鏡頭。

【素材】

歌曲段落:[副歌 1:04-1:36 的其中 30 秒]

歌詞:[貼上]

視覺風格:[手持、自然光、生活感]

【輸出格式】

Markdown 表格:

鏡號 | 秒數 | 畫面 | 字幕 | 音效 | 剪點節奏

【硬性規則】

  1. 第 1 顆鏡頭必須是「動態 + 高對比」,禁止靜態開場
  2. 前 3 秒至少要有 2 次剪點
  3. 每顆鏡頭不得超過 3 秒
  4. 字幕每行不得超過 12 字
  5. 剪點必須對齊歌曲重拍
  6. 最後一顆鏡頭需留 0.5 秒黑畫面,方便平台循環播放
  7. 禁止使用 Logo 開場

開始輸出。

4-4 模板 D:AI 繪圖/影片生成用的逐鏡 Prompt 擴寫

這個模板是「第二階段」用的。當你有了分鏡大綱之後,可以再跑一次 Prompt,把每一顆鏡頭的「畫面描述」擴寫成可以直接餵給 Midjourney、Stable Diffusion、Runway、Kling 的英文 Prompt。

【角色】

你是 AI 影像生成的 Prompt 工程師,

熟悉 Midjourney、Runway Gen-3、Kling 的提示詞規則。

【任務】

將以下分鏡表,逐顆擴寫為英文生成 Prompt。

每一顆需輸出:

  1. 靜態圖像 Prompt(給 Midjourney)
  2. 動態影片 Prompt(給 Runway / Kling)

【分鏡表】

[貼上你的分鏡表格]

【輸出格式】

S01

  • 靜態:[英文 Prompt]
  • 動態:[英文 Prompt]

【Prompt 組成規則】

每個 Prompt 必須包含:

主體 + 動作 + 環境 + 光線 + 鏡頭 + 焦段 + 底片質感 + 色調

【硬性規則】

  1. 每個 Prompt 不超過 60 個英文單詞
  2. 必須使用具體的鏡頭術語(如 35mm, shallow depth of field, dolly in)
  3. 禁止使用 "beautiful", "amazing" 等主觀形容詞
  4. 風格關鍵字需全片統一(如 cinematic, 35mm film grain, neon noir)
  5. 人物特徵需保持一致,請在每個 Prompt 中重複描述

開始逐顆輸出。

五、從大綱到可執行:多階段生成工作流

看完上面的模板,你可能會想:「為什麼要拆這麼多階段?我一次叫 AI 做完不行嗎?」

答案是:可以,但品質會差很多。原因很簡單,語言模型的注意力有限。你一次要它同時處理音樂結構分析、鏡頭設計、英文 Prompt 擴寫,它會每樣都做一點,每樣都不精。

下面是我實際在用的四階段工作流。

5-1 第一階段:歌曲結構分析

這階段不需要創意,只需要邏輯。把歌詞與音檔丟給 AI,請它輸出結構化的段落分析。

請分析以下歌詞,判斷其歌曲結構(Intro / Verse / Pre-Chorus / Chorus / Bridge / Outro),

並標註每個段落的:

  • 情緒基調(3 個形容詞)
  • 情緒強度(1-10)
  • 建議的視覺關鍵字(3 個)

以 JSON 陣列輸出。

這一步的產出,會成為第二階段的輸入。你會發現,光是這一步,就能讓後面所有階段穩定很多。

5-2 第二階段:分鏡大綱生成

用模板 A 或 B,產出完整的分鏡表格。這個階段最容易出問題,建議跑兩到三次,比較不同版本,然後手動合併最好的部分。

我自己的習慣是:第一次跑,看整體結構對不對;第二次跑,調整情緒曲線;第三次跑,只針對不滿意的段落重新生成。

5-3 第三階段:逐鏡細化與圖像 Prompt

用模板 D,把每一顆鏡頭擴寫成生成工具可用的 Prompt。這階段建議分批做,一次 10 顆,避免 AI 品質衰減。

如果你用的是 Claude 或 GPT-4 等級的模型,可以要求它「每輸出 10 顆就暫停,等我說繼續」。這樣可以有效控制輸出品質。

5-4 第四階段:人工校稿與一致性檢查

這一步絕對不能省。AI 生成的分鏡,一定有幾個常見問題:

角色外型在不同鏡頭之間不一致(例如一下穿黑衣一下穿白衣)

場景跳躍不合理(上一顆在室內,下一顆突然在海邊)

情緒強度曲線有斷層(例如副歌突然從 8 掉到 3)

景別重複(連續五顆都是特寫)

時間碼加總不等於總長

建議做一張檢查清單,逐項打勾。這大概會花你 10 到 15 分鐘,但能省下後續拍攝或生成的大量時間。

六、常見錯誤與優化技巧

6-1 常見錯誤清單

這是我看過最多人踩的坑,列出來給大家避雷:

  • 沒給時間碼,只給歌詞。AI 會用自己想像的節奏分配鏡頭,結果整首對不上。
  • 沒限制景別與運鏡的選項。AI 會發明一堆不存在的術語,例如「環繞式推進凝視」。
  • 一次要它生成太多鏡頭。超過 60 顆,後半段品質會明顯下滑。

  • 沒有給視覺參考。AI 會預設「電影感」,結果整份分鏡都是好萊塢套路,跟你的獨立音樂氣質不合。
  • 沒有要求輸出格式。AI 會用段落式散文回應,你還得自己整理成表格。

    沒有檢查一致性。最常見的是主角造型前後不一,或色調突然斷裂。

  • Prompt 寫得太長太雜。超過 1500 字的 Prompt 反而會讓模型抓不到重點。
  • 沒有迭代。跑一次就定稿,等於放棄了 80% 的優化空間。

    6-2 提升穩定性的技巧

    最後分享幾個讓輸出更穩定的實戰技巧:

    技巧一:使用術語表。在 Prompt 開頭定義清楚你的專業詞彙。例如明確寫出「景別一律使用 ELS/LS/MS/MCU/CU/ECU 六級制,不得使用其他描述」。這樣可以大幅降低 AI 自由發揮的空間。

    技巧二:分段生成。不要把整首歌一次丟進去。先做 Intro 到 Verse 1,確認風格對了,再繼續往下。這樣可以在早期就修正方向,避免整份重做。

    技巧三:控制生成溫度。如果你用的是 API,把 temperature 設在 0.6 到 0.8 之間。太低會很死板,太高會很發散。分鏡這種需要創意但又要結構的任務,中間值最適合。

    技巧四:用負面清單。前面提過,明確列出「禁止事項」比只列「要求事項」更有效。因為模型的預設傾向很難靠正面指令完全覆蓋。

    技巧五:要求 AI 自我檢查。在 Prompt 最後加一句「輸出後,請自行檢查時間碼是否連續、景別是否重複、情緒曲線是否合理,若有問題請修正後再輸出」。這招意外地有效。

    技巧六:保留人類的品味。AI 生成的分鏡,結構和技術層面通常沒問題,但「這顆鏡頭到底好不好看」這件事,還是得靠你。我的習慣是,AI 產出後,挑出我最有感覺的 10 顆,然後親手改寫另外 5 顆,讓整份分鏡有人的味道。完全 AI 生成的分鏡,看久了會有一種「標準化」的無聊感。

    七、結語:分鏡不是終點,是溝通的起點

    寫到這裡,我想回到一個更根本的問題:為什麼我們要做自動化分鏡?

    不是為了取代導演,也不是為了讓創作變得更機械。恰恰相反,是為了把音樂人從「不知道怎麼把腦中的畫面說出來」這個困境中解放出來。

    分鏡腳本本質上是一種溝通工具。它溝通的是你的音樂想傳達什麼樣的視覺想像,以及你要如何把它交給攝影師、剪輯師、AI 工具。當這份工具做得夠好,你的音樂就更容易被「看見」。

    自動化 Prompt 的價值,在於它降低了這份工具的製作門檻。以前你需要懂影視語言、需要花好幾天,現在你只需要會寫 Prompt、花幾個小時。這中間省下的時間,你可以拿去寫下一首歌,或者好好睡一覺。

    最後,我想說的是:工具會一直變,但對音樂的想像不會。Prompt 再厲害,也只是把你腦袋裡的畫面翻譯出來的輔助。真正決定作品好壞的,永遠是你對那首歌的理解,以及你想讓聽眾感受到什麼。

    希望這篇指南對頂客論壇的朋友們有幫助。如果你試了這些模板,歡迎在下方回覆分享你的成果,或者把 Prompt 改得更進化,再貼回來讓大家一起學習。音樂創作這條路,一個人走很孤單,一群人走會有趣得多。

    我們下篇文章見。

    ```

    🏠 返回首頁