無人值守 AI 影片生成流程與腳本自動化技巧
語氣:{tone}
規則:
- 開頭 15 字內必須有鉤子,不可用「大家好」開場。
- 正文至少包含一個具體數字或案例。
- 全文 260~320 字,唸出來約 60 秒。
- 禁止使用「非常」「十分」「相當」等空洞副詞。
- 結尾給一個明確行動呼籲。
輸出格式(純 JSON,不要任何說明文字):
"hook": "開頭一句",
風格:寫實攝影、3D 渲染、扁平插畫、動漫
例如不要寫「一個人在用電腦」,而要寫「中景,一名戴眼鏡的年輕人坐在木桌前使用筆電,清晨側光從左側窗戶透入,寫實攝影風格,色調偏暖」。這樣的描述拿去餵文生圖模型,出圖穩定度高很多。你可以在提示詞最後加一句:「每個 scene 的 visual 必須包含景別、主體、動作、光線、風格五要素。」
另外建議控制場景數量:60 秒影片約 8~12 個場景,平均每 5~7 秒換一次畫面,節奏最舒服。太少會顯得呆板,太多會讓觀眾眼睛疲勞。
四、AI 影片生成環節的自動化實作
腳本層完成後,接下來就是把文字變成聲音與畫面。這一段技術含量最高,但也是最容易套用現成工具的部分。
4-1 文字轉語音與對嘴
TTS 的選擇要考慮三件事:語音自然度、是否支援繁體中文與台灣腔、是否回傳時間軸。實務上,我會把旁白拆成「單句」逐句生成,而不是整段一次生成,原因有二:一是方便後續按句對齊字幕,二是某一句念壞了只要重跑那一句,不必整段重來。
生成時建議把每句音檔存成 voice_001.mp3、voice_002.mp3,並在資料庫記錄每句的起訖秒數。之後用 FFmpeg 把它們串成單一音軌,同時保留時間軸對照表,字幕就能自動生成,不需要靠語音辨識再跑一次。
如果你要做「人物對嘴」類型,流程會多一層:先用文生圖生成人物形象,再用對嘴模型(如 SadTalker、Wav2Lip 類工具)把音檔與人像結合。這一層算力需求較高,建議放到有 GPU 的環境執行,或使用雲端 API。
4-2 文生圖/圖生影與素材拼裝
畫面素材有三條路可走:
無論走哪條路,都建議把素材統一轉成相同解析度與幀率(例如 1080×1920、30fps),避免後製時畫面比例跳動。批次轉檔可以用 FFmpeg 一行指令搞定。
4-3 字幕、配樂與轉場自動化
字幕是短影音的命脈。由於我們在 TTS 階段已經有時間軸,字幕可以直接用 ASS 或 SRT 格式生成,無需再跑語音辨識。字幕樣式建議:
字級大、粗體、白字黑邊(提高可讀性)
每行不超過 12 字,一次顯示一至兩行
關鍵字用不同顏色強調(可在腳本階段用標記語法標出)
配樂方面,建議建立一個「無版權音樂庫」資料夾,按情緒分類(振奮、溫馨、懸疑、輕鬆),排程時隨機挑一首,音量壓在旁白的 15%~20%。轉場不要花俏,短影音最安全的做法是「硬切」搭配偶爾的淡入淡出,AI 生成的花式轉場反而容易顯得廉價。
最後用 FFmpeg 組裝,核心指令概念如下(簡化示意):
ffmpeg -f concat -i scenes.txt \
i voice.mp3 -i bgm.mp3 \
filter_complex "[0:v]scale=1080:1920,setsar=1[v];\
[1:a]volume=1.0[a1];[2:a]volume=0.18[a2];\
[a1][a2]amix=inputs=2:duration=first[a]" \
map "[v]" -map "[a]" -vf "subtitles=sub.ass" \
c:v libx264 -preset medium -crf 20 -c:a aac -b:a 192k \
output.mp4
把這段包成 Python 函式,每次只要傳入素材清單與音檔路徑,就能產出成品。
五、串接與排程:把整條產線黏起來
各層都能獨立運作之後,接著要解決「怎麼讓它們自動接力」的問題。這一段談工具鏈組合與錯誤處理。
5-1 常見工具鏈組合
依你的技術背景,我會推薦三種組合:
對個人創作者而言,「半自動」通常是最佳解。你只需要會基本的 Python、看得懂 API 文件,就能在一個週末把整條產線架起來。
5-2 錯誤處理與重試機制
無人值守最大的敵人是「半夜三點 API 回 429」。因此每一個 API 呼叫都應該包在重試邏輯裡,建議採用指數退避(exponential backoff):第一次失敗等 5 秒,第二次等 15 秒,第三次等 45 秒,最多重試三次。若仍失敗,就記錄下來並跳過該支影片,繼續處理下一支,不要讓整批卡住。
另外兩個實用技巧:
這兩點看起來很工程,但實際上只要一張 Google Sheet 加幾個欄位就能做到,效益卻非常大。
六、品質把關與風險管理
自動化跑順之後,真正的挑戰才開始:如何確保產出穩定、不踩法規紅線。
6-1 AI 內容的合規與版權
三件事必須注意。第一,素材授權:素材庫的免費素材通常可商用,但仍要看個別授權條款;AI 生成圖像則要注意你所使用的模型之商用條款。第二,平台揭露規範:部分平台要求標註 AI 生成內容,建議在描述欄固定加一行說明。第三,內容真實性:不要讓 AI 生成不存在的數據或引用,腳本階段就應要求「所有數字必須來自提供的資料」,避免生成幻覺造成名譽風險。
6-2 人工複審的「最小介入」設計
我建議的複審流程是這樣的:每天早上花 15 分鐘,打開當日生成的 5 支影片,每支只看前 10 秒與最後 10 秒,中間隨機跳看 10 秒。檢查三件事:開頭鉤子夠不夠力、畫面有沒有明顯崩壞、字幕有沒有錯字。發現問題就記錄下來,累積一週後回頭修正提示詞模板或參數。這種「抽樣 + 回溯修正」的模式,能把人力控制在最小,同時讓品質逐週提升。
七、實戰案例:一天產出 20 支短影音的排程範例
以下是一個實際可用的排程範例,假設你要經營一個 AI 工具教學頻道,每天要發 3 支短影音,一週 21 支。
每日 02:30:逐句生成 TTS 音檔,同時建立時間軸對照表。
每日 03:40:生成 ASS 字幕檔,挑選配樂。
每日 08:00:發送複審通知,人工抽樣檢查。
整套流程的雲端 API 成本,依使用量估算,一支 60 秒影片大約落在新台幣 3~15 元之間(取決於是否使用付費文生圖與對嘴),遠低於外包剪輯的行情。而人工投入時間,從原本每支三小時降到每天 15 分鐘複審,等於用 1% 的人力維持同樣的產出規模。
八、常見問題 FAQ
Q1:完全不會寫程式,也能做到無人值守嗎?
可以,但建議從「半自動」開始。先用 Make 或 Zapier 串接三個步驟(選題 → 腳本 → TTS),熟悉資料流的概念之後,再逐步加上剪輯環節。
Q2:AI 生成的影片會不會被平台降權?
平台在意的是「觀眾是否喜歡」,而不是「是否為 AI 生成」。只要內容有資訊價值、觀看完成率高,就不會因為用了 AI 而被懲罰。真正會被降權的是搬運、重複、無意義的內容。
Q3:如何避免每支影片看起來都一樣?
在提示詞中加入「變化參數」:每次隨機指定不同的開頭句型、不同的敘事視角(第一人稱 / 客觀教學 / 反問)、不同的視覺風格。光這三個維度就能組合出數十種變化。
Q4:素材生成失敗怎麼辦?
建立「備援素材庫」:預先準備 50 張通用背景圖與 20 段通用 B-roll,當生成失敗時自動改用備援素材,確保影片一定能輸出。
Q5:需要多強的電腦?
如果全部走雲端 API,一台普通筆電就能跑;只有在本地執行開源圖像或對嘴模型時,才需要獨立顯卡。多數個人創作者用雲端 API 的總成本,仍低於購買高階顯卡。
九、結語:自動化的終點是「把時間還給創意」
無人值守的 AI 影片產線,本質上是一場「把重複勞動規則化」的工程。你花在架設流程上的那幾個週末,會在未來半年、一年裡,用數百支影片的產出回報你。但請記住,自動化不是為了讓你躺著不動,而是把你從剪片、對字幕、找素材這些機械性工作中解放出來,讓你能把精力放在真正無法被取代的事情上:選對題目、說對故事、理解你的觀眾。
工具會一直變,模型會一直換,但「五層式流水線」與「結構化腳本」這兩個核心觀念不會過時。先從最小可行的三步驟開始跑起來,讓它每晚替你工作,你會發現創作這條路,忽然變得寬闊很多。
如果你也在打造自己的自動化產線,歡迎把這篇文章收藏起來,照著章節一步步実作。下一篇文章我會談「如何用數據回饋自動優化選題」,讓你的產線不只好用,還會自己進化。