最近上完關於「AI漫劇製作」的課程之後,我重新整理了一次自己對AI短劇、AI漫劇的理解。
以前看到網路上一支支AI短劇,尤其是人物、場景、運鏡都做得很完整的作品,很容易產生一種感覺:「這應該很難吧?」
因為裡面牽涉到劇本、角色、分鏡、AI繪圖、AI影片、配音、字幕、音效,甚至還有剪輯,看起來就像一個小型影視製作團隊才能完成的事情。

但這堂課讓我比較清楚地理解到,其實把整個流程拆開之後,AI漫劇最核心的製作邏輯,大致可以整理成四個步驟:
- 第一步:劇本+腳本製作—GPT
- 第二步:分鏡畫面生成—GPT+AI繪圖工具
- 第三步:分鏡影片生成—GPT/Gemini+AI影片工具
- 第四步:合成成片—剪映
乍看之下工具很多,但它的本質其實非常簡單:把一個故事,按照正確的順序,一個鏡頭、一個鏡頭交付出來。
也就是說,AI並不是幫我們按下一個按鈕,就自動生出一部完整的電影。
真正需要學習的,反而是「拆解」。

一個故事如何拆成劇情?一段劇情如何拆成場景?一個場景如何拆成鏡頭?一個鏡頭又需要哪些人物、表情、動作、道具與環境?
當這些東西越清楚,後面的AI生成就會越穩定。
這也是我上完這堂課之後,覺得最重要的一個觀念。

第一步:劇本+腳本製作
AI漫劇第一個步驟,不是先去生成漂亮的圖片,也不是急著生成影片,而是先把「故事」做好。
因為如果故事本身不好看,再漂亮的AI畫面,也只是漂亮的圖片拼貼而已。
明確故事核心

開始寫劇本以前,首先要回答一個問題:這到底是一個什麼故事?
需要先建立一個能夠自洽的時空背景,包括故事發生在哪個年代、什麼城市、什麼環境,人物之間又存在什麼關係。
接著才是主線劇情。
例如:一名結婚十年的妻子,突然發現丈夫每天凌晨一點都會收到一通電話。
這時候故事核心就出現了。
觀眾自然會開始思考:電話是誰打來的?丈夫是不是外遇?為什麼一定是凌晨一點?他到底隱瞞了什麼?
有了核心問題之後,再慢慢往外發展角色關係、事件、衝突與反轉。
因此,我現在會認為,寫AI漫劇時最重要的不是一開始就要求GPT:「幫我寫一部短劇。」
而是先告訴GPT故事類型、主要人物、角色關係、核心秘密、主要衝突,以及最後希望觀眾留下什麼情緒。
條件越清楚,GPT產出的劇本就越接近可以實際製作的內容。
開場鉤子設計
短影音時代有一個非常現實的問題:觀眾沒有義務把你的故事看完。
尤其是YouTube Shorts、Instagram Reels、TikTok這類短影音內容,前面幾秒鐘如果沒有事情發生,使用者手指一滑,影片可能就結束了。
因此AI漫劇的前5~10秒非常重要。

最好能夠直接丟出一個「不正常的事情」。
例如:凌晨一點,門外突然出現一雙女人的高跟鞋。
妻子拿起丈夫的手機,螢幕上卻顯示「已死亡三年的妹妹」。
又或者婚禮正在進行時,一個小女孩突然跑進會場,大喊新郎「爸爸」。
這類畫面的共同特徵就是:觀眾一看到,就會想知道接下來發生什麼事。
這就是鉤子。
好的鉤子不一定需要爆炸、打架或非常誇張,而是需要製造「資訊缺口」。
讓觀眾知道有事情發生,卻不知道事情的答案,自然就比較容易產生繼續觀看的動機。
節奏控制

有了故事之後,還不能把所有資訊一次塞給觀眾。
這也是我覺得AI寫劇本很容易發生的問題。
GPT很會寫內容,但如果沒有控制,它很容易把背景、人物、原因、情緒與解釋一次全部寫出來。
結果故事反而沒有懸念。
比較好的方式,是採用一種「快-慢-快」的節奏。
事件發生時快一點,例如爭吵、追逐、發現秘密、推門、電話響起,這些鏡頭可以快速切換。
但到了人物真正產生情緒的地方,就要慢下來。
例如妻子發現真相之後,不一定馬上需要說一大串台詞。
可能只是站在門口,看著桌上的兩杯咖啡,停頓幾秒,然後問一句:「所以這十年,我到底算什麼?」
這種留白,有時候反而比解釋一分鐘更有力量。
所以做AI漫劇,不能只是一直塞資訊,而需要安排情緒的呼吸空間。
如果是比較長的劇情,也可以每隔一段時間安排一個小高潮,例如新線索出現、角色關係改變,或者前面的認知被推翻,避免觀眾產生資訊疲勞。
第二步:分鏡畫面製作:一致性才是真正的難題

劇本完成之後,就進入我認為AI漫劇最關鍵的一個環節:分鏡。
因為文字故事可以寫得天馬行空,但是到了畫面階段,每一個東西都必須被具體化。
一個鏡頭至少要知道:角色是誰?場景在哪裡?有哪些道具?人物正在做什麼?攝影機又從哪裡拍?
例如一句很簡單的劇本:「她回到家,發現丈夫坐在沙發上。」
真正要生成畫面的時候,就需要進一步拆解。
例如:30歲亞洲女性、黑色長髮、穿著米白色大衣,站在現代公寓玄關;35歲男性,穿深灰色襯衫,神情疲憊地坐在客廳沙發;晚上,客廳只有一盞暖黃色落地燈;桌面放著手機、咖啡杯以及一封拆開的信。
到了這個程度,AI才真正知道我們想要的是什麼畫面。
角色設計:先建立人物設定表
角色一致性是AI漫劇非常重要的一件事情。
因為第一幕女主角是長髮,第二幕突然變成短髮;第一幕看起來30歲,下一幕突然變成50歲,觀眾很容易出戲。
所以主要人物最好一開始就先建立完整的「角色設定表」。
我自己把它整理成一個很好理解的萬能公式。
-
-
- 第一,誰:性別、年齡、職業、身份、個性、社會地位。
- 第二,長什麼樣子:髮型、臉型、五官、身材、高矮胖瘦、氣質,以及辨識度最高的特點。
- 第三,穿什麼:運動休閒服、西裝、制服、宮廷服、學生制服、破舊衣物,甚至鞋子、耳環、眼鏡都可以固定。
- 第四,採用什麼畫風:國漫風、韓漫風、日漫風、水墨風、電影寫實風、3D動畫風、二次元風格等等。
-
我覺得這裡有一個非常重要的觀念:不要每一張圖都重新「發明」角色。
第一張圖確定人物之後,後面的所有分鏡就應該盡量沿用相同的人物描述。
這樣才能降低AI每次自由發揮所造成的角色漂移。
場景與道具,也需要保持一致
以前我會把一致性理解成「人物長得一樣」就好了。
但實際製作之後才會發現,場景一致性一樣重要。
例如女主角家的沙發第一幕是白色,下一幕突然變成黑色;房間原本有大片落地窗,下一個鏡頭窗戶突然消失。
這些看起來只是小問題,但連續播放之後就會非常明顯。
因此重要場景也可以事先做好設定。
例如:現代高級公寓、米白色沙發、木質茶几、大片落地窗、暖黃色間接照明。
甚至故事中的關鍵道具也可以先固定。
像是一支紅色手機、一條項鍊、一封牛皮紙信件、一個咖啡杯。
當某個道具牽涉劇情伏筆時,它其實就已經不是普通背景,而是故事的一部分。
第三步:把靜態分鏡變成AI影片

圖片準備完成之後,接下來就是圖生影片或者文生影片。
我自己的理解是:圖片決定「長什麼樣」,影片提示詞則決定「發生什麼事情」。
所以進入AI影片生成階段之後,提示詞的重點也會開始改變。
不需要再寫一大堆人物背景故事,而是要明確描述:誰在動?怎麼動?鏡頭怎麼移動?人物表情如何變化?環境又發生了什麼改變?
影片一定要分段製作
目前實際製作AI影片,我會把故事拆成5秒、10秒、15秒,必要時再使用較長的影片片段,而不是期待AI一次生成一分鐘甚至數分鐘的完整劇情。
因為影片越長,需要維持的人物、動作、物理邏輯與畫面細節越多,AI越容易出現不穩定。
相反地,把它拆成一個個短鏡頭:
-
-
- 女孩推開房門。
- 男人慢慢抬頭。
- 手機突然亮起。
- 女孩低頭看到訊息。
- 男人起身。
- 女孩後退一步。
-
每一段只要求AI完成一件事情,生成成功率反而會提高很多。
所以AI漫劇不是「生成一部影片」。
而是:生成很多個正確的小鏡頭,再把它們組成一部影片。
影片提示詞需要延續統一風格

影片生成時,也需要持續帶入統一的視覺風格。
例如:電影寫實風格、低飽和色調、夜晚室內暖光、淺景深、35mm電影鏡頭。
當每一段影片都沿用類似的視覺描述,最後剪在一起時,整體感才不會差距太大。
另外,每生成一個鏡頭之前,我覺得還需要重新檢查一次:這個鏡頭需要誰?場景在哪裡?需要哪些道具?人物做什麼?人物現在應該是什麼情緒?上一鏡頭和這一鏡頭能不能接得起來?
這就是分鏡真正存在的價值。
如果前面的分鏡設計做得夠完整,後面的AI影片製作其實會簡單很多。
第四步:剪映合成—AI只是素材,剪輯才決定故事好不好看

最後一步,就是把所有AI生成的圖片與影片素材放進剪映。
到了這個階段,我反而覺得不能再把它單純當成「AI工作」。
因為真正決定作品好不好看的,其實是剪輯。
把所有素材按照故事順序排列之後,需要開始處理旁白、人物台詞、字幕、背景音樂、音效、轉場、畫面速度,以及每個鏡頭停留的時間。

例如劇本寫:「電話突然響起。」
如果只是畫面出現手機,衝擊可能沒有那麼強。
但是加上一聲安靜房間裡突然響起的手機鈴聲,整個氣氛馬上就不同了。
再例如角色發現真相。
這裡不一定需要讓背景音樂一直播放。
有時候突然把音樂拿掉,只留下人物呼吸聲、腳步聲或者環境聲,情緒反而會更強烈。
所以我現在會認為:AI負責提供畫面素材,剪輯負責控制觀眾的情緒。
影片什麼時候快、什麼時候慢、哪一句話之後停兩秒、哪個秘密晚一點才揭露,這些才真正決定一部短劇是否吸引人。
上完這堂課,我對AI漫劇最大的理解
以前我以為AI漫劇最難的是AI生成技術。
好像需要會很多軟體、很多提示詞,以及各式各樣複雜的AI工具。
但是實際整理完這套流程後,我反而覺得:真正重要的不是會多少AI工具,而是能不能把故事拆解得夠清楚。

故事寫不好,AI救不了。
人物設定不清楚,AI就會亂長。
分鏡沒有拆好,影片就很容易失控。
節奏沒有設計,畫面再漂亮也可能讓人覺得無聊。
而剪輯沒有做好,前面生成再多素材,最後也只是一堆AI影片的拼貼。
因此AI漫劇真正的核心能力,其實包含三件事情:講故事、拆鏡頭、控制情緒。
GPT、Gemini、各種AI繪圖工具、AI影片生成工具以及剪映,只是在不同的階段協助我們完成工作。
工具未來一定還會一直改變。
AI影片可能可以生成得越來越長,角色一致性也會越來越好,甚至未來可能真的只需要一句話,就能自動生成一整部短劇。
但是我相信,「故事」這件事情不會消失。
因為觀眾最後記住的,不是哪一個AI模型生成了這段影片。
觀眾記住的可能是:
-
- 那個角色讓我心疼。
- 那一句話讓我停下來。
- 那個反轉我完全沒想到。
- 或者看到結局時,我居然有一點想哭。
如果AI技術最後只是為了完成這件事情,那麼我們現在真正需要學習的,也許並不是如何成為AI工具專家。
而是學會:怎麼利用AI,把自己腦中的故事真正說出來。
這大概就是我這次學習AI漫劇製作之後,最大的收穫。

AI漫劇四步驟快速整理
第一步|劇本+腳本
先建立世界觀、人物關係、故事主線、核心衝突、開場鉤子與劇情反轉,再控制整體故事節奏。不要只是叫GPT「寫一個故事」,而是要先把故事需要的條件設定清楚。
第二步|分鏡畫面
將劇本拆成一個個可以視覺化的鏡頭,固定角色、服裝、場景、道具與整體畫風,優先解決AI漫劇最容易發生的角色與場景一致性問題。
第三步|分鏡影片
把每個鏡頭拆成短片段,描述角色動作、表情、鏡頭運動與環境變化,讓AI一次只完成一件事情,而不是要求AI一次生成整部短劇。
第四步|剪映成片
加入配音、字幕、音效、背景音樂,重新調整節奏與鏡頭長度,最後才真正把大量AI素材變成一個完整、有情緒、有故事性的作品。
所以整套AI漫劇製作流程看似複雜,回到最基本的概念,其實就是一句話:先把故事想清楚,再把故事拆清楚,最後讓AI一個鏡頭、一個鏡頭幫我們完成。
AI漫劇學習心得總結
這次的學習也讓我更確定,現在學AI不能只追工具。
今天可能流行GPT,明天是Gemini,後天又會出現新的AI影片模型。工具一直在更新,但如果我們掌握了劇本、分鏡、故事節奏、角色一致性與剪輯這幾個核心能力,即使未來換了一套新的AI軟體,整套製作邏輯依然可以繼續使用。
因此對想開始做AI漫劇的人來說,我覺得不需要一開始就追求電影等級的效果。
可以先從30秒、60秒的小故事開始,把一個故事拆成5~10個鏡頭,先練習角色一致性,再練習影片生成,最後進到剪映完成配音、字幕與音效。
先真正完成第一部作品,比研究十種AI工具更加重要。
因為只有當作品真正做出來之後,我們才會知道AI在哪裡容易失控、哪些提示詞需要修改、哪些畫面其實不用生成,以及哪些地方可以透過剪輯來解決。
AI漫劇真正的學習,其實就是在一次又一次「做完作品」的過程中累積出來的。
而這也是我接下來想繼續實際練習、測試與記錄的方向。