前面第 16 篇,我開始測試用 Codex+HyperFrames,把一段錄音自動變成知識短片。
到了第 17 篇,又進一步把 AI 數字人放進影片裡。
照理說,做到這裡,該有的東西幾乎都有了。
字幕有、標題有、知識卡有、動畫有、轉場有,甚至連左下角會說話的 AI 講師都有了,可是我把成品打開來看,還是一直有一種感覺:「嗯……它會動沒錯,可是怎麼還是很像 PPT?」
這個問題其實讓我卡了一段時間,因為從功能上來說,影片沒有壞,該出現的都有出現、文字也跟得上錄音、畫面甚至比一般簡報豐富很多。但就是少了一種:真正的「影片感」。
後來我才慢慢發現,問題根本不是:動畫太少。而是:畫面還是在用「簡報」的思考方式,而不是用「故事」的思考方式。

這也是我後來開始接觸:Illustrated Storytelling。
也就是:用插畫、場景、構圖和視覺變化,真正替聲音說故事。
先講最重要的結論:有動畫,不等於有影片感

這句話我現在非常有感。
例如一張知識卡,標題從左邊滑進來、Icon 從下面彈上來、三個 Bullet 一個一個 Fade In、最後按鈕再跳一下,這當然叫動畫。
但是如果從頭到尾都只是:文字卡、Icon、方框、條列,那觀眾看到的其實還是:簡報。只是這份簡報會動而已。
PPT 動畫真正的問題,不是它不好,而是它太「元件導向」
PPT 很習慣把畫面拆成:標題、副標、三個重點、一張圖片、一個 Icon。
然後再問:這個元素要怎麼進場?從左邊?從下面?淡入?放大?
這是一種:Element Animation。也就是「元件動畫」。
但是影片真正更重要的問題其實不是:「這個字要怎麼飛進來?」
而是:「這一秒,觀眾到底應該看什麼?」
這就是我開始從「做動畫」改成「設計視覺焦點」

以前一個 Scene 裡可能有:標題、四個 Bullet、一張圖、三個小 Icon、AI Presenter、字幕。
我會想:每一個都做點動畫好了。結果就是:全部都在動。但觀眾反而不知道要看哪裡。
後來我的想法開始改成:每一個時間點,只安排一個主要視覺焦點。
例如第 0~2 秒:先看一句問題。第 2~4 秒:焦點移到一張插畫。第 4~5 秒:再 Highlight 一個關鍵字。這時畫面才開始有:引導。
簡報是在「展示資訊」,Storytelling 是在「帶觀眾走」
我覺得這是兩者最大的不同。
| 簡報式動畫 | Illustrated Storytelling |
|---|---|
| 一次展示一組資訊 | 讓資訊依故事順序發生 |
| 以文字和卡片為中心 | 以場景和視覺事件為中心 |
| 問「元素怎麼進場」 | 問「觀眾現在應該看到什麼」 |
| 畫面常固定不動 | 視角、焦點、構圖會改變 |
| 動畫裝飾內容 | 動畫本身參與敘事 |
例如同一句話,可以有完全不同的做法
假設口播說:「每天忙著處理很多事情,不代表你真的完成了最重要的事。」
如果是 PPT 思維,我可能會做:
-
- 標題:忙碌 ≠ 有效率
- 下面三個 Bullet:工作很多、時間很滿、重要事情卻沒完成,然後三點依序飛進來。
這沒有錯,但是 Illustrated Storytelling 可以完全不同。
畫面先是一個人坐在桌前。
桌上堆滿:Email、手機通知、文件、行事曆、時鐘快速走動、人物一直在處理。
但畫面角落那一張真正重要的企劃書,從頭到尾沒有被碰到。最後鏡頭把其他東西慢慢淡掉。
只留下:那一張沒完成的重要工作。這時甚至不用打很多字,觀眾就已經懂了。
這就是「畫面自己會說話」
我後來越來越在意這件事情。
如果把影片靜音,只看畫面,觀眾能不能大概理解:這一段在講什麼?
如果完全看不懂,只看到:漂亮卡片、文字、Icon。
那畫面其實沒有真正參與內容,只是:替聲音做裝飾。
真正好的 Illustrated Storytelling,應該是:聲音負責說,畫面負責演。
所以插畫不是「找一張漂亮圖放上去」

這也是我後來才慢慢理解的。
以前講到插畫,我可能會想:這一段講辦公室,就做一張辦公室 AI 圖。這一段講焦慮,就做一個人在皺眉。這一段講學習,就放一個人在看書。
這其實仍然比較像:配圖。
Illustrated Storytelling 要再往前一步。它不是問:「這一段放什麼圖?」而是問:「這一段要發生什麼事?」
「圖」和「Scene」是不一樣的
一張圖可能只是:一個人坐在桌前。
一個 Scene 則要思考:人物在哪裡?正在做什麼?視線看哪裡?前景有什麼?背景有什麼?哪個物件最重要?下一秒什麼東西會改變?
也就是從:Static Image 變成:Visual Scene。
我現在會先替每個 Scene 寫一句「視覺事件」
這個方法我覺得很好用。
以前 Scene 可能只寫:
Scene 02
主題:時間管理
畫面:辦公室插畫
現在我反而會寫:
Scene 02
視覺事件:
桌面通知越堆越多,
時鐘持續走動,
真正重要的企劃文件被壓在最下面。
這兩種寫法的差別非常大。
前者只知道:要有一張辦公室圖。後者開始知道:畫面要發生什麼。
Illustrated Storytelling 的第一個關鍵:人物要有行動
如果插畫裡的人物永遠只是:站著、坐著、看鏡頭、指著文字。
很快還是會變成:人物版 PPT。
所以人物最好有明確行動。
例如:翻找文件、停下來思考、望向窗外、伸手拿咖啡、滑手機、關掉通知、把一張紙從文件堆裡抽出來,只要人物「正在做事情」,畫面就比較容易活起來。
第二個關鍵:物件也可以參與故事
其實不一定每一段都需要人物,有時候物件反而很好用。
例如講:資訊太多,可以讓:Email、訊息泡泡、文件、通知,一個一個堆進畫面,講優先順序,可以讓十張待辦卡慢慢縮成三張,最後只剩一張被 Highlight。
講流程,就讓一個物件從 A 點走到 B 點。
這些都比:直接打三個 Bullet 更有畫面。
第三個關鍵:場景要有前景、中景、背景

我覺得這是讓 PPT 感消失得非常快的一個方法。
因為 PPT 通常是:一個平面,文字和圖片都貼在同一層。
但真正的場景會有:Foreground、Midground、Background。
例如咖啡店:前景可以是一個模糊的咖啡杯、中景是正在工作的主角、背景則有人走動、窗外街景,哪怕只是插畫,只要有這三層,畫面立刻就比較像:鏡頭,而不是:投影片。
第四個關鍵:鏡頭不一定真的移動,但畫面要有「攝影思維」

Illustrated Storytelling 不代表一定要做很複雜的 Camera Animation。
就算是一張靜態插畫,也可以用:特寫、中景、遠景、Over-the-shoulder、俯視、側面,來改變觀看感受。
例如同一個人在工作。
-
- 第一個 Scene:遠景,看整個混亂辦公桌。
- 第二個 Scene:特寫手機通知一直增加。
- 第三個 Scene:特寫時鐘。
- 第四個 Scene:再回人物表情。
這樣即使內容沒有變很多,也已經比:一張畫面從頭撐到尾有影片感很多。
第五個關鍵:不要把口播每一句都翻成大字

這也是我最容易做過頭的地方。
因為口播有一句,就很自然想:那我畫面也打一句。
結果影片就變成:聲音唸一次、字幕寫一次、大標題再寫一次,同一份資訊重複三次,其實很浪費。
比較好的做法是:口播負責完整句子、字幕負責可讀性。
大字只抓:真正值得記住的兩三個字。
例如口播:「真正耗掉時間的,往往不是工作本身,而是不斷被打斷。」字幕照常顯示。
大字只需要:「被打斷」其他交給畫面去演。
第六個關鍵:轉場不能只是為了「換頁」

PPT 的轉場通常就是:上一頁出去、下一頁進來。
但是故事型影片的轉場最好是:上一個畫面的某個東西,帶出下一個畫面。
例如:時鐘特寫、鏡頭放大進時鐘、下一幕直接變成行事曆,或者人物把文件翻過去,文件背面就變成下一個 Scene。
再例如:手機畫面放大,下一幕直接進入手機裡的聊天視窗,這種轉場就不是「切換畫面。」而是:故事繼續往下走。
第七個關鍵:一個 Scene 不要塞完整的一張「海報」
這是我覺得 AI 生圖特別容易出現的問題。
因為我們很容易一次生成一張:漂亮、完整、資訊滿滿、構圖完整,像海報一樣的圖片,然後直接拿去做影片。
可是問題也來了。
一張圖本來就已經把所有資訊講完,HyperFrames 後面還能做什麼?最多就是:Zoom In、Zoom Out、平移,這也是為什麼做到後來,我開始覺得:一張完整 AI 插畫,其實還不夠。
這正好會接到下一篇的:Layered Motion Graphics。
但是在進入 Layered Motion Graphics 之前,要先有 Story Frame
我現在會把整個流程想成:
Audio
↓
Transcript
↓
Scene
↓
Visual Event
↓
Story Frame
↓
Layer Split
↓
Motion
也就是說,不要一拿到錄音就直接:找 Icon、做動畫。而是先決定:這一段故事到底長什麼樣子。
什麼是 Story Frame?
我現在會把 Story Frame 理解成:這個 Scene 最重要的那一格畫面。
有點像漫畫的一格、也有點像電影分鏡。
如果這一格完全不動,它本身還是要:看得懂、有焦點、有構圖、有情緒,等這一格成立後,再想:哪些東西可以動。
這和我第 16 篇學到的「先把靜態畫面做好,再做動畫」其實是一樣的

只是現在又再往前一步。
以前的靜態畫面可能是:漂亮的知識卡。
現在的靜態畫面則變成:一個有故事的場景。
所以真正的變化不是:動畫技術變強。而是畫面思考方式變了。
我現在會怎麼判斷一個 Scene 還是不是太像 PPT?
我大概會看幾件事情。
如果一個 Scene 把所有動畫停掉之後,只剩:一個標題、三個 Bullet、一個 Icon、一張配圖,那通常還是 PPT 邏輯。
如果停掉動畫後,看到的是:一個人物、一個具體情境、有前景、有空間、有動作暗示、有視覺焦點,那就開始比較接近:Storytelling。
我也開始把影片裡的文字分級
| 文字類型 | 用途 |
|---|---|
| 字幕 | 完整跟著口播,負責理解 |
| Key Phrase | 只顯示真正要記住的關鍵字 |
| Scene Label | 必要時交代時間、地點或階段 |
| 圖內標示 | 協助理解流程、方向或物件 |
這樣就不會每一段都變成:畫面上塞很多文字。
數字人加入後,更需要 Illustrated Storytelling
因為第 17 篇加入 Presenter 之後,如果主畫面還是 PPT:
那最後就會變成:左下角一個會說話的人+後面一張簡報。本質其實還沒有變。
反過來,如果主畫面本身是一個:有角色、有場景、有物件變化、有視覺焦點、有情境推進的 Story Scene,那 Presenter 才比較像帶著觀眾看故事的人。而不是簡報旁邊的講師視窗。
所以 AI 講師和 Storytelling 其實不是二選一
我現在反而覺得最理想的結構是:知識故事是主體。
AI 講師負責陪伴與轉場、字幕負責理解、動畫負責焦點與節奏,四個各有工作,不要全部搶同一件事情。
如果是 15 秒短片,我現在會怎麼改?
例如同樣 5+5+5 秒。
以前可能是:
| 時間 | PPT 式做法 |
|---|---|
| 0–5 秒 | 標題+Icon+一句 Hook |
| 5–10 秒 | 三點知識卡 |
| 10–15 秒 | 總結卡+CTA |
現在我可能會改成:
| 時間 | Storytelling 做法 |
|---|---|
| 0–5 秒 | 一個具體人物/情境衝突出現 |
| 5–10 秒 | 畫面事件變化,把原因演出來 |
| 10–15 秒 | 視覺收斂,留下答案與一個 Key Phrase |
內容可能完全沒有變,但觀看感受會完全不同。
我現在甚至覺得:Shorts 越短,越需要視覺敘事
因為 15 秒根本沒有時間讓觀眾:慢慢讀四個 Bullet。
如果一眼就看到一個場景:觀眾反而更容易理解。
例如:「資訊過載。」
與其寫:訊息很多、注意力分散、工作效率下降。
不如直接讓一個人物被:Email、LINE、通知、文件,一層一層包圍,可能一秒就懂了。
這也是 AI 插畫真正有價值的地方
以前如果每一個 Scene 都要真人拍,成本其實很高。辦公室、咖啡廳、下雨、捷運、不同人物、不同物件,根本拍不完。
但 AI 插畫可以讓我們先建立:場景、角色、光線、構圖、情緒。
再交給 HyperFrames 去做下一層的 Motion。
所以 AI 生圖真正有意思的地方,不只是:「幫我做漂亮素材。」
而是:讓以前拍不到的 Story Frame,變得可以大量產生。
但是如果每一支影片都重新生不同人物,也會有新的問題
例如:第一支女生長這樣、第二支又變成另一個人,第三支衣服不同、第四支臉型又不一樣,整個系列就會沒有一致性。
所以如果未來真的大量做 Illustrated Storytelling,我覺得還要慢慢建立:角色規則、色彩規則、場景規則、插畫風格。
甚至:Story Visual DNA,這樣影片才不會每一支都像不同頻道。
做到這裡,我開始發現「影片 Skill」要記錄的不只是字幕與尺寸
一開始我的影片 Skill 可能只需要記:1080×1920、15 秒、字幕貼底、芫荽字體、5+5+5。
但是做到 Illustrated Storytelling 後,Skill 還需要知道:每個 Scene 要有 Visual Event、不要只做資訊卡、人物要有行動、畫面要有焦點、文字不要重複口播、要有景別變化、轉場最好承接故事,這才開始變成真正的:影片語言規則。
我現在最想避免的一句指令就是:「幫這張 PPT 加更多動畫」
因為如果底層還是一張 PPT。
動畫加再多,也只是:更華麗的 PPT。
比較好的問題應該是:「這段內容如果不用文字解釋,我要怎麼把它演出來?」
只要開始問這個問題,畫面就會開始不一樣。
Tina學姐這次最大的體會:不是讓元素動,而是讓故事動
我覺得這句話很適合當這篇的結論。
PPT Animation 比較像:讓元素動。
Illustrated Storytelling 則是:讓故事動。
人物改變、場景改變、物件改變、焦點改變,觀眾的理解也跟著一步一步前進。
這時動畫才不是裝飾,而是內容本身的一部分。
寫在最後:從「會動的簡報」開始走向真正的影片
做到第 18 篇,我覺得自己的 AI 短影片流程又往前走了一步。
一開始我只在意:有沒有字幕、有沒有動畫、畫面會不會太單調。
後來開始加入:AI Presenter、圖片、知識卡、更多 Motion。
但是做到這裡,我才真正發現:影片好不好看,最底層的問題不是動畫數量。
而是:有沒有一個值得被看的視覺故事。
先有 Story、再有 Frame、最後才有 Motion。這個順序,我覺得非常重要。
好看的影片,不是把簡報做得更會動,而是讓聲音真正長出一個視覺世界。