加入好友

AI數字人怎麼放進 Codex 影片?|第三方平台+HyperFrames 的正確分工

上一篇,我整理了自己這一陣子實際測試的:Codex + HyperFrames 錄音轉知識短片工作流,從一段 MP3 錄音開始,轉逐字稿、切 Scene、安排字幕、加入知識卡、做動畫、最後輸出 MP4。

做到這裡之後,照理說影片已經可以看了。但是我自己看著看著,又開始覺得:「畫面好像還少了一個『人』。」

因為我的內容本來就是知識型。如果整支影片只有:字幕、知識卡、圖示、插畫、流程圖,雖然資訊很完整,卻還是有一點像:會動的教學簡報。

所以我開始想:如果在左下角放一個小小的講師呢?就像很多線上課程一樣,畫面大部分還是知識內容,但是角落有一位講師跟著聲音說話,這樣觀眾會不會比較有陪伴感?

問題是:我自己又不想露臉,那最自然的答案就變成:AI 數字人。

我手上其實已經有兩個重要素材

這一次我不是從零開始。我已經有:一張 AI 講師圖片。還有:tina-test.mp3

也就是說:「長什麼樣子」有了、「要講什麼」也有了,剩下的問題就是:怎麼讓這張 AI 講師圖片真的跟著錄音說話?

我一開始其實也會直覺想:Codex 不是什麼都能做嗎?那乾脆叫 Codex 自己把照片變成數字人影片?

後來做下去,我才發現:這不是最合理的分工方式。

第一個重要觀念:Codex 不是數字人生成引擎

Codex 很強的地方,是:理解任務、讀檔案、寫程式、整理流程、調整畫面、協調不同工具。

但是把一張人物照片變成:嘴型自然、眼睛會動、表情自然、頭部微微晃動,而且還要和語音同步,這本身就是一個非常專門的 AI 任務。

它需要的不是普通 HTML 動畫,而是:Talking Avatar / Lip Sync / Digital Human 模型。

所以這一段,應該交給真正專門做數字人的平台。

第三方平台的角色:負責把「照片+聲音」變成會說話的人

我現在會把第三方數字人平台想成:演員工廠。

我交給它:AI 講師圖片、錄音。

它負責產生:presenter.mp4,也就是一支:AI 講師跟著錄音說話的影片。

例如我這次就是想把:AI 講師圖+tina-test.mp3 先轉成:presenter.mp4

這個 presenter.mp4 本身,不需要是一支完整知識短片。

它只需要做好一件事情:把「講師」演好。

所以第三方平台不需要負責整支知識短片

這一點我覺得很重要。

因為一開始很容易變成:既然數字人平台能做影片,乾脆整支都讓它做。

但是我的知識短片裡面還需要:字幕、重點字、知識卡、插畫、流程圖、動畫、Scene 切換、品牌標頭、CTA。這些事情如果全部塞給數字人平台,反而會失去原本 HyperFrames 的優勢。

所以比較合理的做法是:數字人平台只負責人。HyperFrames 負責整支影片。

我現在會把三者分工成這樣

工具 主要工作
Codex 總導演/流程設計/檔案管理/修改程式/協調工作流
第三方數字人平台 把 AI 講師圖片+錄音,產生會說話的 presenter.mp4
HyperFrames 把 presenter.mp4、字幕、圖片、知識卡與動畫整合成最後影片

這樣一分,整個問題突然就簡單很多。

如果把它比喻成拍片,就更好懂

Codex 是:導演。第三方數字人平台是:演員。HyperFrames 是:攝影棚+剪輯台+Motion Graphics 系統。

導演不需要自己變成演員,演員也不需要自己剪整支影片,每個工具只做它最擅長的部分,我覺得這才是真正合理的 AI 工作流。

第一步:先準備 AI 講師圖片

數字人影片要好看,第一個最基本的東西,就是:講師圖片本身要適合動畫。

我現在會特別注意:

    • 正面或微微側面
    • 臉部不要被頭髮遮太多
    • 嘴巴清楚
    • 眼睛清楚
    • 光線均勻
    • 背景不要太亂
    • 肩膀最好有完整保留

如果圖片一開始就:臉很小,嘴巴被手遮住,側到幾乎看不到另一邊臉,那後面 Lip Sync 再厲害,也比較容易怪。

AI 講師不一定需要全身

因為我這次想做的,不是:一位老師站在正中央講 15 秒。

我的想法比較像:左下角小圓形講師視窗。或者:左側半身 Presenter。

因此圖片只要:頭、肩膀、一點上半身,其實就夠了。這樣數字人影片產生後,還比較容易塞進 HyperFrames 的版面。

第二步:把錄音交給數字人平台

這一段最單純。我希望 AI 講師講什麼,就使用:tina-test.mp3 這樣有一個很大的好處。

上一篇 HyperFrames 的字幕和畫面,本來就是依照同一份錄音做的,現在數字人也使用同一份錄音。也就是:所有東西共用同一條時間軸。這件事非常重要。

為什麼我不建議另外讓數字人平台重新產生 AI 語音?

不是不能。

而是如果我的原始影片已經以 tina-test.mp3 為基準:字幕是照它切的、Scene 是照它切的、動畫也是照它切的,結果數字人突然改用另一個 AI Voice。

就可能出現:講話速度不同、停頓不同、句子長度不同、整個時間軸重新跑掉。

所以對我目前這套工作流來說,最乾淨的是:同一份錄音,從頭用到底。

第三步:產出 presenter.mp4

數字人平台最後真正要交回來的,就是:presenter.mp4

這個檔案我會把它視為:素材,它不是 Final Video,這個觀念一定要分清楚。

就像做真人影片時:我先拍一段老師講話、這段老師影片只是素材。

後面還要:排版、加字幕、加 B-roll、加動畫、加圖卡,最後才變成成品。AI 數字人其實也一樣。

如果平台支援透明背景,當然最好

如果數字人平台可以直接輸出:透明背景,那後面會非常方便。

因為 presenter 可以直接疊在知識卡上,不需要再處理矩形背景。

但如果平台輸出的只是一般背景影片,也不是不能用。

可以:先使用乾淨單色背景、後續再做去背、或者乾脆把 Presenter 放進一個:圓形視窗。這也是我自己很喜歡的做法。

我為什麼喜歡「左下角小圓講師」?

因為知識影片真正的主角,還是:知識內容,不是數字人。

如果 AI 講師佔滿整個畫面,會變成:觀眾一直看人。但是流程圖、插畫、知識重點都只能縮小。這樣反而本末倒置。

所以我目前比較喜歡 畫面中央或上方:主知識區。畫面底部:字幕區。左下角:小圓形 AI 講師。這樣三者不會搶位置。

但是這裡馬上又遇到新的版面問題

以前沒有 Presenter 時,左下角可能可以放:圖片、流程、裝飾。

現在多了一個數字人,整個 Safe Area 都要重新想。

尤其我們前面又已經決定:字幕要貼底。如果 Presenter 也貼底,就會撞到字幕。

所以不能只是:「把一支 presenter.mp4 疊上去。」還要重新設計:Presenter Safe Zone。

我現在會把直式影片大致分成三個安全區

區域 主要內容
上方/中央 知識主畫面、插畫、流程圖、標題
左下或右下 AI Presenter
最底部 字幕

Presenter 必須高於字幕、字幕必須低於主要畫面、三層都不要互相蓋住。

HyperFrames 的角色,就是把這些 Layer 疊在一起

這就是 HyperFrames 開始真正重要的地方。

假設目前有:

background.jpg
presenter.mp4
illustration.png
captions.json
audio.mp3

HyperFrames 要做的,就是把它們變成:

Layer 1:背景
Layer 2:知識圖片
Layer 3:重點文字
Layer 4:AI Presenter
Layer 5:字幕
Layer 6:裝飾動畫

然後再放進同一條 Timeline。

這樣 Presenter 不再是一支獨立影片,它只是一個:Video Layer。

這時 AI 數字人就跟圖片、字幕一樣,只是一個 Component

這個觀念我覺得非常重要。

一開始看到數字人,會很容易覺得:「哇,這個東西好高科技,整支影片是不是都要繞著它做?」

但真正成熟的工作流,反而應該把它降級成:一個可以開、關、換位置、換大小的 Component。

例如 Scene 1:Presenter 出現。Scene 2:Presenter 暫時縮小。Scene 3:Presenter 再出現做 CTA。

這樣會比 15 秒從頭到尾都黏在左下角更有節奏。

數字人不一定要全程出現

這也是我後來越想越覺得合理的做法。

如果一支 15 秒知識片,數字人 15 秒都在講:看久了其實還是會單調。

反而可以這樣:

時間 數字人安排
0–5 秒 Presenter 出現,建立人物連結
5–10 秒 Presenter 縮小或離場,讓圖解成為主角
10–15 秒 Presenter 再出現,做結論或 CTA

這樣畫面反而更像:真的有人在帶著觀眾上課。

第四步:Codex 負責安排 Presenter 什麼時候出場

這就是 Codex 最適合做的地方。

它可以讀:逐字稿、Scene、presenter.mp4、字幕。

再依照規則決定:講師從第幾秒進場、放左邊還右邊、多大、哪一段要縮小、哪一段要離場、CTA 時要不要再放大。

這才是 Codex 真正擅長的:編排。

Codex 不必製造 Presenter,它只要會「使用 Presenter」

我覺得這句話非常值得記下來。

Codex 不需要負責生成每一種素材,但它要知道怎麼使用不同素材。

就像前面的產品銷售頁,Codex 不需要自己拍 Dosha 產品照。

但它要知道:哪張是產品主圖、哪張是情境圖、哪裡應該使用。

影片也是同一個概念,Codex 不需要自己生成數字人。

但是它需要知道:presenter.mp4 是什麼,以及應該怎麼放。

第五步:字幕還是由 HyperFrames 統一控制比較乾淨

這裡也很容易重複。因為有些數字人平台本身也能燒字幕。

可是如果 presenter.mp4 已經自帶字幕,然後 HyperFrames 又放一次字幕,就會變成:兩套字幕。

這一定很亂。

所以如果目標是把 Presenter 當素材,我反而會傾向:數字人平台只輸出人物影片,不要把完整影片 UI 一起做死。

字幕統一交給 HyperFrames。這樣位置、字體、大小,一句一句出現,全部跟第 16 篇的字幕規則共用。

同一條錄音,也能避免嘴型和字幕不同步

如果:數字人用 tina-test.mp3。HyperFrames 字幕也用 tina-test.mp3。整個影片時間軸也以 tina-test.mp3 為準。

那理論上:Presenter、字幕、動畫、Scene,都在同一條時間上。

這會比:數字人一套錄音、字幕另一套文字、動畫又自己估時間,穩定很多。

這次我真正想做的畫面,大概就是這樣

┌───────────────────────────┐
│       主知識畫面           │
│                           │
│   圖片 / 流程 / 重點動畫   │
│                           │
│ ○ AI講師                  │
│                           │
│      字幕一句一句出現       │
└───────────────────────────┘

AI 講師不是最大、字幕也不是最大、真正最大的仍然是:知識。

Presenter 的尺寸不是越大越好

一開始看到數字人,當然會很想把它做大,不然好像浪費。

但這支影片不是:AI 主播新聞,也不是:純數字人口播。而是:知識動畫影片。

所以 Presenter 只要讓觀眾知道:「有人正在帶我理解這件事。」其實就夠了。

我會特別避免 Presenter 擋到哪些東西?

至少有四種。

1. 字幕

最重要。所以 Presenter 不能太貼底。

2. 重點文字

如果一段正在 Highlight 關鍵字,不要讓人物剛好擋住。

3. 流程箭頭

知識型影片很多流程圖。Presenter 擋住箭頭,觀眾會突然看不懂。

4. CTA

最後一段如果有 CTA,位置要先預留。

所以 Presenter 也要有自己的 Safe Zone 規則

例如:

Presenter Safe Zone:
- 不得進入字幕區
- 不得遮住 H1 / Key Point
- 不得遮住流程主線
- 預設放左下或右下
- Scene 可調整大小
- 必要時可暫時離場

當這些規則先定義好,後面就比較適合自動化。

第六步:數字人影片也要做 QA

這一層不能因為「AI 已經做完」就不看。

我會特別看:

    • 嘴型有沒有明顯不同步
    • 嘴巴有沒有怪異變形
    • 眨眼是否自然
    • 頭部動作是不是太頻繁
    • 手或身體是否出現奇怪變形
    • 影片開頭是否有靜止幀
    • 結尾是否突然卡住

因為如果 presenter.mp4 本身就怪,HyperFrames 再漂亮也救不了。

我現在反而不追求「像真人到看不出來」

這件事情我覺得很有趣。

以前看數字人,很容易一直問:像不像真人?嘴巴自然嗎?會不會被看出是 AI?

但做到知識短片之後,我反而覺得:這不是最重要的。

真正重要的是:不要怪、不要干擾、不要搶內容,讓觀眾覺得有人陪他理解。如果做到這樣,我覺得就夠了。

AI 講師反而很適合我這種不露臉的內容工作流

這也是我為什麼會一直想測數字人的原因。

因為如果要我自己:化妝、架燈、架相機、錄 30 支、重講、剪掉 NG,這對我的工作方式並不適合。

但如果我可以:先錄音、準備一張固定 AI 講師圖、數字人平台幫我產 presenter.mp4、Codex 再自動組合,那整個門檻就完全不一樣。

更重要的是:同一位講師可以形成系列識別

如果每一支影片都使用:同一位 AI 講師、同一種衣服或近似風格,固定出現在相似位置。字幕也一致、色彩也一致,觀眾久了就會開始建立辨識。

也就是:Presenter 本身也開始變成品牌的一部分。

所以 AI 數字人其實也需要 Presenter DNA

做到這裡,我甚至開始覺得:可以像前面網站的 Brand DNA 一樣,替影片的講師也定義一套:Presenter DNA。

例如:

項目 規則
角色 知識型 AI 講師
服裝 簡潔、專業、不過度正式
出現位置 左下為主
尺寸 不超過主知識畫面的視覺權重
動作 自然、少量、不搶戲
用途 開場、轉折、結論、CTA

這樣未來每一支影片就不需要重新決定。

Presenter 也可以變成 Skill 裡的一個選項

例如以後整套影片 Skill 可以有:

presenter:
  enabled: true
  position: bottom-left
  size: small
  appear_in:
    - intro
    - outro

或者某些影片:

presenter:
  enabled: false

這時數字人就不再是一個很神秘的 AI 功能。而是:影片模板裡的一個開關。

這才是我真正想要的自動化

不是每次:上數字人平台、下載、打開剪映、去背、縮小、拖到左下角、再調字幕,下一支再重新做一次。

我真正想要的是:只要 presenter.mp4 出現,Codex 就知道:這是一位講師。HyperFrames 就知道:要把它疊到固定位置。字幕也知道:要避開 Presenter。

這樣才叫:Workflow。

整套 AI 數字人影片流程,我現在會畫成這樣

AI 講師圖片
        +
tina-test.mp3
        ↓
第三方數字人平台
        ↓
presenter.mp4
        ↓
Codex 讀取 Presenter+逐字稿+Scene
        ↓
決定 Presenter 出場規則
        ↓
HyperFrames
        ↓
背景+知識畫面+動畫+Presenter+字幕
        ↓
Preview / QA
        ↓
Final Render
        ↓
knowledge-video.mp4

這個流程我覺得已經很清楚地說明:第三方平台不是競爭者,而是素材供應者。

不要讓每一個 AI 工具都想包辦全部

這其實是我這次最大的體會。現在 AI 工具很多。

每一個都會說:可以寫、可以剪、可以做影片、可以做 Avatar、可以自動化。

如果我一直想找:「一個工具全部做完。」最後反而可能每一段都普通。

真正比較合理的方式是:嘴型同步最強的工具,做數字人。流程與程式最強的 Codex,做協調。畫面動畫與時間軸交給 HyperFrames。每個工具都做自己擅長的 20%。最後組成一套完整的 100%。

Tina學姐這次最大的體會:AI 自動化不是找一個萬能工具,而是設計正確分工

這次做到數字人,我覺得自己對「AI Workflow」又多理解了一層。

以前我會問:「這個工具能不能做這件事?」

現在我比較會問:「這件事情,交給哪一個工具最合理?」

兩個問題看起來很像。其實差很多。

Codex 也許可以想辦法做一些 Avatar 效果。HyperFrames 也可以做人物影片 Layer。數字人平台也可以加字幕。

但不代表:它們都應該做。

真正好的 Workflow,是:邊界清楚、資料能交換、每個工具做最擅長的事,最後再由 Codex 把流程串起來。

寫在最後:AI 講師不是整支影片,它只是整個知識系統的一個 Layer

做到第 17 篇,我現在反而不會把數字人看得那麼神秘了。

它不是:「一支 AI 影片。」

它只是:Presenter Layer。錄音是 Audio Layer。字幕是 Caption Layer。插畫是 Visual Layer。Motion Graphics 是 Animation Layer。所有東西最後在 HyperFrames 裡面組起來。

而 Codex 則負責:讓這些 Layer 知道什麼時候該出現、該放哪裡、該怎麼合作。

這個觀念一旦想清楚,數字人就不再是一個需要重新發明整套流程的新專案。

它只是:在原本已經存在的錄音轉影片 Workflow 裡,多加入一個新的 Component。

我覺得這才是最有價值的地方。