幾年前,「輸入一段文字,幾秒生成一部電影」的說法曾風靡一時,讓人以為影視製作的門檻與成本即將迎來毀滅性的下降。然而,當第一批湧入 AIGC 浪潮的影視從業者真正踏入機房,才發現現實遠比預想殘酷:秒級生成的「微短劇」迅速面臨品質同質化與觀眾審美疲勞;而真正試圖用 AI 打造具有影視質感、具備敘事連貫性的作品時,一場關於技術、成本與審美的拉鋸戰才剛剛開始。
一、 領域轉移:從 1 分鐘「情緒快餐」到 10 分鐘「橫螢幕中劇」
在文字生成影片(T2V)技術爆發初期,市場上充斥著大量 1 分鐘左右的 AI 微短劇。這類內容多以單人特寫、簡單對話為主,製作期短、門檻低。然而,隨著大量重複性極高的內容湧入,觀眾對僵硬的動作與千篇一律的面孔迅速失去新鮮感。
為了打破這一僵局,部分創作團隊開始將目光轉向每集約 10 分鐘、採用 16:9 橫螢幕畫幅的「中場劇」。與極簡的短劇相比,橫螢幕中劇對視覺語言的要求呈幾何級數上升:
1. 長鏡頭與景別調度:不再能僅靠單一特寫混過,必須在遠景、中景與特寫之間流暢切換,同時維持空間關係的和諧。
2. 動態視覺與連續性:10 分鐘的敘事要求人物的表情變化、肢體張力與光影氛圍保持前後一致,避免「一秒換臉」或「背景漂移」。
3. 多人物互動:當同一畫面中出現多個角色時,AI 大模型對空間邏輯與動態平衡的掌控力面臨極大挑戰。
二、 幕後紀實:被「機率」支配的製作流程與算力黑洞
外界常誤以為 AI 影視能實現「一鍵生成」,但實際參與專案的創作者直言,製作體驗更像是在「算力黑洞中進行無限重試(抽卡)」。
(一) 前期數位資產的嚴格控管
生成式 AI 的本質是機率模型,具有高度的隨機性。為了防止同一個角色在不同鏡頭中出現服飾、髮型乃至五官細節的劇烈波動,團隊必須在前期導入傳統 3D 或 2D 美術資產建立概念庫,包含角色多角度三視圖、道具固定模型等,強行給予 AI 明確的物理與視覺邊界。
(二) 提示詞(Prompt)與微表情的拉扯
當影片涉及複雜的情節或精細的微表情時,提示詞的撰寫甚至比傳統劇本還要繁複。例如為了呈現角色在特定情緒下的眼皮跳動或肌肉抽搐,技術人員需要撰寫上千字的精確描述,並歷經數十次甚至上百次的重新生成,才能篩選出一個勉強合乎導演意圖的鏡頭。
【鏡頭複雜度與時間成本對照】
• 靜態空鏡 / 簡單人物特寫:生成重試 3 到 5 次,耗費數分鐘至半小時。
• 具備特定動態的雙人鏡頭:生成重試 20 到 30 次,耗費半天至一天。
• 多角同框 / 精細微表情 / 複雜光影:生成重試數百次,耗費數天至數週。
三、 商業迷思與現實落差:預算、算力與平台期望
(一) 「免費 / 廉價」的認知誤區
資本與平台往往對 AI 影視抱持「成本趨近於零」的幻想。但事實上,高頻率的畫面生成會消耗海量的 Token 與雲端算力,僅算力與 API 調用成本就可能高達數十萬新台幣。再加上美術修正、聲學後製與團隊人力,總費用雖然低於頂級真人實拍,但絕非「白菜價」。
(二) 隨機性帶來的修改無底洞
在傳統實拍中,重拍或補拍會受到場地與演員檔期等實體限制,使團隊對修改次數保持克制;然而面對 AI,投資方常誤以為「只要改改提示詞就能重來」,進而提出無休止的調整要求,反而導致算力費用與時間成本失控。
四、 合規與審查挑戰:當擬真遇上傳統影視標準
雖然多數 AIGC 作品以網路劇或數位內容形式發布,但在審查與版權規範上,所面臨的標準並不比傳統劇集寬鬆:
1. 肖像權與平均臉困境:直接使用高擬真人臉易引發版權與肖像權爭議;但若使用 AI 生成的通用「泛化臉」,又容易讓觀眾產生視覺疲勞與漠離感。
2. 細節合規嚴格:線上審查單位對擬真視覺的審核標準高度對齊真人作品,從角色口型與語音的對齊度,到背景細節(如騎乘工具是否佩戴安全裝備)皆會嚴格把關。
3. 「去 AI 化」與標註的雙重矛盾:團隊需花費大量精力修飾微小瑕疵以消除「AI 感」,但在發布時又必須依法標註「AI 生成內容」,這種矛盾反映了當前技術過渡期的奇特生態。
五、 深度剖析:AIGC 影視的當前瓶頸與未來戰略
(一) 商業脈絡:從買量導流回歸敘事本質
早期 1 分鐘短劇依賴「前 3 秒強衝擊」與大量的廣告買量導流來變現。但當 AI 生成的僵硬畫面無法持續吸引觀眾停留時,廣告投放的回報率迅速下滑。轉向 10 分鐘「中劇」,代表行業開始體認到:單靠技術新鮮感無法建立長期商業價值,內容最終仍需回歸專業的視覺語言、人物塑造與戲劇結構。
(二) 技術鴻溝:機率模型 vs. 影視工業的確定性
傳統影視工業的核心要求是「高可重複性與精準控制」,而當前生成式 AI 的核心運作機制則是「機率分佈」。這種底層邏輯的衝突,導致創作者耗費大量時間在抹平隨機性帶來的錯誤上。此外,肢體張力、自然配音以及環境音效等聲學後製,目前仍極度仰賴傳統專業團隊補位。
(三) 美學選擇:擬真路線的「恐怖谷」與風格化路線
強行追求「高擬真真人」極易觸發觀眾的恐怖谷效應,使眼睛微小的僵硬或肌肉不自然被無限放大。相比之下,採用風格化(如繪畫感、水墨風或特定藝術質感)的視覺語彙,反而能避開擬真陷阱,發揮 AI 在意象建構上的獨特優勢。
六、 結語:在技術演進中尋找新型態的美學語言
歷史上每一次技術革新——從黑白到彩色、從無聲到有聲、乃至數位攝影取代底片,都曾引發舊有體系的焦慮與對新工具的誤解。AI 影視或許不會全面取代真人實拍,但它正在迫使創作者重新定義「導演」與「機房製作」的角色。隨著大模型與工具鏈的持續完善,屬於 AIGC 時代的獨特敘事語言與工業標準,正在這些反覆的試錯與拉鋸中逐漸成形。
