AI 影片生成工具比較 2026:四種類型、中文支援度與商用授權風險

桌面上的小型相機、筆電與耳機,代表內容工作者的影片製作工作環境

這篇文章要解決的是一個很具體的困擾:你在網路上搜尋「AI 影片生成工具比較」,跳出來的清單把 Sora、HeyGen、CapCut、ElevenLabs 排在同一張表裡比較「價格」和「輸出解析度」,看完之後你還是不知道該訂哪一個。原因不是那些文章寫得不夠長,而是它們一開始就把四種完全不同的東西放進同一個籃子。一個用來生成不存在的畫面,一個用來把講稿變成人臉講話,一個用來剪你已經拍好的素材,一個只處理聲音。它們的競爭對手不是彼此。

內容目錄

所以這篇的做法是先分類、再比較。我會把 2026 年還在營運的 AI 影片工具拆成四類,每一類都回答同樣的四個問題:實際能做到什麼、明確做不到什麼、繁體中文的支援程度到哪裡、以及生成出來的東西你到底能不能拿去商用。最後兩項是台灣讀者最在意、但幾乎沒有比較文認真寫的部分——尤其是商用授權,我在查核過程中就翻到一條足以讓整支影片作廢的限制:某個知名虛擬主播平台的內建虛擬人,明文禁止用在任何形式的付費廣告。

另外先講一件會影響你整份選型清單的事:Sora 的網頁版與應用程式已經在 2026 年 4 月 26 日停止服務(API 則要到 2026 年 9 月 24 日才關閉,寫這篇時還在倒數)。這不是傳聞,是 OpenAI 說明中心的公告。任何在 2026 年下半年還把 Sora 列為「現行選項」的比較文,都代表作者沒有回頭查過。這也是我把「怎麼自己確認一個工具還活著」寫成獨立章節的原因——在這個領域,工具清單的保鮮期大概只有一季。

文中所有價格都附官方定價頁連結與查核日期(2026 年 8 月 1 日),並且一律以官網公告為準。AI 工具的方案結構變動極快,你看到這篇的時候數字可能已經不同,但判斷框架不會變。

先把四類工具分開,比較才有意義

把「AI 影片工具」當成單一品類,是多數比較文寫壞的起點。實務上它們解決的問題差距非常大,投入產出的邏輯也不同。生成式模型是用算力換「本來不存在的畫面」,虛擬主播是用算力換「不用出鏡也不用拍攝」,剪輯輔助是用算力換「後製工時」,配音是用算力換「錄音室與人聲」。你手上如果是一支已經拍完的三十分鐘訪談,生成式模型完全幫不上忙;你如果需要一段海底珊瑚的示意畫面,剪輯工具也變不出來。

下面這張表是四類的定位。看的時候請把重點放在「輸入是什麼」——這決定了你要不要先有素材。

類別 輸入 輸出 代表工具 典型用途
① 文字轉影片/生成式 文字描述、參考圖 幾秒到數十秒的無中生有片段 Runway、Pika、可靈(Kling)、Google Flow(Veo) 示意畫面、B-roll、概念稿、產品情境
② 虛擬主播/講稿轉影片 講稿文字、你自己的錄影 一個人對鏡頭說話的完整影片 HeyGen、Synthesia、D-ID 教學課程、公告、多語版本、SOP 影片
③ 剪輯輔助與長片轉短片 你已經拍好的長影片 字幕、去贅字、切好的短影音 Descript、Opus Clip、CapCut Podcast 轉短影音、訪談上字幕、社群切片
④ 配音與語音克隆 文字或原始錄音 語音檔 ElevenLabs 旁白、多語配音、聲音替身

一個實際的工作流通常會跨兩到三類。例如一支給客戶的產品短影音,可能是「用第一類生成三段示意畫面」加「用第四類做旁白」加「用第三類上字幕與切成直式」。真正該問的問題不是「哪一個最好」,而是「我這條動線的哪一段最花時間,那一段有沒有工具」。這個判斷邏輯跟選 AI 寫作工具是同一套,如果你還沒建立起自己的工具評估習慣,可以先看繁中內容工作者怎麼評估 AI 寫作工具的定價與政策風險那一篇,兩篇的方法論是共用的,這裡就不重複定價政策的通則。

還有一個分類上的雜訊要先排掉:很多工具會同時宣稱自己有四類的功能。CapCut 有生成式功能也有配音,HeyGen 也能做翻譯配音。這不代表它們可以互相取代,而是各家都在把相鄰功能包進來。判斷方式很簡單:看它最貴的方案在賣什麼、官網首頁的主視覺在演示什麼,那才是它真正的本業。附加功能通常只夠應付最簡單的情境。

2026 年的前提:Sora 已經停止服務

拔掉的電源線放在水泥地上,象徵已停止服務的 AI 影片工具

根據 OpenAI 說明中心的Sora 停止服務說明(查核日 2026-08-01),Sora 的網頁版與應用程式已於 2026 年 4 月 26 日停止服務,Sora API 則將於 2026 年 9 月 24 日停止。官方同時說明:使用者可以到 sora.chatgpt.com/sunset 匯出自己建立的內容,匯出完成後會收到通知信;在停止服務並經過任何最終匯出期間之後,OpenAI 會永久刪除與你使用 Sora 相關的資料。另外,已購買的 ChatGPT/Sora 點數仍可轉用於 Codex。

這件事對讀者的影響有三層。第一層是最直接的:如果你手上有存在 Sora 裡的素材,那是要處理的待辦事項,不是可以拖的事,因為官方明講最終匯出期間是「如果我們有辦法提供」的語氣,沒有承諾一定會有。第二層是選型上的:任何 2026 年的工具清單如果還把 Sora 排在第一位,你就該懷疑整份清單的查核品質,包括它的價格。第三層比較深——這件事說明了一個結構性風險:影片生成的算力成本很高,即使是資源最充足的公司也可能收掉產品線。你把工作流深度綁定在單一供應商上,是有代價的。

怎麼自己確認一個工具在 2026 年還活著

我在寫這篇時對每一個要列出的工具都跑了同一套動作,你也可以照做,大概三分鐘就能檢查一個:

  1. 打開官方定價頁,不是打開第三方評測文。第三方評測文最愛的做法是抄上一版的表格改年份。定價頁如果 404、跳轉到別的產品、或者整頁只剩「聯絡我們」,那就是警訊。
  2. 找官方說明中心搜尋 discontinu、sunset、deprecat 這幾個字。停止服務的公告通常會放在說明中心而不是首頁,因為首頁要賣新產品。Sora 就是這個情況。
  3. 看服務條款的「最後更新日期」。條款超過一年沒動的產品,通常也很久沒人在維護法務了。Runway 的使用條款最後更新是 2026 年 5 月 11 日,CapCut 的繁中版服務條款是 2026 年 4 月 15 日,這種頻率代表產品還在正常運作。
  4. 如果定價頁需要登入才看得到數字,就不要引用任何在網路上找到的數字。這是我在可靈(Kling)上遇到的狀況,後面會說明我的處理方式。

第四點值得特別強調,因為它同時是查價紀律。網路上有大量「某工具 2026 定價」的文章,彼此的數字互相矛盾,而它們互相抄。你唯一能信的是你自己打開官方頁面看到的東西,加上你看到它的那個日期。

第一類:文字轉影片,能做到什麼與做不到什麼

這一類是最容易被 demo 影片騙的。你在社群上看到的驚人生成片段,背後通常是幾十次重跑加上人工挑選,而且長度多半在十秒以內。理解它的能力邊界,比背模型名稱有用得多。

實際能做到的事

目前這類模型最穩定的產出是「短、單鏡頭、不需要精確控制」的畫面。具體來說包括:抽象或自然的空景 B-roll,例如雲、水面、街道人流;產品放在某個情境裡的示意畫面;概念稿與分鏡示意,用來跟客戶溝通「大概是這種感覺」而不是最終交付;還有從一張靜態圖延伸出輕微運鏡的動態,這對把既有的產品照變成社群動態素材特別實用。

如果你的需求是這幾種,這類工具的投報率其實不錯,因為替代方案是買素材庫授權或是實際去拍。反過來說,如果你的需求超出這個範圍,付費升級到更貴的方案通常不會解決問題,因為那是模型能力的邊界而不是額度的邊界。

明確做不到的事

以下幾件事在 2026 年的現況下仍然不可靠,不要在跟客戶提案時承諾:

  • 畫面裡的文字。這是最容易踩的坑。要求模型在畫面上寫招牌、產品標籤、字幕、看板,結果幾乎都是似字非字的亂碼,中文字尤其嚴重。實務解法是:畫面完全不要求文字,所有字都用後製疊上去。
  • 同一個角色跨鏡頭保持一致。雖然各家都有參考圖與角色功能,但要做到十個鏡頭裡是同一個人、同一件衣服、同一個髮型,仍然需要大量重跑與挑選,時間成本可能高過直接找人拍。
  • 精確的動作指令。「他先轉身,然後把杯子放到桌上左邊」這種多步驟指令,模型會抓到氛圍但不會照做順序。
  • 長度。單次生成通常以秒計,要做成一分鐘以上的影片必須靠多段拼接與後製,那本質上是剪輯工作。
  • 特定真人。指定某個公眾人物的臉,除了做不到之外還有法律問題,這一點放在後面的肖像權章節談。

定價(查核日 2026-08-01,一律以官網公告為準)

工具 方案與月費 幣別確認方式 官方定價頁
Runway Free 0 元/一次性 125 點;Standard 每月 15 美元(年繳折算每月 12 美元)/每月 625 點;Pro 每月 35 美元(年繳折算 28 美元)/2,250 點;Max 每月 95 美元(年繳折算 76 美元)/9,500 點;Enterprise 客製 頁面原始碼的 priceCurrency 標示為 USD runway.com/pricing
Pika Basic 0 元/每月 80 點;Standard 月繳 10 美元(年繳折算 8 美元)/700 點;Pro 月繳 35 美元(年繳折算 28 美元)/2,300 點;Fancy 月繳 95 美元(年繳折算 76 美元)/6,000 點 頁面無 priceCurrency 結構化資料,以錢字符號與方案表判定為美元;定價頁預設停在年繳分頁,卡片下方寫 billed yearly pika.art/pricing
Google AI(Flow/Veo) 台灣區官方頁以新台幣標示:AI Plus 每月 165 元/Flow 200 點;AI Pro 每月 650 元/Flow 1,000 點(查核當日 Flow 內標示的模型是 Gemini Omni Flash;「可試用 Veo 3.1 Lite、有使用限制」是 AI Pro 在 Gemini App 側的權益,不等於 Flow 點數含 Veo,兩件事不要綁在一起看);AI Ultra 每月 3,300 元或 6,500 元兩檔/Flow 10,000 或 25,000 點 台灣區頁面直接顯示 NT$,不需換算 gemini.google/subscriptions
可靈(Kling) 官方會員頁需登入才顯示方案與價格,且官方與各方資料均指出價格因地區與活動而異,因此本文不列出任何未經登入確認的數字 無法在未登入狀態確認,故不引用 app.klingai.com 會員方案

關於可靈那一列,我要說明處理原則,因為這比數字本身重要。我在查核時找到大量第三方文章列出可靈的五個方案與月費,數字彼此不一致,而且都沒有標示查核來源是登入後的結帳頁還是別人的文章。在這種情況下,把數字寫進文章等於把不確定性轉嫁給讀者。所以我的做法是保留官方連結、說明「需登入查看」、並且明講價格因地區浮動。如果你要用可靈,請自己登入看結帳頁上的幣別與金額。

這一類的幣別陷阱

訂閱前有兩個地方會讓你算錯成本。第一個是「年繳折算價」被當成月繳價顯示。Runway 與 Pika 的定價頁預設都是年繳視角,你看到的較低數字其實要一次付十二個月。第二個是幣別。同一個定價頁在不同地區可能顯示不同幣別,Google 的訂閱頁在台灣就直接顯示新台幣,而多數美國新創維持美元計價再由發卡行換匯,你的實際扣款還要加上外幣交易手續費。判斷幣別最可靠的方式是看頁面原始碼裡的 priceCurrency 欄位,或直接走到結帳頁看實際扣款幣別,不要憑符號猜——美元、澳幣、加幣、新加坡幣在頁面上都可能只寫一個錢字符號。

繁體中文支援:這一類的中文問題不在介面

對生成式影片模型來說,「支援繁體中文」其實是三個不同的問題,混在一起講就會誤判。第一是介面語言,這個最不重要,看不懂英文介面可以靠瀏覽器翻譯。第二是提示詞語言,多數模型能理解中文提示,但描述鏡頭運動、光線、材質這些專業詞彙時,英文的訓練資料密度明顯較高,實務上用英文寫提示詞的成功率比較穩。第三,也是真正的痛點:畫面裡的中文字幾乎必定失敗。方塊字的筆畫結構讓生成模型很難產出正確字形,你會得到看起來像中文但完全不成字的東西。

所以繁中使用者的正確用法是:把模型當成「拍畫面的攝影師」,不要把它當成「做平面設計的美編」。所有文字資訊——標題、字幕、產品名、價格——都在後製階段用剪輯軟體疊上去,你才控制得住字體與正確性。如果你想把提示詞寫得更精準,AI 繪圖 prompt 的風格、光影與構圖寫法那一套邏輯可以直接搬過來用在影片提示詞上,運鏡詞彙額外加上去就行。至於靜態圖的工具選擇,另有AI 圖片生成工具的比較可以參考。

第二類:虛擬主播與講稿轉影片

這一類的價值主張很清楚:你不用出鏡、不用打燈、不用重錄,把講稿貼進去就得到一支有人臉在講話的影片。對於做教學內容、內部訓練、產品說明、或是需要同一份內容出多語版本的人,省下的時間非常可觀。但這一類同時是四類裡法律風險最高的,因為它處理的是真人的臉與聲音。

定價(查核日 2026-08-01,一律以官網公告為準)

工具 方案與月費 額度重點 官方定價頁
HeyGen Free 0 元;Creator 每月 29 美元;Pro 每月 49 美元;Business 每月 149 美元(額外席次每席 20 美元);Enterprise 客製 免費方案每月 3 支、每支上限 1 分鐘;Creator 每月 600 點、可移除浮水印、輸出 1080p;Pro 每月 1,000 點、輸出 4K;Business 每月 1,500 點、影片可到 60 分鐘 heygen.com/pricing
Synthesia Basic 免費;Starter 每月 29 美元(年繳折算每月 18 美元);Creator 每月 89 美元(年繳折算 64 美元);Enterprise 客製 免費方案每月 10 分鐘影片;Starter 每月 10 分鐘、個人虛擬人 3 個;Creator 每月 30 分鐘、個人虛擬人 5 個 synthesia.io/pricing
D-ID 官方定價頁未在未登入狀態完整列出各方案金額,僅可見 Trial 與 Lite 方案含浮水印,並另設 API 定價頁 需進入 Studio 或 API 定價頁確認,本文不引用未確認金額 d-id.com/pricing

看這張表的時候請注意計價單位的差異:HeyGen 用點數,Synthesia 用影片分鐘數。點數制的風險是你不容易預估一個月夠不夠用,因為不同的虛擬人模型消耗速率差很多;分鐘制的風險則是它算的是成片長度,你重做三次就是三倍。兩種都建議先用免費方案跑一支真實需求的影片,記錄實際消耗,再回頭推算方案。

授權陷阱:內建虛擬人不能用在付費廣告

這是我在查核過程中最意外的發現,也是這一類最容易讓人踩雷的地方。Synthesia 的官方影片授權說明用一張允許/不允許的對照表明確規定:使用平台內建的 Stock 或 Synthetic 虛擬人與聲音時,允許的用途包括放在自己網站上的教學影片、常見問題影片、產品影片,以及分享到 YouTube、Facebook、Instagram、TikTok 等社群平台;不允許的用途則包括電視廣告、Facebook 付費廣告、Instagram 付費廣告、YouTube 付費廣告、TikTok 與 Snapchat 付費廣告、程式化廣告購買,以及任何形式的付費推廣。另外表上還有一列是「未經許可的電視播送」——注意括號裡的限定,這一條不是絕對禁止,取得 Synthesia 許可就不在此限,跟前面那些「付費廣告」的絕對紅線不同。官方並註明違反規則可能導致帳號被停權,通常會先要求移除或修改影片。

換句話說,同一支影片,你放在自己粉專自然發文是可以的,你按下「加強推廣」把它變成廣告就違反授權。這對接案者是很現實的風險:客戶拿到影片之後多半會想投放,而客戶不會知道有這條限制。官方同時說明,如果改用 Custom Avatar(也就是用真人建立的專屬虛擬人),上述限制就不適用,改為依你與被使用肖像者之間的協議為準——但前提是你必須確認該人士已達法定年齡並且自由、知情地同意其聲音或肖像被使用。

這給了一個很清楚的實務結論:如果影片會被拿去投放廣告,就不要用平台內建的虛擬人,要用有簽同意書的真人虛擬分身。這條規則請寫進你的交付流程與報價單,而不是等出事再說。相關的條款寫法可以參考報價單的欄位結構與著作權歸屬寫法那一篇的做法,把用途限制當成報價前提列出來。

同意機制不是形式,是產品內建的閘門

要用一個真人的臉做虛擬分身,這兩家平台都不是「你上傳影片就好」,而是有強制流程。HeyGen 的說明文件寫明:每一個以影片建立的數位分身都必須先錄一段同意影片,長度控制在 30 秒內,念出平台提供的指定文字,而且同意影片裡的人必須跟分身素材裡的人是同一個人。如果你是幫別人建立分身,同意影片必須由本人錄製——對方不需要跟你在同一個地點,可以掃 QR Code 直接用手機提交。

Synthesia 的個人虛擬人流程更嚴:同意錄影必須由本人現場即時錄製、不能上傳事先拍好的檔案,錄影中要出現畫面上顯示的通行碼。這裡有兩個細節值得講清楚,免得白做工或誤解規則。第一,「不能上傳」只針對同意錄影,拍虛擬人用的素材本身是可以上傳檔案的(官方規格為單一連續鏡頭、約一到五分鐘、檔案 2GB 以內)。第二,年齡不是一律先查:官方寫的是如果你送出的內容被系統標記為需要年齡驗證,才會要求你確認已滿 18 歲。至於個資層面,Synthesia 的隱私權政策把虛擬人建立所涉的資料明列為生物特徵資料與特種個人資料,並引述歐盟 GDPR 與伊利諾州生物特徵隱私法作為需要明示同意的法律依據——這段的出處是隱私權政策,不是上面那篇操作說明。

很多人會覺得這些步驟很煩。反過來看,這其實是幫你把責任邊界畫清楚:平台留下了同意紀錄,代表你不是在偷用別人的臉。但要注意,平台的同意流程保護的是平台,不完全等於保護你。如果你是接案者,替客戶建立以客戶員工為原型的虛擬分身,你自己也應該另外簽一份書面同意書,載明使用範圍、期間、地域、是否可用於付費廣告,以及員工離職後怎麼處理。平台的同意影片沒有這些欄位。

繁體中文支援怎麼驗

這類平台的行銷頁都會標「支援 160 種以上語言」或「175 種以上語言」。這個數字對你的實際決策幫助有限,因為它是語言數量,不是品質。要判斷繁中可用度,唯一的方法是用免費方案跑一段你自己的真實講稿,然後聽以下四件事:

  • 破音字。「重」「行」「長」「都」「還」這些字有沒有念對。這最能看出模型的中文語意理解程度。
  • 數字與單位。「3,500 元」「2026 年 8 月 1 日」「30%」有沒有念成正確的中文讀法,還是逐字念出符號。
  • 中英混排。你的講稿裡一定會有 SEO、Podcast、Wi-Fi 這種詞,聽它是切換成英文發音還是硬用中文拼。
  • 口音。這是台灣讀者最在意也最少被寫的一點。多數平台的中文語音是以中國大陸普通話語料為主訓練的,捲舌、兒化音、以及「視頻」式的語調對台灣觀眾來說會很出戲。沒有任何平台在官方文件上承諾台灣口音,所以只能自己聽。

另外提醒一個容易誤會的地方:這類平台的「語言支援」講的是語音與嘴型,不是字幕的字體。你輸入繁體字,模型輸出的是華語語音,它不會因為你打的是繁體就換一個口音。字幕的繁簡問題屬於後製,要在剪輯階段確認。

第三類:剪輯輔助與長片轉短片,繁中落差最大的一類

雙手放在筆電觸控板上剪輯影片,桌上有筆記本與咖啡杯

這一類本來應該是台灣內容工作者最需要的:你已經有一場一小時的直播、一集 Podcast、一段客戶訪談,需要的是自動上字幕、自動去掉贅字、自動切成十段直式短影音。國外的推薦清單幾乎都會把 Descript 和 Opus Clip 放在前兩名。問題是——這兩個工具的官方文件都告訴你,它們處理不了中文。

Descript:官方明說中文不支援

Descript 的做法是把影片轉成逐字稿,你像編輯文件一樣刪掉一句話,影片就跟著剪掉。這個互動邏輯確實很好用。它的官方支援語言說明寫得非常直白:Descript 可以自動轉錄 26 種語言,但「目前支援的轉錄語言僅限使用拉丁字母的語言。中文、日文、俄文等語言尚未支援,不過這確實是我們未來想加入的」。官方列出的語言表裡確實一個中文選項都沒有。

同一份文件還有兩個容易被忽略的限制:部分編輯與 AI 功能僅支援英文逐字稿,包括贅字偵測、匯入逐字稿、取代逐字稿與轉錄詞彙表;而且每個檔案只能轉錄一種語言,含有多種口說語言的檔案目前不支援。這對台灣的中英混講情境是實質障礙。

Descript 的定價(查核日 2026-08-01,以官網定價頁為準)。這一頁是本文查核時最容易算錯錢的地方:頁面標語寫「年繳最多省 35%」,卡片上顯示的低價是年繳均攤價。以每人每月計,Free 為每月 60 分鐘媒體額度;Hobbyist 月繳 24 美元、年繳均攤 16 美元,600 分鐘;Creator 月繳 35 美元、年繳均攤 24 美元,1,800 分鐘、可輸出 4K;Business 月繳 65 美元、年繳均攤 50 美元,2,400 分鐘、最多 5 個席次;Enterprise 客製。這些數字對做英文內容的人是划算的,對只做繁中內容的人則基本上是零。

Opus Clip:官方語言表沒有中文

Opus Clip 專門做一件事:把長影片自動切成適合社群的短片段,配上動態字幕。它的官方支援語言頁查核當日列出的是 25 種語言(不是「25 種以上」),包含英文、德文、西班牙文、法文、葡萄牙文、義大利文、荷蘭文、俄文、波蘭文、印尼文、烏克蘭文、瑞典文、土耳其文、挪威文、克羅埃西亞文、羅馬尼亞文、斯洛伐克文、希臘文、丹麥文、芬蘭文、匈牙利文、捷克文、日文、韓文、越南文。日文有、韓文有、越南文有,中文沒有,繁體簡體都沒有。頁面另註明多數語言仍在 Beta 階段。

定價(查核日 2026-08-01,以官網定價頁為準):Free 0 元、動態字幕含浮水印;Starter 每月 15 美元、可去浮水印;Pro 每月 29 美元;Business 客製。

CapCut:沒有全球固定價這件事是官方講的

CapCut 在台灣的使用率很高,自動字幕對中文的辨識也堪用,它是這一類裡繁中可行度最高的選項。但它的定價有一個特性值得先講清楚:CapCut 官方說明頁「CapCut Pro 要多少錢」直接寫著,CapCut Pro 的價格會因你所在地區、使用裝置與當下的促銷活動而不同,並沒有全球固定價格,要看最新價格必須登入後在網頁版、桌面版或手機版的訂閱頁面查看。

這是官方自己承認的「同一個產品在不同人眼裡不同價」。所以任何一篇告訴你「CapCut Pro 每月多少錢」的文章,只要沒說明是在哪個地區、哪個裝置、哪個時間點看到的,那個數字對你就沒有參考價值。我在這裡也不編一個給你。

繁中使用者可行的替代動線

既然主流的兩個工具處理不了中文,繁中內容工作者實際可行的動線是把「轉錄」與「剪輯」拆開:

  1. 先用支援中文的語音轉文字服務產出逐字稿。ElevenLabs 的 Scribe v2 官方文件標示支援 90 種以上語言並提供字詞級時間戳與講者分離,這類服務可以輸出帶時間軸的字幕檔。
  2. 把字幕檔帶進剪輯軟體,人工校對專有名詞。中文語音轉文字的錯誤通常集中在人名、品牌名、專業術語,這一段人工校對省不掉,但比從零打字快很多。
  3. 切片段的判斷自己做。Opus Clip 那類工具的核心價值是「幫你找出長片裡哪一段適合當短影音」,這個判斷在中文內容上目前只能靠人。實務上你聽一次逐字稿、標出三到五個有記憶點的段落,效率不會比工具差太多。
  4. 在剪輯軟體裡完成直式構圖與字幕上版。這一步 CapCut 或任何你熟悉的剪輯軟體都做得到。

如果你的主要素材來源是 Podcast,這條動線會是你的常態工作流,設備與託管平台的選擇會直接影響轉錄品質——原始錄音越乾淨,後面每一步都越省事,這部分可以參考Podcast 設備與託管平台的實際門檻。而如果你的目標是一份素材產出多個平台的版本,一稿多用的內容規劃與排程做法可以搭著看。

第四類:配音與語音克隆

這一類的成熟度是四類裡最高的。文字轉語音在中文上的自然度已經到了大部分聽眾不會特別注意的程度,成本也遠低於找配音員。但它同時牽涉到最敏感的東西:一個人的聲音。

ElevenLabs 定價與商用授權門檻

ElevenLabs 的官方定價頁(查核日 2026-08-01,頁面原始碼可見 USD 標示,並註明價格未含各項稅費):Free 0 元、每月 10,000 點;Starter 每月 6 美元、30,000 點;Creator 每月 22 美元、121,000 點;Pro 每月 99 美元、600,000 點;Scale 每月 299 美元、1,800,000 點;Business 每月 990 美元、6,000,000 點;Enterprise 客製。年繳相當於付十個月。

這裡有一個對接案者非常關鍵的門檻:免費方案不含商用授權,商用授權從每月 6 美元的 Starter 方案起才有。語音克隆的層級也是分開的:即時語音克隆從 Starter 起提供,專業語音克隆從 Creator 起提供,更高方案提供更多組專業克隆聲音。也就是說,如果你用免費方案做了一段旁白交給客戶,那是違反授權的——而且每月 6 美元的成本低到沒有任何理由省。

只能複製你自己的聲音

ElevenLabs 的專業語音克隆官方文件寫得很明確:目前只允許你克隆自己的聲音,在送出微調請求之前,你會被要求完成一段驗證程序。官方建議驗證時盡量使用與錄製訓練樣本相同或相近的設備、語氣與表達方式;如果驗證失敗,可以等 24 小時後再試或聯絡客服。文件同時建議訓練音檔至少 30 分鐘,理想是接近 2 到 3 小時,而且必須是單一講者、無背景噪音、風格一致。

另外一個容易被忽略的細節:官方建議用「你將主要使用的那個語言」來錄製樣本。如果你用英文樣本克隆出聲音再拿去講中文,很可能帶著英文口音並且發音錯誤。要做中文旁白,就用中文錄樣本。

中文支援的真相:語言層級不是字體層級

ElevenLabs 的官方模型文件顯示,最新的 Eleven v3 支援 70 種以上語言,其中列有 Mandarin Chinese;Eleven Multilingual v2 支援 29 種語言,列表中包含 Chinese;語音辨識模型 Scribe v2 支援 90 種以上語言。

這裡要講一個所有中文使用者都該理解的觀念:語音模型是「語言」層級的,不是「字體」層級的。官方文件裡不會出現「繁體中文」或「簡體中文」這種選項,因為對語音合成來說,繁體與簡體只是同一種語言的兩種書寫系統,念出來是一樣的音。你把繁體字貼進去,模型讀得懂,輸出的是華語語音。

真正會有差別的是口音與用詞。模型的華語語料以中國大陸為主,所以預設聲音多半偏普通話腔。要拿到接近台灣華語的效果,實務上有兩個做法:一是在官方聲音庫裡試聽篩選(有些社群貢獻的聲音是台灣人錄的),二是自己錄樣本做語音克隆——這也是為什麼專業語音克隆對繁中創作者的價值特別高。另外提醒,用詞層面模型不會幫你換,「視頻」「屏幕」「軟件」這種詞是你稿子裡就要先改掉的,這屬於寫作階段的事。

商用授權與所有權:三個最常被誤解的地方

木桌上放著空白紙張、鋼筆與眼鏡,代表授權條款與同意書

誤解一:「平台不主張所有權」不等於你獨佔

幾乎每一家 AI 工具都會在條款裡寫「我們不主張你的輸出內容的所有權」,很多人看到這句就安心了。但這句話只回答了一半。以 Runway 的使用條款(最後更新 2026 年 5 月 11 日)第 4.4 節為例,它的完整結構是這樣的:公司不主張你的輸入與輸出的所有權;在你遵守協議的前提下,公司不限制你將輸出作商業使用;但你同時承認輸入與輸出可能被公司用於訓練與改進其 AI 模型、演算法與相關技術產品,並且你據此授予公司一項非專屬、不可撤銷、永久、全球、免權利金、已付清、可轉讓、可再授權的權利與授權,以在上述目的下使用你的任何輸入與輸出。條款還提醒,由於人工智慧的性質,輸出可能不是獨一無二的,其他使用者可能產生相似的輸出。

另外第 4.1 節有一句值得注意:除了你的內容與使用者內容之外,公司及其供應商擁有服務以及 Custom Avatars 的一切權利、所有權與利益。也就是說,在該平台上建立的自訂虛擬人,權利歸屬跟你的一般輸出不同。

CapCut 的繁體中文服務條款(最後更新 2026 年 4 月 15 日)也是類似結構,而且寫得更細:「我們對您的使用者內容內容不享有任何所有權」,但當你透過服務提交使用者內容時,即視為授予公司及其關係企業「一項非專屬、免權利金、可轉讓、可再授權、永久且全球適用之使用授權」,用於營運、開發及提供服務。條款另有一段「使用者內容權利放棄」,載明你放棄對相關行銷、廣告或促銷材料事先檢查或批准的權利,並在適用法律允許範圍內放棄公開權與著作人格權。同一份條款還列出責任上限:公司的最大責任總額限於你在索賠前十二個月內支付的金額,或 50 美元(條款原文即以 USD $50 標示)取其高者。

把這三點合起來看,實務結論是:

  • 你可以商用,這通常沒問題。
  • 你不會獨佔,別人可能生成出很像的東西,所以不要把 AI 生成畫面用在商標、Logo 或需要排他性的識別素材上。
  • 你的素材會被拿去訓練,所以客戶的未公開產品、未上市的視覺、機密簡報不要丟進去。這一點如果你的客戶有保密協議,是真實的違約風險。

誤解二:免費方案通常沒有商用授權

這是接案者最容易出事的地方,因為免費方案的「不能商用」往往寫在條款裡而不是介面上,你操作時完全不會被擋。已知的例子:ElevenLabs 的商用授權從 Starter 起才有,免費方案不含;Pika 的免費方案不含商用使用權,付費方案才列出可商用與可去浮水印;HeyGen 的免費方案有支數與長度限制且不含移除浮水印,浮水印移除從 Creator 起提供。

浮水印和商用授權是兩件事,不要混為一談。有些方案可以去浮水印但仍限個人使用,有些方案有浮水印但已經給了商用授權。判斷方式只有一個:去定價頁的功能對照表找「commercial use」或「商業使用」那一列,看你的方案那一格是不是打勾。找不到就去讀條款。

誤解三:平台給你授權,不等於你有著作權

這是台灣讀者最需要知道、但幾乎沒有比較文提到的一層。平台的服務條款只能處理「平台與你之間」的關係,它管不到「你對這份成果有沒有著作權」——後者是各國著作權法的問題。

經濟部智慧財產局在電子郵件 1140522c 函釋(令函日期 114 年 5 月 22 日,網頁更新日期 114 年 7 月 2 日)中說明:依我國著作權法第 3 條第 1 項第 2 款及第 10 條規定,著作人指創作著作之人,著作必須是由自然人所為的創作,才可能受到著作權保護。因此 AI 生成的成果是否享有著作權,要看創作過程中有無人類實際的創意投入。如果只是把 AI 當作輔助工具使用,而有人類實際的創意投入,完成的創作成果仍可受著作權保護,著作權原則上由投入實際創意的自然人享有(僱傭與出資聘用的情形另依第 11、12 條處理);反之,若創作過程完全由 AI 的演算功能獨立完成,沒有人類精神文明的投入,該成果無法享有著作權。

同一份函釋還處理了商業使用的侵權疑慮:如果 AI 生成的成果與訓練資料中的原始著作構成實質近似,後續拿去商業使用可能有侵權問題;智慧財產局建議先向 AI 模型的開發或管理者釐清有無取得著作財產權人的授權、以及能否轉授權第三人商業利用,並應遵循生成式 AI 提供者訂定的使用規範。函釋末段也提醒,著作權屬私權,個案是否受保護、是否侵害他人著作權,仍應由司法機關就個案具體事實調查證據認定。

對接案者來說,這段的實務意義是:如果合約裡寫「本案所有成果之著作財產權歸客戶所有」,而你交付的是純 AI 生成、沒有你實質創意投入的片段,那這個條款可能是空的——因為那份成果本來就沒有著作權可以讓與。這不是文字遊戲,當客戶日後發現有人用了幾乎一樣的畫面而來找你負責時,這個差別會很具體。合約層面的處理方式建議搭配接案合約的必備條款與著作權歸屬那一篇一起看。

本節涉及法律問題,內容僅供一般資訊參考,並非針對個案的法律意見。所引法規與函釋以連結之官方頁面為準,實際案件請洽律師或向主管機關查詢。

訓練資料與肖像權:交付前要處理的五件事

語音克隆與數位分身的核心風險,不在技術而在「這張臉、這個聲音是不是你的」。這一節整理成可執行的檢查項目。

一、任何真人的臉與聲音,都要本人同意

臉部特徵與聲紋在台灣屬於個人資料保護法所稱的個人資料,未經同意蒐集、處理或利用會有法律責任;同時,肖像權與聲音屬於人格權的一環,受民法保護。前面提到的 HeyGen 同意影片、Synthesia 現場同意錄影,都是平台端的最低門檻,不能取代你自己的書面同意。

書面同意書至少要有:被使用人的姓名與簽名、明確的使用範圍(哪些平台、哪些用途)、是否可用於付費廣告、授權期間、地域範圍、能否轉授權給第三方、以及終止與撤回的機制。特別是最後一項,員工離職、代言人合約到期之後,那個數位分身還在不在,要事先講好。

二、不要用公眾人物、也不要用「像某人」

指定真實人物生成影片,除了多數平台的政策明確禁止之外,在台灣同樣可能構成侵害肖像權與人格權。「不指名但做得很像」不是安全牌——判斷侵害的標準是一般人能否辨識,不是你有沒有寫出名字。

三、投入模型的素材,你要有權利

CapCut 的服務條款在「第三方 AI 服務」一節寫得很清楚:該服務部分功能整合了第三方 AI 技術與 API(條款列舉 Runway、Stable Diffusion、Google、YouTube、FLUX、Luma),使用時除受 CapCut 條款規範外,還要遵守各該技術提供者的附加條款;並且明確要求你必須確保擁有所有必要的權利、授權和權限來提供輸入內容,包括任何必要的公開權授權或同意。這條規則其實適用於所有平台:你丟進去的照片、影片、錄音,你要有權利丟。客戶提供的素材也一樣,要在合約裡讓客戶保證他有權提供。

四、把「有沒有用 AI」講清楚

接案時是否揭露使用 AI,取決於客戶的產業與內部規範。有些客戶完全不在意,有些(例如金融、醫療、公部門標案)有明確規定。最安全的做法是在報價階段主動問一句,並把答案寫進合約。事後才被發現,破壞的是信任而不只是條款。關於 AI 在接案流程裡哪些環節能交、哪些不能交,用 AI 工具接案不砸招牌那一篇有更完整的分界。

五、把賠償責任的上限寫進合約

平台的條款普遍把自己的責任壓得很低——前面提過 CapCut 的責任上限是前十二個月付款金額或 50 美元取高者。也就是說,如果生成內容出了問題,平台幾乎不會賠你。這代表風險最後會落在你和客戶之間。實務做法是在合約裡對應處理:明訂你的賠償責任上限(常見做法是以本案報酬總額為上限)、載明客戶提供素材的權利保證,以及素材有問題時的責任歸屬。

四種常見情境的組合建議

把前面的資訊收斂成可以直接照做的組合。以下都假設你是一人作業或小團隊。

情境一:幫客戶做社群短影音,客戶會投放廣告

關鍵限制是「會投放」。所以虛擬主播必須用有簽同意書的真人分身,不能用平台內建的 Stock 虛擬人。生成式畫面選一家有明確商用條款的(Runway 的條款在這點寫得最清楚),配音用 ElevenLabs 的付費方案,剪輯與字幕用 CapCut。整月的固定成本大約落在生成式工具一份加配音一份,先從最低付費階去試,不夠再往上跳。

情境二:做線上課程或內部訓練影片

這是虛擬主播類最划算的情境,因為內容長、需要常更新、而且通常不做付費投放。用 Synthesia 或 HeyGen 建立自己的數位分身,改一次講稿就能重新產出一版,不用重新打燈錄影。要注意計價單位:課程影片長度累積得很快,先估算總分鐘數再選方案,不要用免費方案的體感去推。

情境三:Podcast 或直播轉短影音

這是繁中最卡的情境。Descript 與 Opus Clip 這條路在中文上走不通,實際動線是「支援中文的語音轉文字產出帶時間軸的字幕檔,人工校對專有名詞,自己判斷切片段,剪輯軟體完成直式構圖」。心理上要先接受這一段仍然需要人力,別為了自動化去買一個官方文件明說不支援中文的訂閱。

情境四:電商產品情境圖與短片

生成式模型在這裡最實用:把既有產品照延伸出輕微運鏡、或生成產品放在不同場景的示意畫面,比實際外拍便宜太多。但兩個紅線要守住:畫面裡絕對不要求模型生成產品名稱或包裝上的文字,那些一律後製疊上;以及不要把還沒公開的產品圖丟進去,因為條款普遍允許平台用你的輸入訓練模型。

訂閱前的六個動作

最後把整篇的查核紀律整理成一份可以照跑的清單。這六件事加起來大概十五分鐘,可以省下之後幾個月的錯誤訂閱。

  1. 確認產品還在營運。打開官方定價頁與說明中心,搜尋停止服務相關字眼,並看服務條款的最後更新日期。
  2. 確認幣別。看頁面原始碼的 priceCurrency 欄位,或直接走到結帳頁看實際扣款幣別。不要憑錢字符號猜。
  3. 確認顯示的是月繳價還是年繳折算價。多數定價頁預設顯示年繳視角。
  4. 確認商用授權在哪一階解鎖。找功能對照表的商業使用那一列,不是找浮水印那一列。
  5. 用免費方案跑一次你的真實需求。不是跑官方 demo 的題目,是跑你手上真正要做的那一支,並記錄實際消耗的點數或分鐘數。
  6. 把用途限制寫進報價單。特別是「是否可用於付費廣告」這一條,在客戶簽字前講清楚。

這份清單看起來瑣碎,但它處理的是這個領域最真實的問題:工具變動太快、行銷頁講的跟條款寫的不一樣、而且大部分中文比較文的資料都是抄來的。你自己花十五分鐘查證,準確度就會超過網路上絕大多數的清單。

常見問題

Sora 停止服務之後,還有哪些生成式影片工具可以用?

依 OpenAI 說明中心公告,Sora 的網頁與應用程式已於 2026 年 4 月 26 日停止服務、API 將於 2026 年 9 月 24 日停止。目前仍在營運且有公開定價頁的生成式影片工具包括 Runway、Pika,以及透過 Google Flow 使用的 Veo 系列;可靈(Kling)也仍在營運,但會員方案需登入才看得到價格。選擇時建議以「官方定價頁能不能公開查到」與「服務條款最後更新日期」作為初步篩選,而不是以社群上的生成效果比較影片為準。

AI 生成的影片可以直接交給客戶並主張著作權嗎?

要分兩層看。平台層面,多數工具在付費方案允許商業使用,但通常同時保留把你的輸入輸出用於模型訓練的授權,而且不保證輸出獨一無二。著作權層面,依經濟部智慧財產局電子郵件 1140522c 函釋,成果是否受著作權保護取決於創作過程中有無人類實際的創意投入;完全由 AI 演算獨立完成、沒有人類精神文明投入的成果,無法享有著作權。因此在合約裡承諾把著作財產權讓與客戶之前,先確認那份成果實際上是否存在著作權。以上僅供參考,個案請諮詢律師。

做繁體中文內容,這四類工具裡哪一類最不能用?

目前落差最大的是第三類的長片轉短片與逐字稿剪輯。Descript 官方說明明確表示轉錄語言僅限使用拉丁字母的語言、中文尚未支援;Opus Clip 官方語言表列出的二十多種語言裡有日文、韓文、越南文,但沒有中文。相對地,配音類(ElevenLabs 官方模型文件列有 Mandarin Chinese)與虛擬主播類(各家宣稱支援上百種語言)在中文上是可用的,但口音與破音字仍須自己用免費方案實際試聽確認。

作者 Andes

Andes|長期在台灣以自由接案與自架站維生,內容涵蓋數位遊牧、接案實務與網站經營。寫工具比較時的原則是:所有價格都回官方頁面查、附上查核日期,查不到就誠實說查不到,不從別人的文章裡抄數字。本文所引法規與函釋皆以官方頁面為準,涉及法律與合約的部分僅供一般參考,個案請諮詢專業人士。