語音轉文字工具怎麼選?中文辨識準確度、隱私條款與剪輯工作流

語音轉文字工具怎麼選?本文以 2026 年 8 月 6 日查核的官方定價頁、API 文件與隱私條款,拆解雲端 API、本地 Whisper 與剪輯軟體內建三類引擎的差別:誠實說明為何幾乎沒有廠商公布中文準確率、哪三家在官方文件列出台灣或繁體華語代碼(Google cmn-Hant-TW、OpenAI zh-tw、Adobe Premiere Traditional Chinese)、Descript 轉錄語言不含中文但字幕翻譯清單有、Otter 只輸出簡體且仍標示 beta,並逐條引用 Google 資料記錄同意書、OpenAI 逐端點保留政策與台灣個資法第 4 條,附完整月繳與年繳均攤價格對

石頭落入淺水面盪出同心圓漣漪,旁邊放著一塊素麻布——比喻聲音(漣漪)被轉換成可以攤平閱讀的文字載體(布面)

去年幫一位客戶做一集 78 分鐘的訪談逐字稿,我犯了一個很蠢的錯:我先挑工具,再看條款。工具跑得很快,中文也還可以,交件當天客戶問了一句「這段音檔會不會被拿去訓練?裡面有我們還沒公開的產品名稱」,我當場答不出來。回去翻條款翻了兩個小時,翻到我把整份服務條款印出來畫線。那次之後,我做語音轉文字的順序整個倒過來:先看條款,再看中文表現,最後才看價格。

內容目錄

會這樣調整,是因為這三件事的「錯誤成本」差很多。價格挑錯,你多付幾百塊;中文挑錯,你多花兩小時校稿;條款挑錯,你可能違反跟客戶簽的保密協議,而且是那種事後補救不回來的違反——資料上傳出去了,對方的條款白紙黑字寫著他們可以「永久、不可撤回」地保留。

這篇我把 2026 年 8 月 6 日當天查到的官方定價頁、官方 API 文件、官方隱私與資料處理條款,還有公開的 ASR 論文與資料集頁面,全部攤開來對照。我會誠實講一件很多比較文不敢講的事:絕大多數語音轉文字工具,官方從來沒有公布過中文的錯誤率數字,更沒有一家公布過「台灣華語」的數字。所以你在別的地方看到「中文準確率 98%」這種說法,那個數字幾乎都不是廠商官方講的。

📌 本文重點

  • 三類引擎的差異不在「準不準」,而在資料流向哪裡:雲端 API、本地模型、剪輯軟體內建,各自的條款風險完全不同等級。
  • 官方查得到的中文數字只有兩種:Whisper 論文的逐語言錯誤率表(有註明資料集),以及少數廠商公布的「區間分級」。沒有任何一家公布台灣華語的獨立數字,連 FLEURS 資料集本身都只有 cmn_hans_cn 這個簡體中國口音的分割。
  • Google Cloud Speech-to-Text V1 有兩個價格:開啟資料記錄每分鐘 US$0.016、不開啟每分鐘 US$0.024(2026-08-06 官方定價頁)。開啟後的同意書寫明授予 Google「永久、不可撤回」的使用權,且可「無限期保留」。
  • Descript 的官方轉錄語言清單有 25 種,不含中文(同頁另有含 Chinese 的 61 種「字幕翻譯」與 30 種「配音翻譯」清單,很容易看反);Otter 支援華語但輸出是簡體中文、官方標示仍在 beta,且一次只能設定一種語言。這兩點決定了它們適不適合台灣接案者。
  • 你把客戶的音檔上傳到雲端服務,在台灣法律上你就是受託處理個資的一方;個資法第 4 條規定受託者「視同委託機關」,施行細則第 8 條把委託方該監督的事項列成六款。

先分清楚三種引擎,別把它們放在同一張比較表

三支高度明顯不同的蜂蠟蠟燭立在石板上,燭腳融蠟量各異——比喻雲端 API、本地模型、剪輯軟體內建三種引擎在成本與掌控度上的量體差異

市面上被叫做「語音轉文字工具」的東西,其實是三種完全不同的產品。把它們並排比價格是沒有意義的,因為它們賣的東西不一樣。

第一類是雲端辨識 API,你付的是「每分鐘或每小時的處理費」。代表是 Google Cloud Speech-to-Text、Microsoft Azure AI Speech、OpenAI 的轉錄模型、AssemblyAI。這類服務沒有介面,你要自己寫程式或用第三方前端接。好處是單價低到誇張,壞處是你得自己處理檔案切割、字幕排版、校稿介面。

第二類是本地模型,你付的是「硬體與時間」。OpenAI 開源的 Whisper 系列,以及在它之上長出來的 whisper.cpp、各種桌面封裝 App。音檔完全不離開你的電腦,條款風險趨近於零,但你要接受它跑得慢、要接受你的筆電風扇會叫。

第三類是成品工具與剪輯軟體內建,你付的是「工作流」。Descript、Otter、Notta 這類 SaaS,還有剪輯軟體裡的字幕功能。它們把辨識、校稿、時間軸、匯出全部包在一起,訂閱制計費。這類最貴,但它省掉的是你的時間。剪輯軟體本身怎麼挑、授權與學習曲線怎麼算,我另外寫過一篇,這裡就不重複了。

我自己的判斷方式很簡單:如果這批音檔的內容我不敢貼在公開的地方,它就只能走第二類;如果只是我自己的 Podcast 側錄、公開講座,那第一類最划算;如果我要交付的成品是帶時間軸的字幕檔,第三類省下的工時通常超過它的訂閱費。

一個常被忽略的分界:辨識引擎和「產品」不是同一件事

很多 SaaS 產品底層接的是別人的辨識模型。這在條款上會造成一個尷尬狀況:你同意的是 A 公司的隱私政策,但你的音檔實際上是流到 B 公司的伺服器。Otter 的隱私政策就明列了「人工智慧服務供應商」與「資料標註服務供應商」兩類外部廠商,後者的描述是提供標註服務、並使用 Otter 分享給他們的資料來建立 Otter 產品功能的訓練與評估資料。換句話說,你的音檔有機會被外部標註人員聽到。這種細節只有翻條款才看得到,產品頁上不會寫。

繁體中文與台灣口音:為什麼你查不到一個「準確率百分比」

這是全文我最想講清楚的一段。先講結論:截至 2026 年 8 月 6 日,我沒有找到任何一家商業語音轉文字廠商,在官方文件上公布過針對台灣華語(cmn-Hant-TW)的錯誤率數字。一個都沒有。

能查到官方數字的只有 OpenAI 的 Whisper,因為它是開源模型,論文附錄有完整的逐語言表格。在論文《Robust Speech Recognition via Large-Scale Weak Supervision》的附錄 D 裡,large-v2 模型在 FLEURS 資料集的中文欄位是 14.7,在 Common Voice 9 的中文欄位是 26.8。

但這兩個數字有三個必須一起講的但書,少講任何一個都會誤導人:

第一,那不是詞錯誤率,是字元錯誤率。論文附錄講文字正規化的那一節寫得很清楚:對中文、日文、泰文、寮文、緬文這些不用空格分詞的語言,他們在每個字之間插入空格,「effectively measuring the character error rate instead」,實際上量到的是字元錯誤率。所以 14.7 這個數字不能拿去跟英文的 WER 直接比較。

第二,那個「中文」不是台灣華語。FLEURS 資料集在 Hugging Face 上公開的 103 個子集裡,華語(Mandarin)只有 cmn_hans_cn 一個,也就是簡體、中國大陸口音;另外唯一一個漢語系的子集是粵語 yue_hant_hk(香港)。沒有 cmn_hant_tw。所以那個 14.7 完全不能推論到台灣人講話的情境。

第三,同一個模型換一個資料集,數字差了將近一倍。FLEURS 是朗讀式的乾淨錄音,Common Voice 是群眾錄的、環境雜、口音雜。14.7 對上 26.8,這個落差就是「乾淨錄音」與「真實錄音」的差距。任何人拿一個 benchmark 數字告訴你某工具中文有多準,你都該先問:哪個資料集?

論文本身還講了一件對中文使用者很重要的事:作者觀察到,表現「比訓練資料量所預期的還要差」的最大離群語言,包括希伯來文、泰盧固文、中文與韓文,並推測原因可能是語言距離造成的遷移不足、位元組層級 BPE 分詞器不適合這些語言,或資料品質差異。同一篇論文也提出一個經驗規律:訓練資料每增加 16 倍,錯誤率大約減半;而 Whisper 的總訓練量是 680,000 小時。這代表中文的表現落差不是隨機的,是結構性的。

廠商公布的是「區間」,不是數字

有兩家廠商在官方文件上把語言分級,這比什麼都不講好,但仍然不是可驗證的數字,因為它們都沒有說明用的是哪個資料集

AssemblyAI 的官方文件把 Universal-2 支援的 99 種語言依詞錯誤率分成四組,Mandarin Chinese 落在「Good accuracy(大於 10%、小於等於 25% WER)」這一組。同一份文件的第一組「High accuracy(小於等於 10%)」裡有英文、西班牙文、法文、德文、印尼文、義大利文、日文等,中文不在其中。

ElevenLabs 的 Scribe v2 文件也用同樣的做法,Mandarin(cmn)被放在「High Accuracy(大於 5%、小於等於 10% WER)」,粵語(yue)也在同一組。它的最高一組「Excellent(小於等於 5%)」裡同樣有日文,但沒有中文。

兩家的分組結果並不一致,這正好說明區間分級不能跨廠商比較。沒有共同的資料集、沒有共同的文字正規化規則,兩張表就是兩套自己的量尺。

三個對台灣使用者有實質意義的官方揭露

Google Cloud Speech-to-Text V2 的官方支援語言清單裡,明確列有一個獨立條目:「Chinese, Mandarin (Traditional, Taiwan)」,語言代碼 cmn-Hant-TW,可用於 chirp、chirp_2、chirp_3 三個模型,並分布在 asia-southeast1、europe-west4、us-central1、eu、us 等端點。這是我查到的官方文件裡,把「台灣華語」寫成一個帶地區碼的獨立語言變體、寫得最完整的一家。

但它不是唯一一家,這點我原本也查漏了。OpenAI 的檔案轉錄文件在說明 languages 欄位可接受的格式時,除了 ISO 639-1(en、es、fr)與部分 ISO 639-3(eng、spa、yue、cmn)之外,還明列「Regional zh locale codes, such as zh-cn, zh-tw, and zh-hk——也就是 zh-tw 是官方文件寫明可送的語言代碼,而且文件同時說「The API rejects unsupported or incorrectly formatted language codes」,代表這份清單是會被實際驗證的,不是文案。

第三家是剪輯軟體:Adobe Premiere 官方說明頁「Languages supported by Speech-to-Text」列出的支援語言裡,同時有 Traditional Chinese (Mandarin)、Simplified Chinese (Mandarin) 與 Traditional Cantonese 三個條目;同系列的自動轉錄說明頁還把 Speaker labeling(要不要分離說話者)列為轉錄前的設定選項之一。如果你的交付物本來就是影片字幕,這是唯一一個「繁體中文轉錄+說話者分離+時間軸」在同一套軟體裡走完的選項,不需要再把音檔另外上傳到第三方服務——這對條款風險的意義比省下的訂閱費大得多。

但要注意它的功能欄位。cmn-Hant-TW 在 chirp_2 上列出的功能是自動標點、模型調適(model adaptation)、詞層級信心值與髒話過濾;chirp_3 只有自動標點、模型調適與髒話過濾。兩者都沒有列出說話者分離。也就是說,就算你用了最貼近台灣華語的設定,多人對談要分辨誰在講話,你還是得另外想辦法。

各服務對「中文辨識表現」的官方揭露程度(查核日 2026-08-06,資料皆取自各家官方文件)
服務/模型 官方是否公布中文數字 公布形式與資料集 是否區分台灣華語/繁體
OpenAI Whisper(開源模型) 論文附錄逐語言表;明列 FLEURS 與 Common Voice 9,並說明中文量到的是字元錯誤率 否,FLEURS 僅有 cmn_hans_cn
AssemblyAI Universal-2 區間 官方文件分四級,Mandarin Chinese 在「>10% 至 ≤25% WER」;未註明資料集
ElevenLabs Scribe v2 區間 官方文件分級,Mandarin(cmn)在「>5% 至 ≤10% WER」;未註明資料集 否,另有 Cantonese(yue)
Google Cloud Speech-to-Text V2 官方定價與支援語言頁未公布錯誤率 是,明列 cmn-Hant-TW
Otter 未公布 官方說明文章僅列支援語言 官方標示為 Chinese (Simplified)
Descript 未公布 官方方案頁列出 25 種轉錄語言,其中不含中文 不適用(轉錄語言不含中文)

Descript 這一列有一個極容易搞反的陷阱,要特別講清楚。它的方案比較表上其實有三張不同的語言清單:「Multi-language transcription」寫的是「in 25 languages, including Catalan, Croatian, …, Swedish, and Turkish」,逐個數過去正好 25 個、裡面沒有中文;但同一頁的「Translate captions」寫的是 61 種語言、「Translate audio (dubbing)」寫的是 30 種語言,這兩張清單裡都有 Chinese。意思是:Descript 可以把你的英文字幕翻成中文,但它不能把中文語音轉成中文逐字稿。看到官網上的「Chinese」就以為能轉錄中文,是這個工具最常見的誤買原因。

這張表要傳達的重點只有一個:如果你的判斷依據是「哪家最準」,你在現有的官方資訊下根本做不了這個判斷。可以做的判斷是「哪家有把繁中台灣當一回事」,而這一題目前有 Google、OpenAI 與 Adobe Premiere 三家給出明確答案。剩下的,就是自己拿三分鐘的實際音檔去跑一輪。這跟我在挑繁中 AI 寫作工具時的結論一樣:官方沒有的數字,就自己測,不要相信轉述。

怎麼自己做一次可信的比較

我的做法是準備一段三到五分鐘、內容我自己完全掌握的音檔,條件盡量貼近真實工作:有背景聲、有兩個人、有中英夾雜、有客戶產業的專有名詞。然後同一段丟進所有候選工具,人工數錯誤。

數錯誤的時候要分類,不要只算總數。我分四類:漏字或吞字、同音錯字、專有名詞錯、英文詞被硬翻成中文。這四類的修復成本天差地遠——同音錯字用搜尋取代五秒解決,專有名詞錯如果你沒注意到,就會整份稿子錯到底。

還有一件很容易被忽略的:標點與斷句。中文沒有空格,斷句錯了整段語意會變。有些工具中文字都對,但一句話斷成三句,你校稿的時間反而比字錯還久。

中英夾雜與專有名詞:台灣使用者的真正痛點

台灣人講話的中英夾雜密度很高。「我們先跑一下 A/B test,然後看 conversion 有沒有變化」——這種句子對辨識引擎是很殘忍的考驗,因為它得在句子中途切換語言模型。

這件事在官方文件上是有明確答案的,而且答案差很多。

Otter 的官方說明文章直接寫死了限制。那篇文章的標題就是支援英語、西班牙語、法語、德語、日語或簡體中文轉錄,內文寫著 Otter 一次只能用一種語言轉錄,如果會議或錄音有不同語言,你必須在會議或錄音開始前先選好對應語言。文章另外提到唯一的例外是法語與英語可以同時轉錄:把預設語言設為法語,系統偵測到英語時會自動切換。中英夾雜不在這個例外裡。同一篇還有一句更該注意的:「German and Chinese (Simplified) are currently still in beta.」——德文與簡體中文目前仍標示為 beta。該篇文章的官方最後更新時間是 2026 年 6 月 7 日。

AssemblyAI 反過來,把中英夾雜當成賣點寫進文件。它的 Code Switching 文件說明 Universal-3.5 Pro 原生處理 18 種語言之間的語碼轉換,把 language_detection 設為 true,模型會跟著說話者在句中切換語言,「保留實際說出的內容,而不是把所有東西翻譯成單一語言」。文件裡直接列出三組示範,其中一組就是英語與華語互換的句子。這是我查到唯一一家把中英夾雜寫進官方功能文件、並附上實例的服務。

OpenAI 的做法是給你參數自己調。它的檔案轉錄文件說明,gpt-transcribe 可以搭配 promptkeywordslanguages 三個欄位來改善專有名詞與多語音訊的轉錄;其中 languages 取代了舊的單數 language 欄位,兩者不能同時送。文件也警告:關鍵字要一行一個、不能含小於號大於號或換行,違反的話整個請求會被拒絕。舊的 whisper-1 也支援 prompt,但有 224 個 token 的上限,控制力明顯比較差。

專有名詞:這是要另外付錢的功能

幾乎所有專業級服務都提供某種形式的「詞彙偏好」,讓你事先餵入品牌名、人名、產品代號。但這在多數服務上是加購項目,而且加購價通常沒有寫在主要方案頁上。

AssemblyAI 的定價頁把加購項目列得很清楚:關鍵詞提示(Keyterms Prompting,最多 1000 個詞或片語、每個片語最多 6 個字)在 Universal-3.5 Pro 上是每小時 US$0.05,在 Universal-2 上則是內含;用自然語言描述音訊情境的 Prompting 功能在 Universal-3.5 Pro 上是每小時 US$0.05,Universal-2 不支援。

ElevenLabs 的 Scribe 文件說關鍵詞提示在批次模式最多 1000 個關鍵詞(每個 50 字元)、即時模式最多 50 個(每個 20 字元),並註明「關鍵詞提示與實體偵測會額外計費」。

Google 這邊叫做 model adaptation(模型調適),前面提過 cmn-Hant-TW 在 chirp_2 與 chirp_3 上都支援這個功能。

Notta 則有一個對台灣使用者很關鍵的限制:它的方案比較表裡,「自訂詞彙」這一列的標題直接寫成 Customize vocabulary (English & Japanese),也就是自訂詞彙功能只涵蓋英語與日語。如果你需要餵中文專有名詞,這條路在 Notta 上是走不通的。

如果你接的案子牽涉客戶的內部術語,我會建議在報價時把「建詞彙表」當成一個獨立工項算進去。這跟用五種定價模型拆解接案報價的邏輯是一樣的:看得見的工序才收得到錢。

說話者分離:多人對談的分水嶺

三股粗麻繩分別平行攤在灰白舊木板上,纖維紋理清晰——比喻說話者分離把混在一起的多人語音拆成各自獨立的段落

單人 Podcast 獨白不需要說話者分離,訪談和會議需要,而且它是決定「這份稿子能不能直接用」的關鍵。沒有說話者標記的訪談逐字稿,等於你還要從頭聽一遍。

官方文件上的狀況是這樣的:

OpenAI 有一個專門的模型在做這件事。檔案轉錄文件寫明,只有在你需要辨識錄音中不同段落由誰發言時,才使用 gpt-4o-transcribe-diarize,並且它「不是一般檔案轉錄的建議模型」。用法是請求 diarized_json 回應格式,會拿到帶有 speaker、start、end 中繼資料的段落;超過 30 秒的音訊要把 chunking_strategy 設成 auto 或語音活動偵測設定。文件也明確說 gpt-4o-transcribe-diarize 不支援 prompt——所以你不能同時要說話者分離跟專有名詞提示,這是二選一。價格方面,官方定價頁把 gpt-4o-transcribe-diarize(轉錄+分離)列為每分鐘 US$0.006,跟 gpt-4o-transcribe 同價,也就是分離本身在 OpenAI 這邊沒有額外加價,貴的是你要放棄 gpt-transcribe 每分鐘 US$0.0045 的價格。

AssemblyAI 把它當加購功能,價格很透明:Speaker Diarization 在 Universal-3.5 Pro 與 Universal-2 上都是每小時 US$0.02。它的定價頁還特別強調 Universal-3.5 Pro 是「我們目前最準確的說話者分離」。

Azure 的做法是把分離放進「增強功能」,而且即時與批次的收費完全不同。官方定價頁的 Speech Model Prices 區塊把「連續語言辨識(Continuous Language identification)、說話者分離(Diarization)、發音評估(韻律)」列為 Enhanced add-on features,後面接的是兩行不同的價:即時每小時、每項功能 US$0.30;批次的連續語言辨識與說話者分離則寫明「Included in Standard/Custom (no extra charge)」——批次模式的說話者分離是不另外收費的(查核日 2026-08-06,區域選 East US;改選 Japan East 顯示同價)。也就是說,如果你做的是逐字稿後製而不是即時字幕,Azure 的說話者分離成本是零;只有走即時轉錄才會被加收那 US$0.30,那時它確實高達主功能(每小時 US$1.00)的三成。

Descript 的方案比較表把它列成內建功能:偵測 8 位以上說話者、由 Speaker Detective 播放每位說話者的片段讓你命名;另有多軌轉錄,可以把分開錄的軌各自轉錄以取得更精準的說話者標記。

而前面提過的那個坑要再說一次:Google Cloud Speech-to-Text V2 的支援語言清單上,cmn-Hant-TW 在 chirp、chirp_2、chirp_3 都沒有列出說話者分離。AssemblyAI 的文件則說明了一個很實務的陷阱:如果你用 language_code 手動指定語言,而該語言不支援你啟用的功能,API 會直接回傳錯誤(例如「The following models are not available in this language: speaker_labels」);但如果你用自動語言偵測,請求會正常完成,不支援的功能會被靜默地從回應中略過

這個「靜默略過」是會出事的。你以為你要到了說話者標記,結果回傳的東西裡根本沒有,而系統沒有報錯。AssemblyAI 自己建議的做法是檢查回應中的 language_codelanguage_confidence 欄位來確認。如果你把逐字稿當成交付物在賣,這種驗證步驟應該寫進你的AI 工具交付前的自檢清單裡。

時間軸與字幕格式:SRT/VTT 怎麼拿到

逐字稿和字幕是兩種東西。逐字稿是純文字,字幕要有時間碼、要切成每行不超過螢幕寬度的長度。如果你的交付物是字幕檔,時間軸的取得方式會直接決定你選哪個服務。

OpenAI 這邊有一個很多人踩到的細節:字幕格式與逐字時間戳記要用舊的 whisper-1 模型,新的模型反而沒有。官方檔案轉錄文件開頭就寫:建議從 gpt-transcribe 開始,只有在你需要說話者標記、逐字時間戳記、字幕格式或翻譯成英文時,才使用專門模型。時間戳記那一節更直接:「Use whisper-1 when you need word or segment timestamps」,並以 timestamp_granularities[] 參數搭配 whisper-1 作為官方範例——需要逐字或逐段時間戳記時,官方指定的就是這個舊模型。

另一個硬限制是檔案大小。OpenAI 的 Transcriptions API 接受最大 25 MB 的檔案,支援 mp3、mp4、mpeg、mpga、m4a、wav、webm 格式。文件建議超過就改用壓縮格式或切成 25 MB 以下的片段,並提醒「避免在句子中間切割,這會移除上下文並降低準確度」。

相對地,ElevenLabs 的 Scribe 文件寫明支援最大 3 GB 的檔案,標準模式最長 10 小時。一個 90 分鐘的訪談,在 OpenAI 上你要自己寫切割邏輯,在 Scribe 上直接丟。這種差異在挑工具時比單價重要得多。

本地方案這邊,Whisper 官方命令列工具與 whisper.cpp 都可以直接輸出字幕格式,這也是我做字幕時偏好走本地的原因之一——不用管檔案大小上限,也不用管每分鐘計費。

中文字幕還有一層工,工具幫不上忙

就算時間軸完全正確,中文字幕還是要人工調整。原因是中文沒有空格,自動斷行常常把一個詞拆兩行;還有專有名詞的全形半形、英文縮寫要不要留原文、數字要用國字還是阿拉伯數字。這些都是編輯決策,不是辨識問題。

我的處理順序是:先拿到帶時間碼的原始稿 → 全文校對文字 → 最後才調斷行。順序反過來會做兩次白工,因為改字會讓行長跑掉。如果你的字幕還要做多語版本,那又是另一個層次的工程,我在多語系內容的架構取捨裡談過相同的權衡邏輯;而翻譯品質本身的計價與現實,翻譯接案那篇講得更完整。

隱私與資料使用條款:這一段請逐條看

兩個素麻布束口袋放在濕石板上,一個用麻繩打結束緊、一個敞開空著——比喻資料留存與資料不留存這兩種條款選項的差別

接案者的實害級議題在這裡。前面所有的準確度討論,如果你的客戶明文禁止素材外流,那就全部作廢。以下每一段我都盡量引官方條款原文,因為這種事轉述會失真。

Google Cloud:兩個價格,就是隱私的價目表

這是全篇我認為最值得記住的一個對照。Google Cloud Speech-to-Text 的官方定價頁上,V1 API 有兩個並列的 SKU:

  • Speech Recognition(with data logging):每月前 60 分鐘免費,超過每分鐘 US$0.016
  • Speech Recognition(without data logging):每月前 60 分鐘免費,超過每分鐘 US$0.024

不讓 Google 記錄你的音檔,每分鐘要多付 US$0.008,也就是貴 50%。這不是解讀,這是官方定價頁上兩個並排的 SKU(查核日 2026-08-06)。

那便宜的那一個,你同意了什麼?Google Cloud 的官方文件頁「Terms for opt-in for data logging」是一份《Consent Addendum to Google Cloud Platform License Agreement》。它定義「Customer Training Data」為你在開啟資料記錄選項時透過 Cloud Speech API 提供給 Google 的客戶資料(以及由這些資料衍生的文字檔)。然後:

  • 用途(Purpose)寫的是讓 Google「develop, improve and model Google’s machine learning technology」,也就是開發、改進與建模 Google 的機器學習技術。
  • 授權條款寫的是:客戶授予 Google「the perpetual, irrevocable right to use, de-identify and copy the Customer Training Data」——永久、不可撤回的使用、去識別化與複製權。
  • 保留期限寫的是:「Google may retain the Customer Training Data indefinitely」——Google 得無限期保留
  • 撤回同意那一段特別註明:你按下「Disable data logging」之後,在此之前已記錄的資料仍會由 Google 繼續保留,而且只對該專案生效,其他仍開啟的專案照記不誤。
  • 存續條款寫的是:本增補協議授予的權利在 GCP 協議終止或到期後繼續存續
  • 同意分享的對象包含 Google 的關係企業、第三方廠商與承包商(受保密協議拘束)。

我把這幾條列出來不是要說 Google 有問題——他們把條款寫得非常清楚,而且給了你多付 50% 換取不記錄的選項,這比很多不給選項的服務誠實得多。我要說的是:這種等級的授權,如果音檔是客戶的,你沒有資格代替客戶同意。

OpenAI API:預設不拿去訓練,而且轉錄端點連濫用監控紀錄都不留

OpenAI 官方的「Data controls in the OpenAI platform」文件開宗明義寫著:自 2023 年 3 月 1 日起,送到 OpenAI API 的資料不會被用來訓練或改進 OpenAI 的模型,除非你明確選擇加入分享資料。這是 API 端的政策,跟消費端的 ChatGPT 產品不是同一套規則,這點務必分清楚。

但「不訓練」不等於「不儲存」。同一份文件說明,使用 API 時資料可能以兩種形式儲存:濫用監控紀錄(abuse monitoring logs)與應用程式狀態(application state)。濫用監控紀錄可能包含提示與回應等客戶內容,總則寫的是預設會針對所有 API 功能的使用產生,並保留最多 30 天,除非法律要求更長,或為保護服務與第三方免於損害而有合理必要。

但總則不等於你用的那個端點——這篇要講的轉錄端點是例外,而且是好的那種例外。同一份文件下方有一張逐端點的保留期表格,欄位依序是端點、資料是否用於訓練、濫用監控保留期、應用程式狀態保留期、是否適用零資料保留。/v1/audio/transcriptions 那一橫排的值是:訓練=No、濫用監控保留=None、應用程式狀態保留=None、零資料保留適用=Yes/v1/audio/translations 同樣是 None)。對照之下 /v1/chat/completions 是 30 天、/v1/audio/speech(語音合成)也是 30 天。換句話說,走轉錄端點時那 30 天並不適用,音檔與逐字稿預設不會被留在濫用監控紀錄裡。這是我查完全部條款之後,對接案者最實用的一個發現。

如果你還要更嚴格的保證,文件寫明有兩個控制項:Modified Abuse Monitoring 與 Zero Data Retention(零資料保留)。前者把客戶內容排除在濫用監控紀錄之外;後者除了同樣排除之外,還會強制把 /v1/responses/v1/chat/completionsstore 參數視為 false,即使請求試圖設成 true。這兩個控制項「目前需要 OpenAI 事前核准並接受額外要求」,文件請你聯絡業務團隊詢問資格,個人接案者實務上拿不到;但就轉錄這個用途而言,預設值本身已經是 None,你不必為了它去談合約。

Otter:訓練用途寫在條款裡,退出要走隱私請求而不是產品開關

Otter 的隱私政策(生效日 2026 年 6 月 16 日)在資料用途的表格裡,有一列寫著:改進與監控服務,「including training our proprietary AI technology on de-identified audio recordings and on transcriptions (which may contain Personal Information)」——包含用去識別化的錄音,以及可能含有個人資料的逐字稿,來訓練 Otter 自有的 AI 技術

這一列同一橫排的「Legal Basis for Processing」欄位寫的是「Consent or Legitimate interests. We may process your Personal Information where we or a third party have a legitimate interest, when this interest is not overridden by your rights and interests.」——同意,或正當利益。(表格上方兩列「Set up your account」與「Provide you with the Services」用的才是 Contractual necessity;這張表欄位很多,讀的時候要確認自己對到的是同一橫排。)

法律依據是「同意或正當利益」而不是「契約必要性」,實務差別在於你有路可走:同一份政策的第 6 節「YOUR RIGHTS」明列 Withdraw consent(撤回你先前給予的同意,僅對之後生效)與 Object to processing(在對方依正當利益處理時提出反對),但開頭就寫著「Depending on where you live and subject to certain exceptions」——這些權利依你的居住地而定,台灣使用者不必然涵蓋在內

要注意的是,這些是要另外提出隱私請求才會啟動的權利,不是產品設定裡一個可以自己關掉的開關;我把整份政策讀完,介面層級唯一明確給出的退出連結是 Google Analytics 的退出工具與瀏覽器 Cookie 設定(查核日 2026-08-06)。同一份政策的廠商清單裡,還列有「Data labeling service providers who provide annotation services and use the data we share to create training and evaluation data for Otter’s product features.」——提供標註服務、並使用 Otter 分享的資料建立產品功能的訓練與評估資料。

Descript:也會拿去訓練,但有一個你可以自己關的開關

Descript 的隱私政策在用途清單裡寫了「Personalize and improve the Descript Service and for research and development purposes including training our artificial intelligence models」,也就是包含訓練其人工智慧模型。

但它另外有一段專門針對「Projects」(你在 Descript 裡建立的專案)的說明,這段比較友善:政策說 Descript 依服務條款的保密義務把 Projects 當作機密資訊處理並限制使用;服務會自動處理你的 Projects,但不涉及人工存取,除非你提供同意或法律要求。接著寫:「We may also use your Projects to analyze and improve the Descript Service. You can opt out of having your Projects used to improve the Descript Service by disabling the Share Data with Descript setting.」——你可以透過關閉「Share Data with Descript」設定來退出。

另外,Descript 的方案頁在 Enterprise 欄位列有「AI and data controls: opt-out of training, custom retention」與「SOC 2 Type II: SSO, SCIM, and audit logs」,也就是更完整的訓練退出與自訂保留期是企業方案的項目。政策層級的那個開關則是所有人都能用的。

台灣法規:你上傳客戶音檔的那一刻,你的身分是什麼

這一段是台灣接案者最容易漏掉的。個人資料保護法第 4 條的條文是:

受公務機關或非公務機關委託蒐集、處理或利用個人資料者,於本法適用範圍內,視同委託機關。

你替客戶處理含有個人資料的錄音,你在個資法上「視同委託機關」,也就是責任跟客戶自己做是一樣的。不是「幫忙處理一下」就沒事。

個人資料保護法施行細則(修正日期民國 105 年 3 月 2 日)第 8 條第 1 項規定「委託他人蒐集、處理或利用個人資料時,委託機關應對受託者為適當之監督」,並在第 2 項把監督範圍列成六款,其中幾款直接命中雲端轉錄的情境:

  • 第一款:預定蒐集、處理或利用個人資料之範圍、類別、特定目的及其期間。
  • 第三款:有複委託者,其約定之受託者。你把音檔丟給雲端 API,那就是複委託。
  • 第四款:受託者或其受僱人違反本法、其他個人資料保護法律或其法規命令時,應向委託機關通知之事項及採行之補救措施。
  • 第六款:委託關係終止或解除時,個人資料載體之返還,及受託者履行委託契約以儲存方式而持有之個人資料之刪除。案子結束後,你在雲端服務上的音檔與逐字稿要刪掉。

同細則第 12 條把「適當之安全措施」定義為技術上及組織上之措施,並列了十一項可包含事項,包括事故之預防通報及應變機制、資料安全管理及人員管理、使用紀錄軌跡資料及證據保存等,並以「與所欲達成之個人資料保護目的間,具有適當比例為原則」。

非公務機關的安全維護義務規定在個資法第 27 條第 1 項:「非公務機關保有個人資料檔案者,應採行適當之安全措施,防止個人資料被竊取、竄改、毀損、滅失或洩漏。」

這裡有一個查核時務必注意的版本問題:個資法在民國 114 年 11 月 11 日有一次修正公布,其中包含刪除第 27 條、增訂第 1-2、20-1、21-1 至 21-5 條等,但該次修正的施行日期依規定「由行政院定之」。全國法規資料庫上該法規的生效狀態標示為「本法規部分或全部條文尚未生效」、生效日期「未定」(查核日 2026-08-06)。我另外用兩個獨立來源交叉確認過:個人資料保護委員會籌備處當日的新聞稿寫的是「本次修正條文施行日期將另由行政院定之」,臺北市法規查詢系統上的同一部法規也標示「本法規部分或全部條文尚未施行,最後施行日期:未定」。也就是說,第 27 條的刪除尚未施行,第 27 條目前仍然有效。如果你在網路上看到有人說個資法第 27 條已經刪除,請自己去全國法規資料庫確認施行狀態。

另外,個資法第 6 條第 1 項規定病歷、醫療、基因、性生活、健康檢查及犯罪前科等個人資料原則上不得蒐集、處理或利用,僅在但書所列六款情形下才有例外。如果你接的是醫療、心理諮商、法律相關的訪談錄音,門檻完全不同,不能用一般案子的標準處理。

責任面,個資法第 29 條第 1 項規定非公務機關違反本法致個人資料遭不法蒐集、處理、利用或其他侵害當事人權利者,負損害賠償責任,「但能證明其無故意或過失者,不在此限」。這是舉證責任倒置——要免責,是你要證明自己沒有故意過失,不是對方要證明你有。

把這些變成可執行的動作

我現在的做法固定成四條:

第一,開案前先問客戶一句:「這批素材可以上傳到境外雲端服務嗎?」把回答寫進書面。這一句話花你三十秒,但它決定了你後面所有的工具選擇。這件事應該跟NDA 裡的機密定義一起確認,因為很多 NDA 的機密資訊定義寬到包含「任何以口頭方式揭露的資訊」。

第二,把使用的服務名稱寫進合約或報價單。不是為了免責,是為了讓客戶知情。接案合約的必備條款裡本來就該有一條處理第三方工具的使用。

第三,案子結案後刪除雲端上的音檔與逐字稿,並留下刪除紀錄。這直接對應施行細則第 8 條第 2 項第 6 款。順手把服務端的帳號權限也一起檢查一次,做法可以參考客戶帳密交接與離場撤銷的流程

第四,敏感案子一律走本地模型,不要例外。沒有「這次應該還好」這種事。你在管理客戶資料的系統上花的心思,應該同等地花在音檔上。

定價:月繳、年繳均攤,還是按分鐘計費

這一段我特別小心,因為訂閱制產品的定價頁幾乎都預設顯示「年繳均攤後的月價」,看起來比實際的月繳價便宜很多。下面每一筆我都標明了計費方式。

先看一個最直白的例子。Notta 的定價頁在加購服務區塊,把兩種價格寫在同一段:Monolingual Translation 顯示 US$6/月、年繳總額 US$72,然後直接註明「The above price is the monthly cost for annual billing. Monthly plan cost: $10 USD/month」——年繳均攤 US$6,實際月繳 US$10,差 67%。這就是為什麼看到訂閱價一定要先確認計費週期。

語音轉文字服務官方定價(查核日 2026-08-06,幣別已標明;用量型服務未含加購功能)
服務/方案 計費方式 官方價格 免費額度與備註
Google Cloud STT V2 標準模型 按分鐘(依用量分級) US$0.016/分鐘(每月 0–50 萬分鐘級距) 50 萬至 100 萬分鐘為 US$0.01、100 萬至 200 萬為 US$0.008、200 萬以上為 US$0.004
Google Cloud STT V2 動態批次 按分鐘 US$0.003/分鐘 以較低急迫性處理音訊,換取折扣費率
Google Cloud STT V1(開啟資料記錄) 按分鐘 US$0.016/分鐘 每月前 60 分鐘免費
Google Cloud STT V1(不開資料記錄) 按分鐘 US$0.024/分鐘 每月前 60 分鐘免費;比開啟資料記錄貴 50%
Azure AI Speech 標準即時轉錄 按小時 US$1.00/小時 官方定價頁 Speech Model Prices(區域 East US;Japan East 同價)
Azure AI Speech 標準批次轉錄 按小時 US$0.18/小時 同上;批次比即時便宜約八成
Azure AI Speech Fast Transcription 按小時 US$0.36/小時 同上
Azure AI Speech 增強功能(含說話者分離) 按小時、按功能 即時 US$0.30/小時/項;批次 US$0 批次的連續語言辨識與說話者分離官方標示為內含、不另計費
Azure AI Speech 免費層 F0 US$0 即時轉錄每月 5 小時免費;標準與自訂共用,不支援批次
OpenAI gpt-transcribe 按分鐘 US$0.0045/分鐘 官方定價頁列為建議的轉錄模型
OpenAI gpt-4o-transcribe 按分鐘 US$0.006/分鐘 官方另列每百萬 token 輸入 US$2.50、輸出 US$10.00
OpenAI gpt-4o-mini-transcribe 按分鐘 US$0.003/分鐘 官方另列每百萬 token 輸入 US$1.25、輸出 US$5.00
OpenAI gpt-4o-transcribe-diarize 按分鐘 US$0.006/分鐘 官方標示用途為「轉錄+說話者分離」
AssemblyAI Universal-3.5 Pro 按小時 US$0.21/小時 支援 18 種語言與原生語碼轉換
AssemblyAI Universal-2 按小時 US$0.15/小時 支援 99 種語言
AssemblyAI 說話者分離加購 按小時 US$0.02/小時 兩個模型皆適用
Descript Hobbyist 訂閱 年繳均攤 US$16/人/月;月繳 US$24/人/月 每月 600 媒體分鐘(10 小時)、400 AI credits
Descript Creator 訂閱 年繳均攤 US$24/人/月;月繳 US$35/人/月 每月 1,800 媒體分鐘(30 小時)、800 AI credits
Descript Business 訂閱 年繳均攤 US$50/人/月;月繳 US$65/人/月 每月 2,400 媒體分鐘(40 小時)、1,500 AI credits
Otter Basic 免費 US$0 每月 300 轉錄分鐘、終身 3 次檔案匯入
Otter Pro 訂閱 月繳 US$16.99/人/月;年繳均攤 US$8.33/人/月(官方標示省 51%) 每月 1,200 錄音分鐘、10 次檔案匯入、單場最長 90 分鐘
Otter Business 訂閱 月繳 US$30/人/月(頁面另掛「20% off for 3 months」限期促銷 US$24);年繳均攤 US$19.99/人/月(官方標示省 33%) 單場最長 4 小時
Notta Free 免費 US$0 每月 120 轉錄分鐘、單次最長 3 分鐘、50 次檔案上傳
Notta Pro 訂閱 月繳 US$13.49/月;年繳均攤 US$8.17/月(年繳總額 US$97.99) 每月 1,800 轉錄分鐘、單次最長 5 小時、每月 100 次檔案上傳
MacWhisper Free 免費 EUR 0 本地執行
MacWhisper Pro 一次買斷 EUR 64/授權 官方標示含終身更新

幾個從這張表看出來的判斷:

用量型比訂閱型便宜一到兩個數量級,但你要自己補工作流。用 Google 動態批次跑 30 小時音訊是 1,800 分鐘 × US$0.003 = US$5.4;Descript Creator 方案同樣是每月 30 小時,年繳均攤是 US$24/月、月繳是 US$35/月。差價買的是介面、校稿環境、字幕排版與匯出。你一個月要處理的量越少,訂閱越不划算;量越大、又願意寫一點腳本,用量型的優勢越明顯。

「批次」是最被低估的省錢開關。Azure 批次 US$0.18/小時對上即時 US$1.00/小時、Google 動態批次 US$0.003/分鐘對上標準 US$0.016/分鐘——只要你不需要即時字幕,切到批次模式就能省下八成左右。而且 Azure 的說話者分離在批次模式下是內含的,即時模式才要每小時每項多付 US$0.30,這一項的差距比費率本身還大。做 Podcast 後製、做逐字稿,本來就沒有即時需求。

訂閱制真正的限制不是價格,是額度單位。Otter Pro 的 1,200 分鐘是「錄音分鐘」、另外只給 10 次檔案匯入;Descript 的額度是「媒體分鐘」,包含匯入或錄製進 Descript 的所有媒體。如果你的工作流是把外部錄好的檔案丟進去,匯入次數上限會比總分鐘數更早卡死你。這種額度結構跟接案平台的抽成級距一樣,帳面費率不是重點,級距怎麼設計才是。

本地跑 Whisper:硬體門檻與實際取捨

如果你的結論是「敏感案子只能本地跑」,那就要面對硬體這一關。好消息是門檻比大部分人想的低。

OpenAI 官方 Whisper 儲存庫的 README 有一張模型表,列出六種尺寸與各自的近似記憶體需求與相對速度:

Whisper 官方模型尺寸與所需 VRAM(資料來源:OpenAI Whisper 官方 README,查核日 2026-08-06)
模型 參數量 所需 VRAM(近似) 相對於 large 的速度
tiny 39 M 約 1 GB 約 10 倍
base 74 M 約 1 GB 約 7 倍
small 244 M 約 2 GB 約 4 倍
medium 769 M 約 5 GB 約 2 倍
large 1550 M 約 10 GB 1 倍
turbo 809 M 約 6 GB 約 8 倍

官方 README 對 turbo 的描述是:large-v3 的最佳化版本,提供更快的轉錄速度,準確度只有極小幅度的下降。對中文轉錄來說,turbo 大概是目前最合理的預設選擇——它的記憶體需求只有 large 的六成,速度是八倍。但 README 也警告:turbo 沒有針對翻譯任務訓練,即使指定 --task translate,turbo 仍會回傳原語言,要翻譯成英文得用 medium 或 large。

那張 VRAM 表講的是官方 PyTorch 實作。實務上大多數人跑的是 whisper.cpp,它的記憶體需求低得多。whisper.cpp 官方 README 的記憶體表列出:large 模型磁碟佔用 2.9 GiB、執行時記憶體約 3.9 GB;medium 是 1.5 GiB 與約 2.1 GB;small 是 466 MiB 與約 852 MB。官方 PyTorch 版 large 要約 10 GB VRAM,whisper.cpp 的 large 約 3.9 GB 記憶體就能跑。這個差距足以讓一台一般規格的筆電從「跑不動」變成「跑得動」。

whisper.cpp 的 README 還說明它把 Apple Silicon 當作一等公民,透過 ARM NEON、Accelerate framework、Metal 與 Core ML 最佳化;在 Apple Silicon 裝置上,編碼器推論可以透過 Core ML 在 Apple Neural Engine 上執行,README 寫的效果是「相較純 CPU 執行可快超過 3 倍」,但也提醒第一次在裝置上執行會比較慢,因為 ANE 服務要把 Core ML 模型編譯成裝置專屬格式。此外 README 提到量化模型需要更少的記憶體與磁碟空間,依硬體不同還可能處理得更有效率。

不想碰指令列的話,桌面封裝 App 是一條路。以 MacWhisper 為例,官方網站列出 Free 方案 EUR 0,Pro 方案是一次性付費 EUR 64 一份授權,並標示含終身更新。注意幣別是歐元不是美元,而且它是買斷而非訂閱——用一年就回本的機率很高。

本地方案真正的成本不是硬體,是時間

我實際的感受是:硬體門檻現在幾乎不是問題,真正的成本是「等」。一小時的音檔在筆電上跑 large 級模型,你要等的時間是以十分鐘為單位計算的,而雲端 API 通常幾分鐘內就回來。

所以我的分工是:敏感、可以晚點交的,睡前丟本地跑;不敏感、要立刻看到結果的,走雲端。這也牽涉到你的工作環境穩定度——長時間的本地運算最怕跑到一半當機重來,我在哪些環節能交給 AI那篇提到的原則同樣適用:能自動化的就自動化,但要有失敗時的回復路徑。

還有一個本地方案的隱藏優勢常被忽略:沒有檔案大小上限、沒有單場時長上限、沒有匯入次數上限。前面提到 OpenAI 的 25 MB 上限、Otter Pro 的每場 90 分鐘與每月 10 次匯入,這些限制在本地都不存在。如果你的素材本來就是長訪談,光是這一點就足以讓本地方案勝出。

四種常見情境,我會怎麼組

情境一:個人 Podcast 主,要逐字稿做節目摘要與 SEO 文章。內容本來就要公開,沒有保密壓力。我會走用量型 API 的批次模式,成本低到可以忽略;或直接本地跑 turbo 模型。省下來的錢拿去買一顆好一點的麥克風,對辨識率的幫助遠大於換工具——因為所有辨識引擎在乾淨錄音下的表現差距,都小於在雜訊錄音下的表現差距。如果你正在規劃節目的收入結構,可以搭配看Podcast 變現的四種收入與實際門檻

情境二:影片創作者,要出中文字幕上架。重點在時間軸與斷行,不在辨識引擎。我會挑一個能直接吐出字幕格式、而且有好用校稿介面的工具,本地或雲端都行。省時間的關鍵是「校稿介面」而不是「辨識準確度」,因為中文字幕無論如何都要人工調斷行。如果你的頻道已經在跑變現,YouTube 分潤與台灣創作者稅務那篇可以一起看。

情境三:接案做客戶訪談逐字稿。這是條款風險最高的情境。先問客戶能不能上雲,不能就本地。要說話者分離的話,本地方案要另外接分離模型,雲端則直接用 OpenAI 的專用模型或 AssemblyAI 的加購。報價時把「說話者標記」列成獨立工項,因為它確實是額外成本。

情境四:會議紀錄自用。這是唯一我認為訂閱制 SaaS 明顯划算的情境,因為你要的是自動加入會議、自動摘要、自動同步這一整套自動化,不是單純的轉錄。但同樣要注意:會議裡如果有客戶的人在場,那些發言也是別人的個人資料。如果你的工作型態是跨時區的非同步協作,跨時區協作的排程與交付方式裡談的非同步紀錄習慣,比即時轉錄工具本身更重要。

常見問題

市面上說某某工具「中文準確率 98%」,可信嗎?

我查了本文涵蓋的所有服務的官方文件與定價頁,沒有任何一家在官方文件上公布過「中文準確率百分之幾」這種單一數字(查核日 2026-08-06)。能查到的官方資訊只有兩種:Whisper 論文附錄的逐語言錯誤率表(有註明資料集與正規化方式),以及 AssemblyAI、ElevenLabs 這類的區間分級(未註明資料集)。看到精確到小數點的準確率宣稱,先問出處;如果出處不是廠商官方文件或有註明資料集的論文,那個數字就沒有比較價值。

台灣口音的華語,哪一家最適合?

官方文件上有三家把台灣(或繁體)變體寫進支援清單:Google Cloud Speech-to-Text V2 明列「Chinese, Mandarin (Traditional, Taiwan)」與代碼 cmn-Hant-TW,可用於 chirp、chirp_2、chirp_3;OpenAI 的檔案轉錄文件把 zh-tw 列為 languages 可送的地區語言代碼;Adobe Premiere 的 Speech-to-Text 支援語言頁列有 Traditional Chinese (Mandarin)。但這些都只代表有提供選項,不代表實際表現一定最好——因為沒有任何官方錯誤率數字可以驗證。實務建議是:拿你自己的三分鐘樣本,同一段丟給兩三家跑一次,自己數錯誤。

免費方案夠不夠用?

看你的量。以官方公布的免費額度來說:Azure AI Speech 免費層 F0 是即時轉錄每月 5 小時(不支援批次);Google Cloud STT V1 是每月前 60 分鐘免費;Otter Basic 是每月 300 轉錄分鐘、終身 3 次檔案匯入;Notta Free 是每月 120 轉錄分鐘、單次最長 3 分鐘、每月 50 次檔案上傳。如果你的素材是長訪談,Notta Free 的「單次最長 3 分鐘」會讓它直接出局;如果你主要是匯入既有檔案,Otter Basic 的「終身 3 次匯入」也一樣。免費方案要看的不是總量,是那些藏在細節裡的單次上限。

我可以把客戶的錄音丟到免費的線上工具嗎?

法律上要先確認你有沒有權限這麼做。個資法第 4 條規定,受委託蒐集、處理或利用個人資料者於本法適用範圍內視同委託機關;施行細則第 8 條把委託方應監督的事項列成六款,其中包含複委託的受託者、以及委託關係終止時儲存資料的刪除。把客戶音檔上傳到第三方服務,實質上就是複委託。比較安全的做法是:開案前用書面確認客戶是否同意使用境外雲端服務,並把你實際使用的服務名稱寫進報價單或合約。不確定的時候,走本地模型。

我的筆電跑得動本地模型嗎?

看你用哪個實作。OpenAI 官方 Whisper 的 README 標示 large 需要約 10 GB VRAM、turbo 約 6 GB、small 約 2 GB。但 whisper.cpp 官方 README 的記憶體表顯示 large 模型執行時約需 3.9 GB 記憶體、small 約 852 MB,門檻低很多;在 Apple Silicon 上還能透過 Core ML 走 Apple Neural Engine,官方 README 標示相較純 CPU 可快超過 3 倍。先從 small 或 turbo 試,跑得動再往上加。

年繳真的比較划算嗎?

單看單價當然是,但要把「你會不會用滿一年」算進去。以官方頁面切換分頁實際比對的數字為例,Otter Pro 月繳是每人每月 US$16.99、年繳均攤是 US$8.33;Descript Creator 月繳是每人每月 US$35、年繳均攤是 US$24。差價確實可觀,但轉錄需求通常跟案子量綁在一起,案量是波動的。另外要特別小心「促銷價」被誤讀成年繳價:Otter 的 Business 方案在月繳分頁上會顯示 US$30 劃掉、改標 US$24,旁邊掛的是「20% off for 3 months」——那是三個月的限期折扣,不是年繳均攤;Business 真正的年繳均攤是每人每月 US$19.99。我的做法是先用月繳跑滿兩個月,確認每月實際用掉的分鐘數穩定超過方案額度的一半,才轉年繳。另外提醒:定價頁預設顯示的往往是年繳均攤價,Notta 的加購區塊就明白寫著年繳均攤 US$6、月繳 US$10,看價格時務必先確認計費週期。

資料來源

  • Google Cloud Speech-to-Text 官方定價頁——證明 V2 標準模型 US$0.016/分鐘起、動態批次 US$0.003/分鐘,以及 V1「開啟資料記錄 US$0.016/不開啟 US$0.024」的兩個並列 SKU。
  • Google Cloud「Terms for opt-in for data logging」同意增補協議——證明開啟資料記錄後授予 Google 永久且不可撤回的使用權、得無限期保留、權利在合約終止後存續,以及停用後既有資料仍保留。
  • Google Cloud Speech-to-Text V2 官方支援語言清單——證明 cmn-Hant-TW(台灣繁體華語)為獨立語言條目,可用於 chirp/chirp_2/chirp_3,且該語言未列出說話者分離功能。
  • Microsoft Azure AI Speech 官方定價頁——證明免費層 F0 為即時轉錄每月 5 小時、標準與自訂共用且不支援批次,以及標準即時 US$1.00/小時、批次 US$0.18/小時、Fast Transcription US$0.36/小時;增強功能(含說話者分離)即時每小時每項 US$0.30,批次則標示「Included in Standard/Custom (no extra charge)」。頁面金額以 JavaScript 載入,須在瀏覽器開啟並選定區域(本文取 East US,另以 Japan East 複核為同價)。
  • OpenAI 官方 API 定價頁——證明 gpt-transcribe US$0.0045/分鐘、gpt-4o-transcribe US$0.006/分鐘、gpt-4o-mini-transcribe US$0.003/分鐘。
  • OpenAI「Data controls in the OpenAI platform」官方文件——證明 API 資料自 2023 年 3 月 1 日起預設不用於訓練、濫用監控紀錄總則為最多 30 天、零資料保留需事前核准,以及逐端點表格中 /v1/audio/transcriptions 的濫用監控保留期與應用程式狀態保留期皆為 None。
  • OpenAI 官方檔案轉錄指南——證明 25 MB 檔案上限、逐字與逐段時間戳記需使用 whisper-1、gpt-4o-transcribe-diarize 提供說話者分離但不支援 prompt,以及 languages 欄位可接受地區語言代碼 zh-cn/zh-tw/zh-hk。
  • OpenAI Whisper 官方 GitHub README——證明六種模型尺寸的參數量、所需 VRAM 與相對速度,以及 turbo 不適用翻譯任務。
  • Whisper 論文《Robust Speech Recognition via Large-Scale Weak Supervision》——證明 680,000 小時訓練量、FLEURS 與 Common Voice 9 的中文欄位數值、中文量到的實為字元錯誤率,以及中文被列為表現落後於趨勢預期的離群語言。
  • Google FLEURS 資料集頁面——證明該資料集 103 個子集中,華語子集只有 cmn_hans_cn(簡體、中國),另有粵語 yue_hant_hk(香港),沒有台灣繁體華語變體。
  • AssemblyAI 官方定價頁——證明 Universal-3.5 Pro US$0.21/小時、Universal-2 US$0.15/小時、說話者分離加購 US$0.02/小時、關鍵詞提示 US$0.05/小時。
  • AssemblyAI 官方支援語言文件——證明 Mandarin Chinese 被列在「>10% 至 ≤25% WER」等級,以及自動語言偵測會靜默略過不支援的功能。
  • AssemblyAI 官方語碼轉換文件——證明 Universal-3.5 Pro 原生支援 18 種語言的語碼轉換,並附英語與華語互換的實例。
  • ElevenLabs Scribe 官方文件——證明 Mandarin(cmn)列在「>5% 至 ≤10% WER」等級、支援最大 3 GB 檔案與標準模式 10 小時,以及關鍵詞提示的數量上限與額外計費。
  • Descript 官方方案頁——證明轉錄語言為 25 種且不含中文、另有含 Chinese 的 61 種字幕翻譯與 30 種配音翻譯清單、月繳(US$24/35/65)與年繳均攤(US$16/24/50)的兩組價格、各方案的媒體分鐘額度與說話者偵測功能。
  • Descript 官方隱私政策——證明用途包含訓練其 AI 模型,以及可透過關閉「Share Data with Descript」設定退出以 Projects 改進服務。
  • Otter 官方定價頁——在瀏覽器切換 Monthly/Annual 兩個分頁實測:Basic 每月 300 轉錄分鐘與終身 3 次匯入;Pro 月繳 US$16.99、年繳均攤 US$8.33(頁面標示 save 51%);Business 月繳 US$30(另掛「20% off for 3 months」促銷 US$24)、年繳均攤 US$19.99(save 33%)。頁面同區的學生方案敘述「Otter Pro Annual: $6.67 USD per month (billed $79.99 annually)/Otter Pro Monthly: $13.59」亦可交叉驗證這組原價。
  • Otter 官方說明文章:支援語言與語言切換——證明支援語言為英語、西班牙語、法語、德語、日語與簡體中文,一次只能轉錄一種語言,且僅法英可同時轉錄。
  • Otter 官方隱私政策(生效日 2026 年 6 月 16 日)——證明以去識別化錄音與逐字稿訓練自有 AI 技術,該用途橫排的法律依據欄為「Consent or Legitimate interests」(Contractual necessity 屬於上方兩列的其他用途),以及第 6 節 YOUR RIGHTS 依居住地提供 Withdraw consent 與 Object to processing、委外資料標註廠商的角色。
  • Notta 官方定價頁——在瀏覽器切換 Monthly/Annual 兩個分頁實測:Free 每月 120 分鐘、單次 3 分鐘上限與 50 次檔案上傳;Pro 月繳 US$13.49、年繳均攤 US$8.17(年繳總額 US$97.99)、每月 1,800 分鐘與 100 次上傳;加購項目「年繳均攤 US$6/月繳 US$10」的雙價標示;自訂詞彙一列標題為 Customize vocabulary (English & Japanese)。
  • Adobe Premiere 官方說明:Languages supported by Speech-to-Text——證明 Premiere 內建 Speech to Text 的支援語言含 Traditional Chinese (Mandarin)、Simplified Chinese (Mandarin) 與 Traditional Cantonese;同系列的自動轉錄說明頁另列有 Speaker labeling 設定項。
  • whisper.cpp 官方 GitHub README——證明各模型的磁碟與執行記憶體需求(large 約 3.9 GB),以及 Apple Silicon 上透過 Core ML 走 ANE 可快超過 3 倍。
  • MacWhisper 官方網站——證明 Free 方案 EUR 0、Pro 為一次買斷 EUR 64 一份授權並含終身更新。
  • 全國法規資料庫:個人資料保護法——證明第 4 條受託者視同委託機關、第 6 條特種個資限制、第 29 條舉證責任倒置,以及民國 114 年 11 月 11 日修正(含刪除第 27 條)施行日期由行政院定之、生效狀態標示為尚未生效。
  • 全國法規資料庫:個人資料保護法(現行有效版本第 27 條)——證明第 27 條第 1 項現行條文為非公務機關保有個資檔案者應採行適當之安全措施。
  • 個人資料保護委員會籌備處新聞稿:個資法部分條文修正案經總統公布——第二來源,證明 114 年 11 月 11 日修正條文的施行日期「將另由行政院定之」。
  • 臺北市法規查詢系統:個人資料保護法沿革——第三來源,獨立於全國法規資料庫,同樣標示「本法規部分或全部條文尚未施行,最後施行日期:未定」,並載明該次修正刪除第 27 條。
  • 全國法規資料庫:個人資料保護法施行細則——證明第 8 條委託監督的六款事項(含複委託與終止時的刪除義務),以及第 12 條對「適當之安全措施」的十一項定義。

本文整理自公開的官方定價頁、官方技術文件與全國法規資料庫條文,內容為個人研究與實作經驗分享,不構成法律意見。個資法的適用會因你處理的資料類別、委託關係與行業別而有差異,涉及醫療、心理、法律等特種個人資料或大量個資的案件,請洽詢律師或個人資料保護專業人員。文中所有價格與條款均為 2026 年 8 月 6 日查核結果,廠商定價與政策可能隨時調整,實際條件請以各服務官方頁面為準。

作者 Andes 的頭像

關於作者|Andes

自架 WordPress 網站與內容經營的長期實作者,寫過的主題涵蓋自架站、SEO、接案與遠距工作。習慣把每一個結論都追回到官方文件或可驗證的數據,價格與規格一律標注幣別與查核日期。本篇的每一筆費率都取自 Google Cloud、Microsoft Azure、OpenAI、AssemblyAI、Descript、Otter、Notta 與 MacWhisper 的官方定價頁,條款逐條比對各家官方隱私政策與資料使用增補協議,法規部分則回到全國法規資料庫確認個資法與其施行細則的現行有效版本與施行狀態,查核日為 2026 年 8 月 6 日。