
今天早上我讓一個瀏覽器代理跑自家網站的例行檢查。它打開首頁、讀完頁面結構、按下搜尋鈕、輸入關鍵字、按 Enter。每一步的回傳都是綠的:typed 5 chars、pressed Return x1。然後我去看網址列——一個字都沒變,那次搜尋根本沒有發生。
點擊、打字、按 Enter,每一格都回報成功,任務進度是零。這就是「AI 代理能自己操作瀏覽器了」這句話底下,沒有人替你算的那一格。
2026 年 8 月 19 日,Anthropic 把 computer use 正式移出 beta,同時推出全新的 browser use 工具。繁體中文世界目前談的幾乎全是 Claude in Chrome 那個外掛怎麼裝、怎麼點——那是消費端。這篇談的是 API 層:31 個動作的完整清單、預設被關掉的 4 個代表什麼,以及我實際跑一輪之後,哪些接案工時真的會被吃掉。
先交代身分:我沒有自己寫執行環境去接官方那個 API。我用的是手邊現成的瀏覽器代理工具,動作名稱與官方清單高度重疊,所以「哪一步會失敗」可以轉移;token 成本我沒測過,文末列清楚。規格與日期一律回官方文件核對,查核日 2026 年 8 月 26 日。
📌 本文重點
- 官方文件白紙黑字寫著這個工具不附瀏覽器:
Your application runs every call against its own browser automation; nothing runs on Anthropic's side.——門檻是搬家,不是消失。 - browser use 宣告 31 個成員動作,其中 27 個預設開啟、4 個預設關閉(
javascript_exec、file_upload、read_console、read_network)。對照組是 computer use 的 17 個。 - 我實測一輪送出 33 個動作,其中 10 個不能照字面相信:4 次明確報錯、3 次靜默假陰性、3 次回報成功但完全沒有效果。
- 讀結構與讀畫面會往相反方向騙你。同一個首頁:讀結構那次回「空頁面」但實際有 67 條連結;讀畫面那次讓我差點寫下「特色圖全破」的假錯誤報告,實際是延遲載入,破圖數是 0。
- 官方要求人類確認的動作列得很具體:
purchasing, modifying accounts, messaging, and accepting terms。這一句剛好定義了接案者還被需要的位置。 - 我的代理一路開到 WordPress 登入頁、精準定位到密碼欄,然後停住。擋住它的不是技術,是憑證。
一、先講結論:能力到位了,但它不附瀏覽器
多數「AI 要取代你了」的文章漏掉官方文件裡最關鍵的那一句。browser use 說明頁開頭第一段就寫:Your application runs every call against its own browser automation; nothing runs on Anthropic's side.
白話講:模型只會告訴你「該點哪裡、該打什麼字」,真正去點、去打的那台瀏覽器要你自己準備、自己養、自己付錢。模型回傳一串動作指令,你得寫程式把每一個指令跑在瀏覽器上,再把結果(頁面文字、無障礙樹、截圖、分頁狀態)包成回應送回去。同一份文件把這個角色稱作 executor,並且明講:這個工具目前不能用在 Claude Managed Agents 上。
過去自動化的門檻是「有沒有人會寫爬蟲」,現在門檻換成三樣:你有沒有一台隔離的機器、有沒有人維護它、出事的時候誰負責。會寫指令的那一段被吃掉了,剩下兩段沒有。
二、08-19 還是 08-20?兩個官方日期我照實並列
官方的平台發布紀錄把這批更新記在 2026 年 8 月 19 日:computer use 以 computer_toolset_20260801 出 beta,不再需要 beta 標頭,新增一輪多動作(batch actions)、zoom 預設開啟、可逐一設定成員開關;browser use 以 browser_toolset_20260801 推出;Files API 與 Skills API 同日出 beta。同一則條目寫明支援的模型是 Claude Fable 5、Mythos 5、Opus 5、Sonnet 5 與 Opus 4.8。
但官方部落格那篇正式公告的日期欄位寫的是 2026 年 8 月 20 日(頁面原始碼裡的 datePublished 同樣是 Aug 20)。
差一天,我兩個都寫,不猜哪個算數。這一輪查資料我看到大量標著「本週最新」的 AI 資訊站,其實是把一個多月前的舊聞改標重發——回官方頁面對一次很便宜,抄錯很貴。
官方那個「省一半時間」的數字要怎麼讀
公告裡引了一段使用者說法:our longest claims workflow went from 32 minutes to 13, cost per task fell about 30% across every workflow we tested, and completion hit 100%, with no changes to our prompts,署名 Davide Locatelli,職稱 Research Engineer。
值得看,但有三個限制要一起看:官方沒有寫出這位工程師所屬的公司;那是保險理賠流程,不是接案者的工作型態;省下的 19 分鐘是機器跑完一輪的時間,不含你把執行環境架起來、出錯時排查的時間。當成「這條路走得通的存在證明」合理,當成「你也會省一半」就是自己加戲。

三、31 個動作全清單,以及預設被關掉的那 4 個
官方文件寫的是:這個工具宣告 31 個成員動作,預設給模型 27 個,另外四個要你自己打開。下表是完整清單,分組沿用官方文件的分法。
| 分組 | 成員動作 | 數量 |
|---|---|---|
| 導覽與擷取 | navigate、screenshot、zoom |
3 |
| 指標操作 | left_click、right_click、middle_click、double_click、triple_click、hover、left_click_drag、left_mouse_down、left_mouse_up、mouse_move、scroll、scroll_to |
12 |
| 鍵盤與等待 | type、key、hold_key、wait |
4 |
| 讀頁面 | read_page、find、get_page_text |
3 |
| 表單與檔案 | form_input、file_upload(預設關) |
2 |
| 診斷與腳本 | read_console(預設關)、read_network(預設關)、javascript_exec(預設關) |
3 |
| 分頁管理 | new_tab、list_tabs、switch_tab、close_tab |
4 |
加起來 31,扣掉預設關閉的 4 個剩 27。作為對照,同一天出 beta 的 computer use 只有 17 個成員。官方發布紀錄的措詞是:browser use 在「截圖加點擊」的控制之上,再加上元素參照、表單輸入、分頁管理、下載回報與選用的檔案上傳。
那 4 個預設關閉的,官方給的理由不是同一個
這裡有一個很容易抄錯的細節。官方文件把四個成員分成兩組,理由不同:
javascript_exec與file_upload預設關閉,理由是它們擴大了「一個被操弄的頁面能讓模型做到什麼」的範圍。文件另外註明javascript_exec跑在頁面自身的權限下,含它的 cookie、儲存空間與同源請求。read_console與read_network預設關閉,理由有兩個,第一個跟安全無關:不是每一套瀏覽器自動化都拿得到那些紀錄;第二個才是它們會讓更多「由頁面控制的內容」流進模型的脈絡。文件並且提醒,網路紀錄「常常含有像是網址裡的權杖那種祕密」,回傳前要自己遮蔽。
把四個都說成「因為危險所以關掉」是錯的,而這個分別會影響你的判斷:如果你的自動化棧根本供不出主控台紀錄,那不是安全取捨,是能力缺口,打開開關也沒用。
幾個官方寫死的邊界
這些數字決定你的代理會在哪裡撞牆:read_page 的輸出上限是 50,000 個字元,超過要自己截斷並告訴模型;find 最多回 20 筆;scroll 的捲動量是滾輪格數,範圍 1 到 10、預設 3;key 的重複次數 1 到 100;hold_key 與 wait 的秒數都是 0 到 30。文件同時聲明這些界限「是說給模型聽的,API 不強制」——驗證輸入是你的事,模型送出超界的參數,API 不會替你擋。
四、我實測一輪:33 個動作,10 個不能照字面相信
我拿自己的網站當標的跑一輪例行維運:開首頁、讀結構、找搜尋、按下去、換頁、讀主控台與網路紀錄、檢查圖片有沒有壞。全程 35 次呼叫,其中 33 次落在官方那份成員清單的範圍內(32 次連名字都一樣,剩下那次叫 tabs_select,對應官方的 switch_tab),另外 2 次是設定視窗大小。
33 個裡有 10 個不能照字面相信,大約三成。而且這三成分成性質完全不同的三類:
| 類型 | 次數 | 實際發生什麼 |
|---|---|---|
| 明確報錯 | 4 | 拿舊的元素參照去點、少了前置截圖就給座標、兩次逾時 |
| 靜默假陰性 | 3 | 回應格式正常、內容是錯的 |
| 回報成功但沒有效果 | 3 | 每一格都綠,事情沒發生 |
明確報錯的那 4 次,反而最讓人放心
第一次是元素參照過期。我先讀首頁結構、拿到一批 ref_N 編號,接著換到分類頁,再用舊編號去點,回應是 ref map not initialized; call read_page first,那一批動作就停在那裡。方向與官方的要求一致:官方規定一輪多動作遇到第一個失敗就停,後面每一個都要回錯誤並附上一段固定文字。但那是寫給你的執行環境的實作契約,不是 API 幫你擋;官方另外提醒,API 自己偵測不到過期的參照,這個錯誤得由你的執行環境回報。
第二次是我剛換頁就直接給座標捲動,被擋下來:座標動作需要先有一張截圖,因為座標的意義是由最近那張截圖定義的。第三、四次是同一個動作兩次逾時 30 秒,訊息說瀏覽器面板目前是隱藏的。
這四次的共同點是「它自己說它沒做到」。只要錯誤會冒出來,你就能寫重試、寫退場、寫告警。真正吃掉工時的是另外六次。
靜默假陰性:回應正常,內容是錯的
開場第二個動作我就中招。我請它讀首頁的可互動元素,回來的是「(empty page)」,附註視窗大小 0×0。如果我只信這一格,結論會是「這個首頁沒有任何可以操作的東西」。我沒信,因為上一個動作我才用腳本直接問過瀏覽器:同一個當下的頁面有 67 條連結、15 張圖、標題正常。把視窗設成 1280×900 再讀一次,17 個元素整整齊齊回來,其中就有我要的搜尋鈕(button "搜尋" [ref_8])。
另外兩次是同一個動作。find 是拿自然語言描述你要的元素,我第一次的查詢字串中英並列(搜尋框 search box),回「No matches」;第二次單獨用英文問 search button,還是「No matches」。可是同一頁的 read_page 明明白白列著那顆鈕,我拿它的編號去點,動作確實落地(回報點在座標 1201, 60)。兩次語意搜尋、兩次假陰性;直接讀結構,一次就中。
為什麼會這樣,我只有猜測沒有量測:那顆鈕在無障礙樹裡的名字只有中文「搜尋」兩個字,語意比對可能就吃不到。但可以直接下的結論是——能用 read_page 拿參照,就不要用 find 賭語意,尤其是介面標籤全是中文的台灣網站。
回報成功但沒有效果:這一類最貴
就是開頭那一段。點下搜尋鈕之後我輸入五個字、按 Enter,兩格都回綠(typed 5 chars、pressed Return x1),網址一個字都沒動。第三次是我想把面板叫到前景,工具回「Fronted tab tab-2」,看起來成功了,可是下一個動作照樣以「面板是隱藏的」逾時失敗。
這一類最貴,因為它會通過你所有的檢查。如果你的自動化只看「每個動作有沒有回錯誤」,它會回報一切正常,然後在下游產出一份空的結果。唯一有效的做法是不看動作的回應,改看世界的狀態——網址變了嗎、那筆資料真的存在嗎、前台看得到嗎。
五、讀結構 vs 讀畫面:兩邊都會騙你,方向相反
常見的講法是:browser use 讀結構所以可靠,computer use 只看像素所以脆弱。方向沒錯,但省略了一半。我這一輪同時吃了兩邊的虧。
讀結構騙我的那一次就是上面的「(empty page)」:頁面明明滿的,結構讀回來是空的。
讀畫面騙我的那一次更危險,因為它幾乎讓我寫出一份錯誤的報告。我截了首頁的圖,畫面上文章卡片的圖片區塊全是空白。任何人看到都會下同一個結論:特色圖破了。我多做了一步,直接問瀏覽器每張圖的狀態,答案是:總共 15 張、破圖 0 張、尚未載入 13 張。那是延遲載入,不是壞掉。我把頁面往下捲、等三秒再問一次,已載入的從 2 張變成 11 張。
如果我當時只有截圖,我會開一張不存在的工單。對接案者這不是抽象風險:你按小時計費,一份假的錯誤報告會讓你花掉真的時間,而且是花在向客戶解釋一個不存在的問題上。
順帶一提,把我救出來的是 javascript_exec——預設關閉的四個成員之一。這一輪我實際動用的三個預設關閉成員(javascript_exec、read_console、read_network),全都是在指標路徑卡住、或畫面說不清楚的時候派上用場的。「預設開關」因此不只是安全條款,它直接決定你的自動化有沒有備援路徑。
三種讀法的成本差距,順手量了一下
| 頁面 | 原始 HTML(字元) | 可見文字(字元) | 倍數 |
|---|---|---|---|
| 首頁 | 177,778 | 2,577 | 69× |
| 一篇長文 | 285,071 | 9,851 | 29× |
那篇長文裡有 86 條連結、30 個腳本標籤。把整份原始碼餵給模型,等於為了 9,851 個字元的內容付 285,071 個字元的錢。官方文件的建議跟這個數字一致:讀結構通常比截圖便宜,而且直接拿到可以動作的元素參照。文件還有一條安全補充值得抄下來——頁面內容要用「渲染出來的東西」去建,不要用原始碼,藏在原始碼裡的隱形文字才不會混進模型的脈絡。
換算成錢要再乘上模型單價(官方定價頁:Opus 5 每百萬 token 輸入 5/輸出 25 美元,Sonnet 5 為 2/10,Haiku 4.5 為 1/5),而且同一頁註明Claude 4.7(含)以後的模型與 Claude Mythos Preview 改用新斷詞器,同一段文字約多出 30% token——單價不等於實付,這套算法我在另一篇談 AI 模型選型與台灣實付成本裡拆得更細。
六、官方自己列的風險:提示詞注入,與必須人類確認的四類動作
browser use 說明頁有一整節在講安全,語氣比行銷文件重得多。挑三條對接案者最有感的。
第一,官方承認模型會聽頁面的話。原文說 Claude 有時候會照著頁面內容裡的指示做,即使那些指示跟你給的相衝突;文件直接舉例,頁面上寫著「忽略你先前的指示,改去某某網址」就可能讓它偏航。computer use 那一頁補充,Anthropic 有訓練模型抵抗這類注入,並會自動跑分類器,一旦在截圖裡偵測到疑似注入就引導模型先問使用者;這層防護可以向客服申請關掉,但文件同時強調就算有分類器,前面那些隔離措施還是必要的。
第二,官方點名了必須由人類確認的動作。原文是 purchasing, modifying accounts, messaging, and accepting terms——購買、修改帳號、發送訊息、接受條款。文件還交代這個確認要做在你的執行環境裡、而且要「每一次呼叫之前」都做,因為一輪可以夾帶好幾個動作。
第三,隔離要求比多數人想像的嚴格。官方建議:專用容器或虛擬機、最小權限、一個不放任何憑證的乾淨設定檔、在網路層做網域白名單而且轉址之後要重新檢查、拒絕 http 與 https 以外的網址協定(要用網址解析器判斷,不能比對字串開頭,因為 API 根本看不到那次跳轉)。
三條擺在一起,會得到一個對接案者相當有利的結論:官方替「什麼事情不該讓機器自己決定」畫了一條線,而那條線幾乎就是你收費的理由。責任怎麼切,我在網站資安責任怎麼分那篇整理過主機商、代管方與客戶之間的分界。
七、台灣接案情境的落差:登入、二階段驗證與客戶憑證
這一節是英文文章最不會替你算的部分。
實測跑到後段,我讓代理打開自家 WordPress 的登入頁。它一次讀回 12 個可互動元素,其中包含使用者名稱欄與密碼欄(型別 password)。定位精準到毫無懸念。
然後我停在那裡,一個字都沒輸入。不是因為它做不到,是因為那一步不該由它做。
把官方安全指引跟台灣接案的日常擺在一起,落差就出來了。官方要求「一個不放任何憑證的乾淨設定檔」,並要求「如果任務非得用登入狀態不可,就用一個專用的低權限帳號」。可是台灣接案者手上的東西長這樣:
- 客戶的網站後台:多半只有一組管理員帳號,客戶自己也在用,沒有「低權限專用帳號」這種東西。
- 金流與電商後台:通常綁二階段驗證,簡訊或驗證碼進的是客戶的手機,不是你的。
- 報稅與政府系統:憑證在讀卡機裡,那是實體物件,瀏覽器代理跨不過去。
- 社群與廣告帳號:權限綁在個人帳號上再授權,一旦被判定異常登入,倒楣的是客戶的資產。
真正的門檻不在模型會不會點,而在「你敢不敢把那組密碼放進一台每天都在讀陌生網頁的機器裡」。官方文件已經替你回答了:不要。憑證怎麼收、怎麼交接、離場時怎麼撤掉,我另外寫過一篇接案者的客戶帳密交接與離場撤銷,那套流程在代理時代只會更重要。
還有一個容易被忽略的:診斷資料會漏東西出去
我打開了讀主控台與讀網路紀錄這兩個預設關閉的成員。很有用——主控台第一行就告訴我站上裝了哪個追蹤外掛與版本號,網路紀錄列出每一支請求的方法、網址、狀態碼。但同一份紀錄也把站台內部的端點原封不動攤開了。官方的措詞是那些內容「常常含有像是網址裡的權杖那種祕密」,要你回傳前先遮蔽。替客戶做代管的話,這條要寫進作業程序:診斷資料是客戶的資產,不是你的除錯素材。
八、對接案報價的實際意義:哪些工時會被吃掉、哪些反而變值錢
收斂成一張表。判準只有兩個:需不需要憑證、做錯了要不要付代價。
| 工作 | 現在的狀態 | 為什麼 |
|---|---|---|
| 公開頁面的資料蒐集、競品比價、清單整理 | 會被吃掉 | 不需要憑證、錯了重跑就好、讀結構又便宜 |
| 大量頁面的例行檢查(連結、標題、圖片有沒有掉) | 大半會被吃掉 | 同上,但要接受它會給你假陰性,得補一層驗收 |
| 把資料從一個後台搬到另一個 | 卡在憑證 | 兩端都要登入,二階段驗證在客戶手上 |
| 下單、改帳號設定、代發訊息、按下同意條款 | 官方明列要人類確認 | 做錯有真實後果,這是規範不是技術限制 |
| 判斷「這個結果對不對」 | 反而變值錢 | 三成的動作不能照字面相信,總得有人看 |
| 把失敗的自動化修回來 | 反而變值錢 | 執行環境要人養,出事的時候客戶找的是你 |
報價上我自己的調整是:把「跑一輪」和「保證結果」拆成兩個項目分開報。跑一輪的價格會被壓,因為那部分確實變便宜了;保證結果的價格不該跟著壓,因為那部分的成本一點都沒降——它甚至變高了,因為現在多了一種「全部回報成功但事情沒發生」的失敗模式要抓。
哪些環節交給 AI 會砸自己招牌,我另外寫過一篇判斷框架:那篇談品質與責任歸屬,這篇談能力邊界。
九、我沒測、所以沒有寫進去的東西
- 我沒有寫一個執行環境去接官方的
browser_toolset_20260801。我跑的是手邊現成的瀏覽器代理工具,動作名稱與契約高度重疊,所以失敗模式可以轉移;但「照官方規格自己實作」會遇到什麼,我不知道。 - 我沒有量到 token 用量與實付金額。成本段落是用官方定價頁的單價加上我實測到的字元數去推論方向,不是帳單。
- 我沒有在正式環境測過
file_upload。官方對它的路徑限制寫得很嚴,那些嚴格程度我沒有實際驗證過。 - 我沒有測過提示詞注入。對著真的惡意頁面跑代理不是我該做的實驗,這一段完全引用官方敘述。
- 我只在一個站台上測。那是我自己的 WordPress,特定佈景與外掛組合。失敗模式的種類應該有普遍性,出現頻率不會有。
- 台灣各家金流與政府系統的實際行為我沒有實測,第七節那些是我做這些系統時的經驗與其公開的驗證機制,不是對代理跑過的測試。
常見問題
Q:我沒有寫程式,這件事跟我有關係嗎?
A:有,但不是「你要去用它」。有關係的是你的客戶可能拿這個當砍價理由。你需要能講清楚一件事:便宜下來的是「跑一輪」,沒有便宜下來的是「保證跑對」。這篇的三成失敗率就是你講這句話的證據。
Q:Claude in Chrome 那個瀏覽器外掛跟這篇講的是同一件事嗎?
A:不是。那是消費端產品,裝在你自己的瀏覽器上、用你自己的登入狀態。這篇講的是 API 層的工具,動作要跑在你自己準備的執行環境裡,適合「要跑一百次」的自動化,不是「我手動點比較快」的單次任務。
Q:31 個動作我要全部實作嗎?
A:不用。官方文件明講可以逐一關掉你不打算實作的成員,並舉了例子:實作得出主控台讀取、但不做低階指標與長按控制的執行環境,就把那個打開、把那三個關掉。但文件同時提醒,關掉不保證模型不會叫它,你的執行環境還是要對那種呼叫回一個錯誤,不能默默丟掉。
Q:我該現在就投資時間學這個嗎?
A:如果你手上有「同一套流程一週要跑十次以上、而且全部在公開頁面上」的工作,值得。如果你的工作大部分卡在登入後面,現在投入的報酬會很低——先去把憑證管理弄好,那件事的效期比任何一個工具版本都長。
資料來源
- Anthropic — Browser use tool 官方文件:31 個成員動作與分組、4 個預設停用成員與各自理由、
Your application runs every call against its own browser automation; nothing runs on Anthropic's side.、一輪多動作的停止規則、元素參照過期的處理、read_page50,000 字元上限與find20 筆上限、安全考量整節(隔離環境、網域白名單、網址協定檢查、必須人類確認的四類動作、主控台與網路紀錄含祕密須遮蔽)、不支援 Claude Managed Agents。查核日 2026-08-26。 - Anthropic — Computer use tool 官方文件:
computer_toolset_20260801共 17 個成員、無需 beta 標頭、提示詞注入分類器會引導模型先請使用者確認且可申請關閉。查核日 2026-08-26。 - Anthropic — Claude Platform release notes 官方發布紀錄:2026 年 8 月 19 日條目,computer use 出 beta、browser use 推出、Files API 與 Skills API 同日出 beta、支援模型清單。查核日 2026-08-26。
- Anthropic — Build production agents with computer use, the Skills API, and the Files API 官方公告:頁面日期欄與原始碼
datePublished均為 2026 年 8 月 20 日;Files API 自動過期/速率上限 5 倍/每組織 1 TB;computer use 可用於 HIPAA 規範工作負載(須簽 BAA);引言原文與署名 Davide Locatelli, Research Engineer(頁面未載明所屬公司)。查核日 2026-08-26。 - Anthropic — Pricing 官方定價頁:Claude Opus 5 每百萬 token 輸入 5/輸出 25 美元、Sonnet 5 為 2/10、Haiku 4.5 為 1/5;Claude 4.7(含)以後的模型與 Claude Mythos Preview 改用新斷詞器,同一段文字約多出 30% token(Sonnet 4.6 以前沿用舊斷詞器)。查核日 2026-08-26。
免責聲明:本文引用之規格、日期與價格均為 2026 年 8 月 26 日查核之官方頁面版本,隨時可能修訂,實際適用請以官方文件為準。文中實測係以作者自有網站為標的、使用現成瀏覽器代理工具進行,非以官方 API 自行實作執行環境,失敗次數與比例僅代表該次執行,不構成任何工具的效能評測。







