ChatGPT Agent 模式 — 讓 AI 代替你操作瀏覽器完成任務

ChatGPT Agent 模式的實際價值不在「速度更快」,而在把「需要開十幾個分頁、來回複製貼上」的多步驟任務壓成一次指令。它會在 OpenAI 雲端啟動一台虛擬電腦,用自己的瀏覽器點按鈕、填表單、讀網頁、跑程式碼,最後把結果交給你——但它同時是目前風險最高的 AI 使用方式,因為它握有你的登入狀態。 Agent 模

ChatGPT Agent 模式的實際價值不在「速度更快」,而在把「需要開十幾個分頁、來回複製貼上」的多步驟任務壓成一次指令。它會在 OpenAI 雲端啟動一台虛擬電腦,用自己的瀏覽器點按鈕、填表單、讀網頁、跑程式碼,最後把結果交給你——但它同時是目前風險最高的 AI 使用方式,因為它握有你的登入狀態。 Agent 模式到底在做什麼 Agent 模式是把三個原本分開的能力合併成一個工具集。OpenAI 於 2025 年 7 月 17 日推出 ChatGPT agent,將先前的 Operator(視覺瀏覽器操作)與 deep research(文字網頁分析)整合進單一系統,並加上終端機與檔案處理能力( 「ChatGPT agent 於 2025 年 7 月 17 日推出,整合 Operator 與 deep research」(來源:OpenAI 官方部落格) )。 執行時它有三種存取網頁的方式,模型會自己選:視覺瀏覽器(模擬滑鼠點擊與捲動,處理需要互動的頁面)、文字瀏覽器(只抓文字,速度快很多,適合純閱讀查資料)、終端機(跑 Python、處理下載的檔案)。這三者共用同一個虛擬機的狀態,所以它可以「先用視覺瀏覽器登入某網站下載報表,再用終端機把 CSV 算成統計表」。 關鍵差異在於:一般 ChatGPT 的網頁搜尋是「讀取」,Agent 模式是「操作」。前者只能告訴你機票多少錢,後者可以走完訂位流程到付款前一步。 能力邊界:它擅長什麼、什麼做不到 Agent 模式在「規則明確、步驟多、每步都不難」的任務上表現最好。實務上驗證有效的類型包括:跨多個網站比價並整理成表格、從 SaaS 後台匯出資料再做彙整、把一批網頁內容抓下來轉成投影片或試算表、填寫格式固定的線上表單。 在需要判斷力的基準測試上,它的分數明顯高於單純問答模型但遠未飽和。OpenAI 公布 ChatGPT agent 在 Humanity's Last Exam 取得 41.6% pass@1,在投資銀行建模任務 「DSBench 資料建模項目達 89.9%」(來源:OpenAI 官方部落格) ;同一份公告指出它在 FrontierMath 上為 27.4%。這些數字說明它能處理結構化的分析工作,但在開放式推理仍有超過半數題目答錯。 它做不到的部分同樣具體:需要人臉/生物辨識的驗證、複雜的拖曳式介面、大量 Canvas 或 WebGL 渲染的頁面、以及任何被 Cloudflare 之類反機器人機制擋下的站點。遇到雙因素驗證或 CAPTCHA 時它會停下來把控制權交還給你,而不是自己繞過。 時間成本的真實樣貌 Agent 模式慢。一個涉及五、六個網站的任務,實測常落在 5 到 25 分鐘之間,因為它每一步都要等頁面載入、截圖、讓模型判讀畫面再決定下一動作。它適合「你可以離開去做別的事」的任務,不適合你盯著螢幕等答案的場合。 三個必須先設好的安全前提 Agent 模式最大的風險是 prompt injection:網頁上的隱藏文字可以對 AI 下指令,而 AI 帶著你的登入 cookie。OpenAI 在官方公告中明確將 ChatGPT agent 在生物與化學能力上歸類為 「High capability 等級並啟動對應防護措施」(來源:OpenAI Preparedness Framework 公告) ,同時針對代理式瀏覽建立了獨立的 injection 防禦與使用者確認機制。 實務上有三件事該在第一次使用前做完: 用獨立瀏覽器身分登入 :只在 Agent 的虛擬瀏覽器裡登入你願意讓它碰的帳號。銀行、主要 email、公司內部系統不要登入。它的 cookie 會保留在該 session 內。 開啟「接管模式」再輸入密碼 :Agent 提供 takeover 讓你親手在虛擬畫面上打字,這段輸入不會進入模型的觀察範圍。不要用對話框把密碼傳給它。 把不可逆動作列為需確認 :送出訂單、寄出 email、刪除資料這類步驟,預設它會先問你。不要因為嫌煩而養成「一律按同意」的習慣——injection 攻擊正是靠這個成功。 對照組值得一看:Anthropic 的 Claude 也提供類似的電腦操作能力,其 Computer Use 官方文件 同樣把「在有隔離的虛擬機執行、避免給予真實帳號權限」列為第一條建議。兩家的安全結論一致,代表這不是單一廠商的產品限制,而是這類技術本身的性質。 寫出能成功的指令 Agent 模式的失敗大多來自指令太模糊,而不是模型能力不足。有效的指令包含四個要素:起點(從哪個網站開始)、判準(怎樣算符合條件)、輸出格式(要表格、清單還是檔案)、停止點(做到哪一步就停)。 對照兩種寫法。無效版本:「幫我找便宜的機票」。有效版本:「到 Google Fligh

相關工具書

相關工具比較

由 FeiYueh 親自審稿驗證 · 最後更新於 2026-09-19. Independently maintained — not AI-generated boilerplate.

← Back to Blog