Manus AI Agent — 自主完成任務的 AI 代理實測與定價

Manus 在 2025 年 3 月以「全球首個通用 AI Agent」姿態發表,最大差異不在模型能力,而在它預設以「非同步雲端虛擬機」執行任務——你關掉瀏覽器,它仍在跑。實測 12 項任務後,真正穩定交付的是資料蒐集、表格整理、簡報與網站生成這四類;需要登入帳號、付費、或跨系統寫入的任務失敗率明顯偏高。定價則從初期爭

Manus 在 2025 年 3 月以「全球首個通用 AI Agent」姿態發表,最大差異不在模型能力,而在它預設以「非同步雲端虛擬機」執行任務——你關掉瀏覽器,它仍在跑。實測 12 項任務後,真正穩定交付的是資料蒐集、表格整理、簡報與網站生成這四類;需要登入帳號、付費、或跨系統寫入的任務失敗率明顯偏高。定價則從初期爭議極大的 39 美元起跳方案,演進為 Credit(點數)制,成本高度取決於任務複雜度而非使用時數。 Manus 是什麼:與 ChatGPT、Claude 的結構性差異 Manus 是由中國團隊 Monica(蝴蝶效應/Butterfly Effect)開發的自主型 AI Agent,2025 年 3 月 6 日發布預覽版,公司總部後續遷至新加坡。它本身不訓練基礎模型,而是在 Anthropic Claude 等既有模型上,加掛一層「規劃器 + 沙箱虛擬機 + 工具集」。 結構差異決定了使用情境。ChatGPT 與 Claude 的對話介面本質上是「同步回合制」:你問一句、它答一句,長任務靠你不斷追問推進。Manus 收到指令後會先產出一份 todo.md 任務清單,然後在雲端 Linux 虛擬機裡逐項執行——開瀏覽器、下載檔案、寫 Python 腳本、跑 shell 指令、產出檔案,過程中不需要你在場。 官方在發布時公布的基準成績是這波關注的起點: 「Manus 在 GAIA benchmark 三個難度層級皆取得當時 SOTA 成績,Level 1 達 86.5%(來源:GAIA Benchmark Leaderboard / Hugging Face)」 。GAIA 是由 Meta AI、Hugging Face 與 AutoGPT 團隊共同提出的通用助理評測,題目要求多步驟推理加實際工具操作,正好對應 Agent 型產品的能力面。需要留意的是這是廠商自報成績,且 GAIA 榜單長期存在測試集過擬合的爭議。 實測:哪些任務真的做得完,哪些會卡住 以 12 項日常辦公與研究任務實測,可交付率呈現明顯的分群。以下依「一次通過」「需人工介入」「無法完成」三類歸納。 穩定交付的任務類型 多來源資料蒐集與比較表 :給定「比較五家雲端硬碟的價格、容量、地區限制,輸出 Excel」,Manus 會實際開啟各官網、擷取價格頁、產出 .xlsx 。平均耗時 8–15 分鐘,欄位正確率高,但價格幣別偶爾混用,需人工複核。 簡報與網頁生成 :從一份 PDF 產出 15 頁簡報,含版面與圖表,可直接下載 .pptx 。排版品質約等同「堪用的內部簡報」,不到對外提案水準。 資料清理與腳本任務 :上傳一份含重複值與格式錯亂的 CSV,要求去重、統一日期格式、輸出樞紐分析。它會自行寫 pandas 腳本執行,這是表現最穩定的一類。 長篇研究摘要 :指定主題後自動搜尋 30–60 個來源並產出附連結報告。引用連結真實可點,但來源品質參差,內容農場與官方文件會被平等對待。 需人工介入或直接失敗的類型 需要登入的操作 :涉及個人帳號(銀行、公司後台、社群發文)時,Manus 會停下來要求你在它的瀏覽器畫面中手動登入。這牽涉把憑證輸入第三方沙箱環境,企業情境下通常直接不可行。 涉及付款的任務 :訂機票、下單購物一律停在結帳前。 反爬蟲機制強的站點 :遇到 Cloudflare 驗證、需要 CAPTCHA 的頁面時大多重試數次後放棄,並在報告中留下空白欄位——這是實測中最需要警覺的一點,它 不會明確標示「這格我抓不到」 ,而是可能填入推測值。 長鏈任務的中段偏移 :超過約 20 個步驟的任務,容易在中段偏離原始指令,執行到一半改去做相鄰但非指定的事。 這種「看起來完成、實際有缺漏」的失敗模式,是自主 Agent 目前的共同弱點。CMU 團隊建構的模擬公司環境測試中, 「最佳 AI Agent 在 TheAgentCompany 真實職場任務中僅完成 24% 的任務(來源:TheAgentCompany, Carnegie Mellon University, 2024-12)」 。這個數字提醒了合理期待值:Agent 適合處理「錯了你看得出來」的任務,不適合託付「錯了你不會發現」的流程。 定價結構:Credit 制怎麼算,實際多貴 Manus 目前採 Credit 點數制,而非依時間或對話則數計費。每次任務消耗的 Credit 取決於執行步驟數、工具呼叫次數與虛擬機運行時間,這代表同樣訂閱方案下,任務越複雜可用次數越少。 官方方案分層大致如下(以官方定價頁為準,方案內容調整頻繁): Free :每日少量免費 Credit,僅夠測試單一短任務。 Basic(約 US$19/月) :入門額度,適合每週數次的輕量任務。 Plus(約 US$39/月)

FAQ

Manus 是什麼:與 ChatGPT、Claude 的結構性差異

Manus 是由中國團隊 Monica(蝴蝶效應/Butterfly Effect)開發的自主型 AI Agent,2025 年 3 月 6 日發布預覽版,公司總部後續遷至新加坡。它本身不訓練基礎模型,而是在 Anthropic Claude 等既有模型上,加掛一層「規劃器 + 沙箱虛擬機 + 工具集」。 結構差異決定了使用情境。ChatGPT 與 Claude 的對話介面本質上是「同步回合制」:你問一句、它答一句,長任務靠你不斷追問推進。Manus 收到指令後會先產出一份 todo.md 任務清單,然後在雲端 Linux 虛擬機裡逐項執行——開瀏覽器、下載檔案、寫 Python 腳本、跑 shell 指令、產出檔案,過程中不需要你在場。 官方在發布時公布的基準成績是這波關注的起點: 「Manus 在 GAIA benchmark 三個難度層級皆取得當時 SOTA 成績,Level 1 達 86.5%(來源:GAIA Benchmark Leaderboard / Hugging Face)」 。GAIA 是由 Meta AI、Hugging Face 與 AutoGPT 團隊共同提出

實測:哪些任務真的做得完,哪些會卡住

以 12 項日常辦公與研究任務實測,可交付率呈現明顯的分群。以下依「一次通過」「需人工介入」「無法完成」三類歸納。 穩定交付的任務類型 多來源資料蒐集與比較表 :給定「比較五家雲端硬碟的價格、容量、地區限制,輸出 Excel」,Manus 會實際開啟各官網、擷取價格頁、產出 .xlsx 。平均耗時 8–15 分鐘,欄位正確率高,但價格幣別偶爾混用,需人工複核。 簡報與網頁生成 :從一份 PDF 產出 15 頁簡報,含版面與圖表,可直接下載 .pptx 。排版品質約等同「堪用的內部簡報」,不到對外提案水準。 資料清理與腳本任務 :上傳一份含重複值與格式錯亂的 CSV,要求去重、統一日期格式、輸出樞紐分析。它會自行寫 pandas 腳本執行,這是表現最穩定的一類。 長篇研究摘要 :指定主題後自動搜尋 30–60 個來源並產出附連結報告。引用連結真實可點,但來源品質參差,內容農場與官方文件會被平等對待。 需人工介入或直接失敗的類型 需要登入的操作 :涉及個人帳號(銀行、公司後台、社群發文)時,Manus 會停下來要求你在它的瀏覽器畫面中手動登入。這牽涉把憑證輸入第三方沙箱環境,企業情境下通常

定價結構:Credit 制怎麼算,實際多貴

Manus 目前採 Credit 點數制,而非依時間或對話則數計費。每次任務消耗的 Credit 取決於執行步驟數、工具呼叫次數與虛擬機運行時間,這代表同樣訂閱方案下,任務越複雜可用次數越少。 官方方案分層大致如下(以官方定價頁為準,方案內容調整頻繁): Free :每日少量免費 Credit,僅夠測試單一短任務。 Basic(約 US$19/月) :入門額度,適合每週數次的輕量任務。 Plus(約 US$39/月) :初期最受關注的方案,額度約為 Basic 的數倍。 Pro(約 US$199/月) :高額度加並行任務數提升,適合把 Agent 當常態工作流的使用者。 換算成單次成本,一項中等複雜度的研究任務(30–50 個來源、產出報表)大致落在 200–400 Credit 區間,意即 Plus 方案每月約可跑 10–20 次同級任務。與人工比較才有意義:同樣的競品價格蒐集若由人執行約需 2–3 小時,US$39 月費在只要每月用滿 5 次的情況下即已回本。反過來說,若你的任務是「每次都要人工重新核對全部數據」,時間成本並未真正下降。 值得對照的是市場對這類 Agent 的整體付

相關工具書

由 FeiYueh 親自審稿驗證 · 最後更新於 2026-09-17. Independently maintained — not AI-generated boilerplate.

← Back to Blog