Gemini 3.8 Flash — Google 輕量模型的速度與省錢實測

Gemini 3.8 Flash 最值得注意的是價格:在 2026 年底前,它的單價只有旗艦模型的零頭,Terminal-Bench 2.1 卻拿到 90.8%,比 GPT-5.6 Terra 和 Claude Sonnet 5 都高。但它不是每個場景都便宜又快。在 high 思考等級下,首個 token 平均要等 1

Gemini 3.8 Flash 最值得注意的是價格:在 2026 年底前,它的單價只有旗艦模型的零頭,Terminal-Bench 2.1 卻拿到 90.8%,比 GPT-5.6 Terra 和 Claude Sonnet 5 都高。但它不是每個場景都便宜又快。在 high 思考等級下,首個 token 平均要等 16 秒,2027 年 1 月 1 日起價格也會翻倍。所以該怎麼選,要看工作是「批次、長任務」還是「即時對話」。 Gemini 3.8 Flash 是什麼:定位與規格 Gemini 3.8 Flash 是 Google 在 2026 年 9 月 2 日發布的輕量主力模型,也是 Google 六週內推出的第三個 Flash 版本。官方稱它為「最聰明的 workhorse 模型」,主打軟體工程、代理任務(agentic tasks)和多步驟專業推理,目標是用接近前沿模型的能力,搭配 Flash 等級的價格。同一天還推出了資安專用版 Gemini 3.8 Flash Cyber,只透過 Fairwind Program 開放給受信任的資安防禦方使用。完整公告見 Google 官方部落格:Introducing Gemini 3.8 Flash and 3.8 Flash Cyber 。 技術規格上,3.8 Flash 的上下文窗口約可放入一整套中型程式碼庫。依 Gemini API 官方模型文件 ,重點規格如下: 模型 ID : gemini-3.8-flash 輸入上限 :1,048,576 tokens; 輸出上限 :65,536 tokens 輸入類型 :文字、圖片、影片、音訊、PDF;輸出只有文字 思考等級 :支援 low、medium、high,不支援 minimal 支援功能 :Context caching、程式碼執行、結構化輸出、Function calling、Google 搜尋與 Google Maps grounding、Batch API、Flex/Priority 推論、Computer use(Preview) 不支援 :音訊生成、圖片生成、Live API 不支援 Live API 代表 3.8 Flash 不適合即時語音對話。做語音客服的團隊需要另外搭配其他模型。 速度實測:生成快,但思考會拖慢首字 Gemini 3.8 Flash 生成文字的速度,在同級模型中偏快。依第三方評測機構的公開實測, 「Gemini 3.8 Flash(high)輸出速度 299 tokens/秒,2026 年 9 月測得」(來源:Artificial Analysis) 。換算下來,一段 1,000 tokens 的回答,純生成時間約 3.3 秒。 要特別留意的是首字延遲(TTFT)。同一份評測中, 「Gemini 3.8 Flash(high)首個 token 延遲為 16.09 秒」(來源:Artificial Analysis) 。這 16 秒大多花在模型內部推理。所以在 high 等級下,使用者按下送出後,要等十幾秒才會看到第一個字。 三種思考等級該怎麼選 思考等級決定智能分數和延遲之間怎麼取捨。Artificial Analysis 的 Intelligence Index 顯示,high 得 41 分、medium 得 40 分、low 得 34 分。從 medium 升到 high 只多 1 分,延遲和 token 用量卻會明顯增加。實務建議如下: 即時聊天、客服、表單填寫 :用 low。智能分數 34 已高於 Gemini 3.1 Pro Preview 的 30 分,首字延遲也最短。 一般文件分析、摘要、翻譯 :用 medium。分數只比 high 少 1 分,每個評測任務成本 0.93 美元,high 則是 1.24 美元,便宜約 25%。 多步驟程式修改、長鏈代理任務 :用 high。這類工作本來就是背景執行,16 秒的首字等待影響不大。 省錢實測:價格結構與實際帳單估算 Gemini 3.8 Flash 目前採用限時推廣價,2027 年起單價翻倍。依 Google 官方公告, 「Gemini 3.8 Flash 推廣價為每百萬輸入 tokens 0.75 美元、每百萬輸出 tokens 3.75 美元,2027 年 1 月 1 日起調整為 1.50/7.50 美元」(來源:Google) 。推廣價和前一代 3.7 Flash 相同。 和前沿旗艦模型相比,價差在一個數量級左右。依 「2026 年 9 月 GPT-5.6 Sol 約每百萬輸入/輸出 tokens 5/30 美元,Claude Fable 5.1 為 10/50 美元」(來源:DataCamp) ,以每天處理 100 萬輸入

FAQ

Gemini 3.8 Flash 是什麼:定位與規格

Gemini 3.8 Flash 是 Google 在 2026 年 9 月 2 日發布的輕量主力模型,也是 Google 六週內推出的第三個 Flash 版本。官方稱它為「最聰明的 workhorse 模型」,主打軟體工程、代理任務(agentic tasks)和多步驟專業推理,目標是用接近前沿模型的能力,搭配 Flash 等級的價格。同一天還推出了資安專用版 Gemini 3.8 Flash Cyber,只透過 Fairwind Program 開放給受信任的資安防禦方使用。完整公告見 Google 官方部落格:Introducing Gemini 3.8 Flash and 3.8 Flash Cyber 。 技術規格上,3.8 Flash 的上下文窗口約可放入一整套中型程式碼庫。依 Gemini API 官方模型文件 ,重點規格如下: 模型 ID : gemini-3.8-flash 輸入上限 :1,048,576 tokens; 輸出上限 :65,536 tokens 輸入類型 :文字、圖片、影片、音訊、PDF;輸出只有文字 思考等級 :支援 low、medium、high,

能力實測:哪些任務進步明顯、哪些原地踏步

Gemini 3.8 Flash 進步最多的是終端機操作和代理任務,通用知識推理幾乎沒有變化。依 「Gemini 3.8 Flash 在 Terminal-Bench 2.1 得分 90.8%,3.7 Flash 為 81.6%」(來源:DataCamp) ,同一項測試中 GPT-5.6 Terra 為 87.4%、Claude Sonnet 5 為 80.4%。 其他基準的變化幅度差很多: τ³-bench Banking(代理任務) :30.9% 提升到 38.1%,多 7.2 個百分點 SWE-Atlas :48.0% 提升到 51.9%,多 3.9 個百分點 CharXiv(圖表理解) :84.5% 提升到 86.2%,多 1.7 個百分點 SWE-Bench Pro :60.4% 提升到 61.6%,只多 1.2 個百分點 Humanity's Last Exam :45.7% 變成 45.4%,基本持平 如果主要用途是問答、知識查詢或一般寫作,從 3.7 Flash 升級到 3.8 Flash,品質差異有限,token 消耗反而變多。如果主要用途是自動化腳本、程式修改或多步

哪些情境該選 3.8 Flash、哪些不該

決定要不要用 Gemini 3.8 Flash,主要看任務對延遲的容忍度,以及任務是否屬於代理或工程類。可以依下列條件判斷: 適合的情境 背景執行的程式碼修改、測試修復、終端機自動化 長文件、長影片、整份 PDF 的分析,可善用 100 萬 tokens 的上下文 金融、法律等專業領域的多步驟代理流程(官方在 Vals Finance Agent V2、Harvey Legal Agent Benchmark 皆列出領先成績) 2026 年內想用低成本大量試跑的原型專案 不適合的情境 即時語音互動:不支援 Live API 需要生成圖片或音訊的應用:只能輸出文字 要求 2 秒內回應、又需要深度推理的前台功能:high 等級的首字延遲約 16 秒 以通用知識問答為主、且已穩定使用 3.7 Flash 的系統:HLE 分數沒有提升,升級效益低

相關文章

相關工具書

由 FeiYueh 親自審稿驗證 · 最後更新於 2026-10-03. Independently maintained — not AI-generated boilerplate.

← Back to Blog