目錄
本文資訊彙整自 2026 年 9 月。Gemini API 定價、模型版本與使用條件更新很快,正式導入前仍建議重新確認最新 API Pricing 與 Model Documentation。
Gemini 3.8 Flash 在 2026 年 9 月 2 日正式推出,API 首發價格和三週前的 Gemini 3.7 Flash 完全一樣:每 100 萬輸入 Token 0.75 美元、輸出 Token 3.75 美元。只看價目表,升級幾乎沒有成本;實際跑 Agent 任務時,帳單卻可能比 3.7 Flash 高。Google 自己已經先提醒,3.8 Flash 遇到複雜工作會多走幾步推理、反覆呼叫工具,而且在較高 Thinking Level 下可能使用更多 Token。第三方評測 Artificial Analysis 也觀察到,高推理設定下的平均單任務成本從 3.7 Flash 約 0.40 美元提高到 3.8 Flash 約 0.58 美元,增幅接近 40%。
這次更新真正需要重新理解的,不是 Flash 還算不算便宜模型,而是 Token 單價已經不足以單獨判斷一個 Agent Workflow 的成本。同樣每 100 萬 Token 3.75 美元,一個回答一次就完成的模型,和一個會多推理幾輪、驗證結果、重新呼叫工具的模型,最後的任務帳單本來就不會一樣。
Gemini 3.8 Flash是什麼?六週內第三款Flash模型
Gemini 3.8 Flash 是 Google 在 2026 年 9 月 2 日推出的新一代 Flash 模型,主打長時間軟體工程、Autonomous Agents,以及需要多步驟推理的企業工作。Google 8 月 13 日才發布 Gemini 3.7 Flash,而這次 3.8 又在三週後接上;官方也直接形容這是六週內的第三次 Flash 發表。
這種發布速度很容易讓版本號看起來像完全不同的一代模型,但 3.8 的實際關係比較接近 3.7 的延伸。Google DeepMind 的 Model Card 明確寫著 Gemini 3.8 Flash is based on Gemini 3.7 Flash,架構、Training Dataset、Data Processing、Hardware 與 Software 等欄位也都直接指向 3.7 Flash 的說明。比較準確的說法不是「3.8 完全沒有架構變化」,而是 Google 沒有替 3.8 公布另一套獨立架構,它仍建立在 3.7 Flash 的基礎上。
3.8 Flash真正增加的是更長的推理與Agent迴圈
Google 對這次升級的描述很直白:3.8 Flash 會 works harder。遇到困難、多步驟工作時,模型會執行更多 Reasoning Steps、反覆呼叫 Tools,再檢查前面的結果,而不是盡快產生第一個答案。這些行為可以提高複雜任務的成功率,代價就是時間與 Token Consumption 都可能增加。
Gemini 3.8 Flash 目前提供 Low、Medium、High 三種 Thinking Level,其中 Medium 是預設值。Low 適合即時聊天、Draft、快速資料分析等比較在意延遲的工作;Medium 是 Google 建議大部分複雜 Coding 與 Agent Use Case 使用的設定;High 則會把更多資源放在 Reasoning 和 Tool Orchestration 上。
這個設定很重要,因為從 3.8 開始,「使用 Gemini 3.8 Flash」本身已經不是完整的成本描述。同一款模型在 Low 和 High 下,可以產生完全不同的延遲、Token 數與最後帳單。
Gemini 3.8 Flash比3.7 Flash強多少?先把官方與第三方數字分開看
Google 公布的 3.8 Flash Benchmark 主要集中在長時間 Coding、Agentic Workflows 與專業推理。DeepSWE v1.1 的官方比較圖裡,3.8 Flash 約為 71.0%,3.7 Flash 則是 65.3%;HLE-Verified 則達到 54.9%,高於 3.7 Flash 的 53.6%。Google 也表示 3.8 在 Vals Finance Agent V2 與 Harvey's Legal Agent Benchmark 等專業 Agent 評測上優於前代。
這些數字適合用來看模型能力往哪裡移動,但仍然是 Google 發布時選擇公開的 Benchmark,不適合直接換算成「實際工作一定多成功幾%」。
第三方 Artificial Analysis 提供了另一個角度。Gemini 3.8 Flash 在 High Reasoning 下的 Intelligence Index 為 59,3.7 Flash 為 56,增加 3 分;Medium 為 57,Low 為 52。三分不是很誇張的代際差距,比較像同一條產品線再往前推一段。
更有意思的其實不是分數,而是成本。Artificial Analysis 計算 3.8 Flash High 的 Intelligence Index Cost per Task 約為 0.58 美元,3.7 Flash High 約 0.40 美元;在每 Token 價格完全相同的情況下,單任務成本反而提高約 40%。該機構觀察到 3.8 Flash 平均 Output Tokens 增加約 30%,Agentic Evaluations 裡也用了更多 Turns。
這組數據剛好把 Google 說的「works harder」翻成比較容易看懂的帳單:能力提升不是免費送進同一批 Token 裡,而是模型願意為了完成困難工作多花一些計算。
Gemini 3.8 Flash價格沒漲,為什麼實際API成本還是可能增加?
輸出價格包含看不到的Thinking Tokens
Gemini API 對 3.8 Flash 的 Standard Pricing 是每 100 萬輸入 Token 0.75 美元、每 100 萬輸出 Token 3.75 美元,而且 Google 特別註明 Output Price 包含 Thinking Tokens。也就是說,完整推理過程即使沒有逐字顯示在最終答案裡,模型實際使用的 Thinking Tokens 仍屬於計費範圍。
因此,看到一段只有 500 字的最終輸出,不能直接用肉眼看到的答案長度估算費用。如果 High Thinking 為了這段答案跑了比較長的內部推理,Output Usage 仍然會高於表面文字量。
這也是 3.8 Flash 和「以前 Flash 就等於低成本」直覺最大的差別。每 Token 仍然便宜,但模型現在有更多空間自行決定需要花多少 Token 才完成工作。
Tool Calls變多,也可能把任務總成本繼續往上推
3.8 Flash 的另一個設計是會在複雜 Agent Task 裡重複呼叫工具。使用 Function Calling 串自己的系統時,真正增加的是迴圈數、Context 與後續 Token;如果使用 Google Search Grounding 或 Google Maps,還有獨立的 Tool Pricing。
Gemini 3.x 目前每月共用 5,000 次免費 Search Requests,超過後 Google Search Grounding 為每 1,000 次 Query 14 美元;Maps 也有自己的免費額度與後續計費。
所以 Agent Workflow 的真實成本至少要拆成兩層:模型用了多少 Input/Output/Thinking Tokens,以及這次執行總共呼叫了多少另外計價的服務。只看 Model Token Price,很容易漏掉第二筆帳。
3.8 Flash和3.7 Flash價格真的完全一樣嗎?
截至 2026 年 12 月 31 日,Standard API 的確完全一樣。兩款模型的 Introductory Pricing 都是:
| 模型 | 輸入/100萬Token | 輸出/100萬Token | Cache Read/100萬Token |
| Gemini 3.8 Flash | US$0.75 | US$3.75 | US$0.075 |
| Gemini 3.7 Flash | US$0.75 | US$3.75 | US$0.075 |
輸出價格都包含 Thinking Tokens。
但這組數字是 Introductory Price,不是長期標準價。Google 已經直接在 Pricing Page 和 3.8 發表公告裡寫明,優惠到 2026 年 12 月 31 日結束。
2027年1月1日起,Standard價格會直接翻倍
從 2027 年 1 月 1 日開始,Gemini 3.8 Flash Standard Pricing 會調整成:
- Input:US$1.50/100 萬 Tokens
- Output:US$7.50/100 萬 Tokens
- Context Cache Read:US$0.15/100 萬 Tokens
- Cache Storage:US$1.00/100 萬 Tokens/小時
目前優惠期的 Cache Storage 是 US$0.50/100 萬 Tokens/小時,因此這一項同樣會翻倍。
如果一套服務準備跑到 2027 年,現在用 0.75/3.75 美元做全年預算會明顯低估成本。9 月到 12 月比較適合拿來量真實 Token Usage,再用 1.50/7.50 美元重算一次明年的 Run Rate。
Gemini 3.8 Flash和GPT-5.6 Sol、Claude Opus 5的價格怎麼比?
截至 2026 年 9 月 3 日,幾款模型的公開 API Token Price 如下:
| 模型 | 輸入/100萬Token | 輸出/100萬Token | 定價狀態 |
| Gemini 3.8 Flash | US$0.75 | US$3.75 | 優惠至 2026/12/31 |
| Gemini 3.8 Flash | US$1.50 | US$7.50 | 2027/1/1 起 |
| GPT-5.6 Sol | US$4.00 | US$20.00 | 優惠至少至 2026/11/21 |
| Claude Opus 5 | US$5.00 | US$25.00 | 目前標準價格 |
即使明年 Gemini 3.8 Flash 恢復到 1.50/7.50 美元,目前帳面 Token Rate 仍明顯低於 Opus 5,也低於 GPT-5.6 Sol 現行優惠價格。
但這張表只能拿來看「單位 Token 費率」,不能直接回答哪一款模型跑同一項工作最便宜。不同模型的 Tokenizer、Reasoning Token Usage、Tool Turns、一次成功率與 Retry Rate 都不同。便宜模型如果需要大量重試,最後可能沒有價目表看起來那麼省;較貴的模型如果第一輪就完成,也可能在特定工作上有更好的 Cost per Successful Task。
這也是 Artificial Analysis 的每任務成本比單純 API Price 更值得參考的原因。不過 0.58 美元同樣只是它那套 Intelligence Index Workload 的測量值,不是一般 API 使用者每次叫 3.8 Flash 都會花 0.58 美元。
Gemini 3.8 Flash Cyber是什麼?和一般3.8 Flash有什麼關係?
Google 這次同步推出 Gemini 3.8 Flash Cyber,主打 Vulnerability Discovery 與 Automated Patching,但沒有全面開放 API,而是透過新的 Fairwind Program 提供給通過審核的政府機關、Critical Infrastructure Operators、Software Maintainers 與其他 Trusted Defenders。
一般 3.8 Flash 和 Cyber 不是兩個完全無關的模型。Google 表示兩者使用同一套 Foundational Intelligence,而這次共同核心的 Coding 與 Reasoning 提升,一部分來自 Cybersecurity Training,另一部分來自可以反覆評估、修正模型表現的 Long-running Agentic Loops。
差別主要在部署環境與 Safeguards。一般 3.8 Flash 對 CBRN 與 Cyber Offense 有較完整的 Misuse Safeguards;3.8 Flash Cyber 的 Cyber Mitigations 比較寬鬆,因此 Fairwind Program 會另外要求組織審查、使用者層級 Authentication、Phishing-resistant MFA、Access Control 與員工使用紀錄。
所以原本「Cyber 版本不重要,只是揭露一般模型為什麼變強」可以稍微修正。對一般 API 使用者確實不需要把 Cyber 納入模型選型,但它說明 Google 正把一般模型與高風險專業能力拆成不同 Access Tier,而且資安訓練確實回饋到了兩款模型共用的核心能力。
至於 Cyber 版實際拿去當安全審查工具的表現,目前仍需要保守看待。Google 公布了 CyberGym、CWE-Bench 與內部 20 種程式語言 Vulnerability Benchmark 等成果,但部分數字來自 Google 內部測試,公開資料也沒有提供足夠資訊把 False Positive Rate 完整換算出來。
Gemini 3.8 Flash對API使用者最大的改變,是成本預設值不能只看Flash標籤
以前選 Flash,通常就是在速度、品質與預算之間先選便宜的那一邊。3.8 Flash 還是便宜,但現在多了一個新的成本旋鈕:Thinking Level。
如果大量工作只是資料整理、摘要、Draft、格式轉換或簡單分類,直接把所有 Request 都開到 High 並不划算。Google 自己就建議 Compute Efficiency 優先的 Workflow 使用較低 Effort,或者繼續使用 Gemini 3.7 Flash。
比較合理的做法,是把 Reasoning Level 當成任務設定,而不是模型設定。簡單工作走 Low,真正需要多步驟分析時再提高到 Medium 或 High。這比所有 Request 固定用同一個 Thinking Level,更接近實際成本需求。
六週連發三款Flash,模型版本還適合直接寫死在工作流嗎?
3.6、3.7、3.8 Flash 在很短的時間內接連推出,確實提高了版本維護頻率。不過這不代表每次新版本發布,上一版就會立即停用。Google 這次反而明確表示,Gemini 3.7 Flash 仍會完整支援,Compute Efficiency 優先的工作可以繼續使用。
實務上真正需要避免的,是把 Prompt、測試結果與程式邏輯全部綁死在「某個版本一定有某種輸出習慣」上。Agent Model 更新後,即使 API Schema 不變,回答長度、Tool Calling Frequency 或 Reasoning Behavior 都可能改變。
一套簡單的 Regression Test 比追每一個 Benchmark 實用很多。固定留下 5~10 個真實任務,每次換版本就跑同一套題目,檢查成功率、Token Usage、Latency、Tool Calls 與輸出格式。這樣才能知道新版是真的比較適合目前的 Workflow,還是單純 Benchmark 更高。
Gemini 3.8 Flash導入前,可以先做五個成本測試
步驟一:挑5到10個平常真的會跑的任務
不要從 Benchmark 題目開始,可以直接從現有工作流挑:資料摘要、Coding Issue、資料分類、報表生成、Agent Tool Use,各選幾個最常出現的案例。每一題固定 Input、判定成功的條件,以及可以接受的最大延遲。
步驟二:3.7與3.8用同樣條件各跑一次
兩款模型目前 Token Rate 相同,因此這一步最容易看出 3.8 的「多想一點」到底花多少成本。除了 Input/Output Tokens,也要留下 Tool Calls、重試次數與整體完成率。
如果 3.8 多花 30% Tokens,卻能把原本兩次才成功的任務變成一次完成,帳單不一定比較差;反過來,如果簡單任務品質幾乎沒有變,額外 Token 就只是支出。
步驟三:同一項任務測Low、Medium、High三種Thinking Level
Medium 是目前預設設定,但不代表每一項工作都應該停在 Medium。Low 的 Intelligence Index 在第三方測試裡雖然比 High 低,但速度更快、First-token Latency 也明顯縮短。
先找到「剛好能穩定完成」的最低 Effort,比直接把所有工作推到 High 更適合長期跑 API。
步驟四:成本計算不要只放Input和Output
至少把以下幾項分開記:
- Uncached Input Tokens
- Cached Input Tokens
- Output+Thinking Tokens
- Google Search/Maps Grounding Queries
- 外部 Tool/API 自己的費用
- Retry 次數
Agent Workflow 真正容易失控的通常不是其中一項,而是同一個任務在多輪 Loop 裡把幾種費用一起放大。
步驟五:用2027價格再算一次
目前 0.75/3.75 美元很適合測試,但正式做 2027 預算時應直接使用 1.50/7.50 美元。Cache Read 和 Cache Storage 也一起調整,不要只把 Input/Output 乘二。
如果按標準價重算之後仍在可以接受的範圍,才比較適合把 3.8 Flash 放進長期 Production Workflow。
3.7 Flash 目前也沒有必要立刻移除。Google 已明確表示會繼續支援,在偏向成本與效率的工作上,它本來就是官方留下的選項。模型 ID 可以放在 Environment Variable 或 Config 裡,讓版本切換不用改整套 Business Logic。
Gemini 3.8 Flash 這次真正改掉的,是「Flash 價格低,所以任務一定便宜」這種簡單判斷。Google 沒有提高每 Token 單價,Artificial Analysis 卻量到 High Reasoning 下每任務成本增加約 40%;兩件事同時成立,原因只是 3.8 願意花更多 Token 和更多 Agent Turns 把事情做完。
這也讓模型選型變得比較像一般軟體成本管理。價目表只決定每一單位多少錢,真正影響月底帳單的是每次任務到底用了多少單位、成功幾次,以及失敗後重跑多少次。
九月到年底這段優惠期最適合拿來量這些數字。等到 2027 年價格翻倍後,再開始研究工作流到底用了多少 Thinking Tokens,會比現在多付一輪學費。
常見FAQs
截至 2026 年 12 月 31 日,Standard API 為每 100 萬輸入 Token 0.75 美元、每 100 萬輸出 Token 3.75 美元,輸出費用已包含 Thinking Tokens。2027 年 1 月 1 日起會調整為輸入 1.50 美元、輸出 7.50 美元。
因為每 Token 價格相同,不代表每個任務使用的 Token 數相同。Google 表示 3.8 Flash 在複雜任務裡會執行更多 Reasoning Steps 並反覆呼叫 Tools;Artificial Analysis 也測到 High Reasoning 下平均單任務成本約 0.58 美元,高於 3.7 Flash 的 0.40 美元。
需要。Google Gemini API Pricing 明確標示 3.8 Flash 的 Output Price including thinking tokens,因此沒有直接顯示在最終回答裡的 Thinking Tokens 仍會計入 Output Usage。
目前支援 Low、Medium、High,Medium 是預設值。簡單、低延遲工作可以先測 Low;複雜 Coding 和一般 Agentic Use Cases 可以從 Medium 開始;High 適合真正需要較多 Reasoning 與 Tool Orchestration 的工作。沒有必要把所有 API Request 固定設為 High。
可以。Google 在 3.8 Flash 公告中明確表示,3.7 Flash 仍會 fully supported,而且特別推薦給 Compute Efficiency 優先的 Workflow。目前沒有必要因為 3.8 上線就立刻把所有 Production Workflow 強制升級。
目前不能直接像一般 Gemini API 一樣使用。Gemini 3.8 Flash Cyber 透過 Fairwind Program 提供給通過審核的 Trusted Defenders,包括政府、Critical Infrastructure Operators、Software Maintainers 等對象,而且有額外的身分驗證與使用限制。
目前官方和第三方評測都顯示有進步,但不像完整跨代更新。Artificial Analysis 的 Intelligence Index 從 56 提高到 59;Google 的長時間 Coding 與專業推理 Benchmark 也有提升。是否值得升級,仍應以實際工作成功率、Token Usage 與 Cost per Successful Task 為準。
Gemini 3.8 Flash 在 2026 年 9 月 2 日正式推出。Google 表示這是六週內第三次 Flash 發表,前一代 Gemini 3.7 Flash 則是在 8 月 13 日推出。