Gemini 3.8 Flash 模型介紹:1M Context、長時間 Agent 與低成本推理
前言
Google 在 2026 年 9 月 2 日公開 Gemini 3.8 Flash。這次更新的重點,不只是把模型做得更快,而是把 Flash 定位成能長時間工作的工程型 Agent:可以持續規劃、呼叫工具、讀取大型上下文,並在多輪執行後交付結果。Google 官方發布公告
截至 2026 年 9 月 3 日,Gemini API 已將 gemini-3.8-flash 列為穩定版模型。它支援文字、圖片、影片、音訊與 PDF 輸入,最大輸入上下文為 1,048,576 tokens,最大文字輸出為 65,536 tokens。Gemini API 模型文件
這篇文章會從模型定位、規格、推理方式、Agent 工具鏈、價格與導入風險幾個角度,整理 Gemini 3.8 Flash 適合什麼工作,以及為什麼「Flash」不再只代表低延遲的聊天模型。
Gemini 3.8 Flash 是什麼?
Gemini 3.8 Flash 是 Gemini 3 系列的通用型模型,官方將它描述為目前最具智慧的 Flash workhorse model,主要面向長時間軟體工程、自治 Agent、企業工作流與複雜知識任務。模型卡則指出,3.8 Flash 建立在 Gemini 3.7 Flash 之上,並延續可調整的 effort level,讓開發者在品質、成本與延遲之間取捨。Gemini 3.8 Flash Model Card
這次發布還有另一個獨立變體 Gemini 3.8 Flash Cyber,專門提供漏洞發現與自動修補能力,透過 Fairwind Program 對受信任的防禦團隊開放。一般開發者在 Gemini API 使用的是 gemini-3.8-flash,不要把 Flash 與受限存取的 Flash Cyber 混為同一個公開 endpoint。
核心規格與能力
| 項目 | Gemini 3.8 Flash |
|---|---|
| API model code | gemini-3.8-flash |
| API 狀態 | Stable |
| 輸入 | Text、Image、Video、Audio、PDF |
| 最大輸入上下文 | 1,048,576 tokens(約 1M) |
| 最大輸出 | 65,536 tokens(約 64K),包含 thinking tokens 的計費輸出 |
| Thinking | low、medium、high;不支援 minimal |
| 工具與能力 | Context caching、Code execution、Computer use(Preview)、File search、Function calling、Google Search/Maps grounding、Structured outputs、URL context |
| 不支援 | Audio generation、Image generation、Live API |
| 批次與延遲選項 | Batch API、Flex inference、Priority inference |
這份清單來自 Google AI for Developers 的模型頁面;實際可用功能仍會受 API 版本、SDK 與使用環境影響,尤其是標示為 Preview 的 Computer Use。完整能力矩陣
3.8 Flash 的主要改變
1. 從單次回答轉向長時間工程任務
Google 的發布資料把 Gemini 3.8 Flash 的主要進步放在 DeepSWE v1.1 長時間軟體工程評測、Vals Finance Agent V2、Harvey Legal Agent Benchmark,以及 HLE-Verified 等工作型 benchmark。Google 表示,3.8 Flash 在 DeepSWE v1.1 上能端到端解決複雜工程問題,並在 HLE-Verified 得到 54.9%。官方 benchmark 說明
這些結果應該理解成「發布方在指定設定下的測試結果」,不能直接等同於每個團隊在真實程式碼庫都會得到 54.9% 的成功率。實際表現還會受到 repository 規模、測試品質、工具權限、上下文整理方式與 Agent harness 設計影響。Google 也在 Model Card 中另外提供評測方法入口,方便讀者查看 benchmark 的範圍與限制。Gemini 3.8 Flash 評測方法
2. 模型會「做更多事」,不只是回答更快
Google 將 3.8 Flash 的效果歸因於更長時間的 Agent loop:模型會執行額外的推理步驟、反覆呼叫工具,再根據結果修正方向。這種設計對 repository migration、跨檔案重構、需要執行測試的除錯,以及必須查資料後產出報告的任務特別有價值。
代價是 token 使用量可能上升。官方明確提醒,在較高 effort level 下,模型可能使用更多 tokens 以換取更好的表現;如果工作主要受限於成本或延遲,可以降低 effort level,或繼續使用 3.7 Flash 處理效率優先的任務。Google 對 reasoning 與 token 使用的說明
3. 多模態上下文與工具鏈形成同一個工作面
1M input context 的意義不只是「可以貼一篇更長的文章」,而是可以把程式碼、設計文件、PDF、錯誤日誌、執行結果與圖片放進同一個任務上下文,再由 Agent 決定是否需要搜尋、執行程式或呼叫外部函式。
因此,Gemini 3.8 Flash 比較適合被當成一個工作流中的推理核心,而不是獨立的聊天視窗。模型本身仍然不會自動取得你的資料庫或伺服器權限;你必須透過工具介面、權限邊界與執行沙盒,把它需要的能力明確暴露出來。
Agent 工作流可以怎麼設計?
一個可控的 Gemini 3.8 Flash Agent,應該把模型的推理與副作用分開:模型負責規劃與提出工具呼叫,工具執行器負責驗證參數、套用權限、執行動作,再把結果交回模型。
flowchart LR
A["使用者任務"] --> B["Gemini 3.8 Flash"]
B --> C["規劃與 thinking"]
C --> D["Function / Search / Code 工具"]
D --> E["執行結果與觀測資料"]
E --> B
B --> F["驗證後的最終輸出"]
基本 API 呼叫
官方目前的文字生成文件以 Google GenAI SDK 與 Interactions API 示範 thinking_level。下面的程式碼只展示最小呼叫,不包含 API key 管理與工具執行器:
1 | from google import genai |
thinking_level 應該依任務設定:簡單分類或格式轉換可以使用 low;需要跨檔案分析、規劃多步驟操作或審查設計時,才考慮 medium 或 high。目前模型頁面列出的可用值是 low、medium、high,傳入 minimal 會出錯。Thinking 設定文件
Function calling 不是自動授權
使用 Function calling 時,模型會產生函式名稱與參數,實際執行仍由應用程式負責。生產環境至少應加入以下控制:
- 只允許明確登記的函式與參數型別。
- 對寫入、刪除、付款、部署與權限變更要求人工核准。
- 每次工具呼叫都設定 timeout、重試上限、冪等鍵與 audit log。
- 將讀取工具和寫入工具分開授權,避免模型用同一組憑證完成整條副作用鏈。
- 把工具輸出視為不可信資料,避免外部內容透過 prompt injection 改寫原始任務。
Google 的 Function calling 文件也將工具用途分成採取行動、補充知識與擴充模型能力三類;這表示 Agent 的可靠性不只取決於模型,也取決於工具契約與執行器設計。Function calling 官方文件
Computer Use 要額外做安全設計
Gemini 3.8 Flash 支援 Computer Use,但目前是 Preview。Google 文件指出,Gemini 3.5 Flash 以上的 Computer Use 可以啟用 prompt injection detection,檢查畫面中是否藏有「忽略前面指令」之類的惡意指示;這項防護是 opt-in,預設值為 false。Computer Use 安全設定
所以只要 Agent 能操作瀏覽器或桌面,就不應把「看得到畫面」當成「可以安全執行任何動作」。敏感操作仍應停在人工確認頁,並將瀏覽器工作區、檔案系統與網路出口限制在最小範圍。
價格與快取成本
以下是 Gemini Developer API 在 2026 年 9 月 3 日查到的 USD 價格。Google 將 3.8 Flash 的價格標成 introductory pricing,2027 年 1 月 1 日會調整:
| 用量模式 | Input / 1M tokens | Output / 1M tokens | 適合場景 |
|---|---|---|---|
| Standard(至 2026-12-31) | $0.75 | $3.75 | 即時互動、一般 Agent |
| Standard(2027-01-01 起) | $1.50 | $7.50 | 正式長期價格 |
| Batch / Flex(至 2026-12-31) | $0.375 | $1.875 | 可非同步或可延遲工作 |
| Priority(至 2026-12-31) | $1.35 | $6.75 | 需要較高服務優先權 |
輸出價格包含 thinking tokens,因此不能只用使用者看見的回答長度估算成本。Context caching 的 cached input 價格在 2026 年底前為每 1M tokens $0.075,之後為 $0.15;另有每 1M tokens 每小時 $0.50、之後 $1.00 的儲存費。Google Search grounding 則提供每月共用的 5,000 次免費搜尋請求,超過後每 1,000 次為 $14。Gemini Developer API pricing
快取策略要配合 Agent 結構
Gemini API 對 Gemini 2.5 以上模型預設支援 implicit caching。3.8 Flash 的 implicit cache 最低輸入門檻是 4,096 tokens;若想提高 cache hit 機率,應把大型且共用的內容放在 prompt 開頭,並在短時間內重複使用相同的前綴。Context caching 文件
這對長時間 Agent 很重要:系統指令、repository 摘要、資料模型與工具 schema 可以形成穩定前綴,而每一輪的任務狀態與工具結果放在後面。要注意的是,Interactions API 目前只支援 implicit caching;如果需要手動建立與管理 cache object,應改用 generateContent API。
導入時的工程建議
先用任務分流控制成本
不要讓所有請求都直接使用 high。可以依任務風險分流:
- 低風險、短答案、固定格式:
low。 - 需要幾次工具呼叫的查詢與報表:
medium。 - 跨檔案修改、設計審查、長時間除錯:
high,並設定總 token 與時間上限。
這裡的重點不是「永遠使用最高推理」,而是讓 effort level 成為明確的容量與成本控制項。
把 Agent 當成分散式系統觀測
一個長時間 Agent 會有多輪 model turn、工具延遲、失敗重試與上下文增長,因此應記錄:
- 每一輪的 input、output、cached tokens 與 thinking 使用量。
- 工具呼叫名稱、參數雜湊、耗時、結果大小與錯誤類型。
- Agent loop 次數、停止原因、人工介入次數與最終成功率。
- 同一任務在不同
thinking_level下的成本、延遲與品質差異。
沒有這些資料,就無法知道模型真的變聰明,還是只是花了更多 tokens 和更多工具呼叫。
用自己的工作負載做回歸評測
官方 benchmark 適合用來了解發布方向,但正式採用前仍應建立自己的 evaluation set,例如:
- 真實 repository 的 issue、migration 與 regression bug。
- 具有權限邊界的工具呼叫案例。
- 多語言 PDF、日誌與截圖混合的知識任務。
- 需要拒絕危險動作、要求人工核准的安全案例。
對 Agent 而言,「能不能完成」不是唯一指標;工具呼叫是否正確、是否會無限重試、是否能在錯誤後恢復,以及是否留下可追蹤的決策紀錄,通常更接近生產風險。
限制與注意事項
第一,Gemini 3.8 Flash 的知識截止日期是 2026 年 3 月;Model Card 也提醒,部分領域的可用知識可能仍只到 2025 年 1 月。因此,模型名稱雖然是 2026 年 9 月發布,並不代表它知道發布日之後的所有事件。Model Card 的知識截止與限制
第二,官方列出的已知限制包含幻覺、偶發的速度或 timeout 問題,以及高 effort level 可能使用更多 tokens。這些限制在長時間 Agent 中會被放大:一次錯誤的工具參數可能造成多輪錯誤,timeout 也可能讓工作流停在半完成狀態。
第三,3.8 Flash 的公開資料主要證明它在 coding、agentic task 與多步驟推理上的方向性提升,並沒有公開所有架構細節。Model Card 明確指出它是建立在 3.7 Flash 之上,因此不應自行推論成完全不同的模型架構,或把 Google 的宣稱 benchmark 當成獨立測試結論。
總結:Flash 正在變成 Agent 的工作馬
Gemini 3.8 Flash 的核心價值,可以濃縮成三件事:1M context 讓大型工作資料能留在同一個任務裡;可調整的 thinking 讓品質、成本與延遲可以分級;工具與多模態支援則讓模型能參與真正的工作流。
如果你的需求是 repository 級別的程式碼工作、跨文件研究、需要搜尋與函式呼叫的企業 Agent,3.8 Flash 值得列入測試名單。它的定位不是「用最低價格回答一句話」,而是用 Flash 的成本結構承擔更長的推理與工具迴圈。導入時,請把 token budget、快取、工具權限、人工核准與可觀測性一起設計,才能把模型能力轉成可維運的系統。
參考資料
- Introducing Gemini 3.8 Flash and 3.8 Flash Cyber — Google
- Gemini 3.8 Flash — Gemini API
- Gemini Developer API pricing — Google AI for Developers
- Gemini 3.8 Flash Model Card — Google DeepMind
- Context caching — Gemini API
- Thinking with Gemini — Gemini API
- Computer use — Gemini API
- Function calling — Gemini API










