前言

Google 在 2026 年 9 月 2 日公開 Gemini 3.8 Flash。這次更新的重點,不只是把模型做得更快,而是把 Flash 定位成能長時間工作的工程型 Agent:可以持續規劃、呼叫工具、讀取大型上下文,並在多輪執行後交付結果。Google 官方發布公告

截至 2026 年 9 月 3 日,Gemini API 已將 gemini-3.8-flash 列為穩定版模型。它支援文字、圖片、影片、音訊與 PDF 輸入,最大輸入上下文為 1,048,576 tokens,最大文字輸出為 65,536 tokens。Gemini API 模型文件

這篇文章會從模型定位、規格、推理方式、Agent 工具鏈、價格與導入風險幾個角度,整理 Gemini 3.8 Flash 適合什麼工作,以及為什麼「Flash」不再只代表低延遲的聊天模型。

Gemini 3.8 Flash 是什麼?

Gemini 3.8 Flash 是 Gemini 3 系列的通用型模型,官方將它描述為目前最具智慧的 Flash workhorse model,主要面向長時間軟體工程、自治 Agent、企業工作流與複雜知識任務。模型卡則指出,3.8 Flash 建立在 Gemini 3.7 Flash 之上,並延續可調整的 effort level,讓開發者在品質、成本與延遲之間取捨。Gemini 3.8 Flash Model Card

這次發布還有另一個獨立變體 Gemini 3.8 Flash Cyber,專門提供漏洞發現與自動修補能力,透過 Fairwind Program 對受信任的防禦團隊開放。一般開發者在 Gemini API 使用的是 gemini-3.8-flash,不要把 Flash 與受限存取的 Flash Cyber 混為同一個公開 endpoint。

核心規格與能力

項目 Gemini 3.8 Flash
API model code gemini-3.8-flash
API 狀態 Stable
輸入 Text、Image、Video、Audio、PDF
最大輸入上下文 1,048,576 tokens(約 1M)
最大輸出 65,536 tokens(約 64K),包含 thinking tokens 的計費輸出
Thinking lowmediumhigh;不支援 minimal
工具與能力 Context caching、Code execution、Computer use(Preview)、File search、Function calling、Google Search/Maps grounding、Structured outputs、URL context
不支援 Audio generation、Image generation、Live API
批次與延遲選項 Batch API、Flex inference、Priority inference

這份清單來自 Google AI for Developers 的模型頁面;實際可用功能仍會受 API 版本、SDK 與使用環境影響,尤其是標示為 Preview 的 Computer Use。完整能力矩陣

3.8 Flash 的主要改變

1. 從單次回答轉向長時間工程任務

Google 的發布資料把 Gemini 3.8 Flash 的主要進步放在 DeepSWE v1.1 長時間軟體工程評測、Vals Finance Agent V2、Harvey Legal Agent Benchmark,以及 HLE-Verified 等工作型 benchmark。Google 表示,3.8 Flash 在 DeepSWE v1.1 上能端到端解決複雜工程問題,並在 HLE-Verified 得到 54.9%。官方 benchmark 說明

這些結果應該理解成「發布方在指定設定下的測試結果」,不能直接等同於每個團隊在真實程式碼庫都會得到 54.9% 的成功率。實際表現還會受到 repository 規模、測試品質、工具權限、上下文整理方式與 Agent harness 設計影響。Google 也在 Model Card 中另外提供評測方法入口,方便讀者查看 benchmark 的範圍與限制。Gemini 3.8 Flash 評測方法

2. 模型會「做更多事」,不只是回答更快

Google 將 3.8 Flash 的效果歸因於更長時間的 Agent loop:模型會執行額外的推理步驟、反覆呼叫工具,再根據結果修正方向。這種設計對 repository migration、跨檔案重構、需要執行測試的除錯,以及必須查資料後產出報告的任務特別有價值。

代價是 token 使用量可能上升。官方明確提醒,在較高 effort level 下,模型可能使用更多 tokens 以換取更好的表現;如果工作主要受限於成本或延遲,可以降低 effort level,或繼續使用 3.7 Flash 處理效率優先的任務。Google 對 reasoning 與 token 使用的說明

3. 多模態上下文與工具鏈形成同一個工作面

1M input context 的意義不只是「可以貼一篇更長的文章」,而是可以把程式碼、設計文件、PDF、錯誤日誌、執行結果與圖片放進同一個任務上下文,再由 Agent 決定是否需要搜尋、執行程式或呼叫外部函式。

因此,Gemini 3.8 Flash 比較適合被當成一個工作流中的推理核心,而不是獨立的聊天視窗。模型本身仍然不會自動取得你的資料庫或伺服器權限;你必須透過工具介面、權限邊界與執行沙盒,把它需要的能力明確暴露出來。

Agent 工作流可以怎麼設計?

一個可控的 Gemini 3.8 Flash Agent,應該把模型的推理與副作用分開:模型負責規劃與提出工具呼叫,工具執行器負責驗證參數、套用權限、執行動作,再把結果交回模型。

flowchart LR
    A["使用者任務"] --> B["Gemini 3.8 Flash"]
    B --> C["規劃與 thinking"]
    C --> D["Function / Search / Code 工具"]
    D --> E["執行結果與觀測資料"]
    E --> B
    B --> F["驗證後的最終輸出"]

基本 API 呼叫

官方目前的文字生成文件以 Google GenAI SDK 與 Interactions API 示範 thinking_level。下面的程式碼只展示最小呼叫,不包含 API key 管理與工具執行器:

1
2
3
4
5
6
7
8
9
10
11
12
13
from google import genai

client = genai.Client()

interaction = client.interactions.create(
model="gemini-3.8-flash",
input="分析這個後端服務的資料流、錯誤處理與可觀測性風險。",
generation_config={
"thinking_level": "high",
},
)

print(interaction.output_text)

thinking_level 應該依任務設定:簡單分類或格式轉換可以使用 low;需要跨檔案分析、規劃多步驟操作或審查設計時,才考慮 mediumhigh。目前模型頁面列出的可用值是 lowmediumhigh,傳入 minimal 會出錯。Thinking 設定文件

Function calling 不是自動授權

使用 Function calling 時,模型會產生函式名稱與參數,實際執行仍由應用程式負責。生產環境至少應加入以下控制:

  • 只允許明確登記的函式與參數型別。
  • 對寫入、刪除、付款、部署與權限變更要求人工核准。
  • 每次工具呼叫都設定 timeout、重試上限、冪等鍵與 audit log。
  • 將讀取工具和寫入工具分開授權,避免模型用同一組憑證完成整條副作用鏈。
  • 把工具輸出視為不可信資料,避免外部內容透過 prompt injection 改寫原始任務。

Google 的 Function calling 文件也將工具用途分成採取行動、補充知識與擴充模型能力三類;這表示 Agent 的可靠性不只取決於模型,也取決於工具契約與執行器設計。Function calling 官方文件

Computer Use 要額外做安全設計

Gemini 3.8 Flash 支援 Computer Use,但目前是 Preview。Google 文件指出,Gemini 3.5 Flash 以上的 Computer Use 可以啟用 prompt injection detection,檢查畫面中是否藏有「忽略前面指令」之類的惡意指示;這項防護是 opt-in,預設值為 falseComputer Use 安全設定

所以只要 Agent 能操作瀏覽器或桌面,就不應把「看得到畫面」當成「可以安全執行任何動作」。敏感操作仍應停在人工確認頁,並將瀏覽器工作區、檔案系統與網路出口限制在最小範圍。

價格與快取成本

以下是 Gemini Developer API 在 2026 年 9 月 3 日查到的 USD 價格。Google 將 3.8 Flash 的價格標成 introductory pricing,2027 年 1 月 1 日會調整:

用量模式 Input / 1M tokens Output / 1M tokens 適合場景
Standard(至 2026-12-31) $0.75 $3.75 即時互動、一般 Agent
Standard(2027-01-01 起) $1.50 $7.50 正式長期價格
Batch / Flex(至 2026-12-31) $0.375 $1.875 可非同步或可延遲工作
Priority(至 2026-12-31) $1.35 $6.75 需要較高服務優先權

輸出價格包含 thinking tokens,因此不能只用使用者看見的回答長度估算成本。Context caching 的 cached input 價格在 2026 年底前為每 1M tokens $0.075,之後為 $0.15;另有每 1M tokens 每小時 $0.50、之後 $1.00 的儲存費。Google Search grounding 則提供每月共用的 5,000 次免費搜尋請求,超過後每 1,000 次為 $14。Gemini Developer API pricing

快取策略要配合 Agent 結構

Gemini API 對 Gemini 2.5 以上模型預設支援 implicit caching。3.8 Flash 的 implicit cache 最低輸入門檻是 4,096 tokens;若想提高 cache hit 機率,應把大型且共用的內容放在 prompt 開頭,並在短時間內重複使用相同的前綴。Context caching 文件

這對長時間 Agent 很重要:系統指令、repository 摘要、資料模型與工具 schema 可以形成穩定前綴,而每一輪的任務狀態與工具結果放在後面。要注意的是,Interactions API 目前只支援 implicit caching;如果需要手動建立與管理 cache object,應改用 generateContent API。

導入時的工程建議

先用任務分流控制成本

不要讓所有請求都直接使用 high。可以依任務風險分流:

  1. 低風險、短答案、固定格式:low
  2. 需要幾次工具呼叫的查詢與報表:medium
  3. 跨檔案修改、設計審查、長時間除錯:high,並設定總 token 與時間上限。

這裡的重點不是「永遠使用最高推理」,而是讓 effort level 成為明確的容量與成本控制項。

把 Agent 當成分散式系統觀測

一個長時間 Agent 會有多輪 model turn、工具延遲、失敗重試與上下文增長,因此應記錄:

  • 每一輪的 input、output、cached tokens 與 thinking 使用量。
  • 工具呼叫名稱、參數雜湊、耗時、結果大小與錯誤類型。
  • Agent loop 次數、停止原因、人工介入次數與最終成功率。
  • 同一任務在不同 thinking_level 下的成本、延遲與品質差異。

沒有這些資料,就無法知道模型真的變聰明,還是只是花了更多 tokens 和更多工具呼叫。

用自己的工作負載做回歸評測

官方 benchmark 適合用來了解發布方向,但正式採用前仍應建立自己的 evaluation set,例如:

  • 真實 repository 的 issue、migration 與 regression bug。
  • 具有權限邊界的工具呼叫案例。
  • 多語言 PDF、日誌與截圖混合的知識任務。
  • 需要拒絕危險動作、要求人工核准的安全案例。

對 Agent 而言,「能不能完成」不是唯一指標;工具呼叫是否正確、是否會無限重試、是否能在錯誤後恢復,以及是否留下可追蹤的決策紀錄,通常更接近生產風險。

限制與注意事項

第一,Gemini 3.8 Flash 的知識截止日期是 2026 年 3 月;Model Card 也提醒,部分領域的可用知識可能仍只到 2025 年 1 月。因此,模型名稱雖然是 2026 年 9 月發布,並不代表它知道發布日之後的所有事件。Model Card 的知識截止與限制

第二,官方列出的已知限制包含幻覺、偶發的速度或 timeout 問題,以及高 effort level 可能使用更多 tokens。這些限制在長時間 Agent 中會被放大:一次錯誤的工具參數可能造成多輪錯誤,timeout 也可能讓工作流停在半完成狀態。

第三,3.8 Flash 的公開資料主要證明它在 coding、agentic task 與多步驟推理上的方向性提升,並沒有公開所有架構細節。Model Card 明確指出它是建立在 3.7 Flash 之上,因此不應自行推論成完全不同的模型架構,或把 Google 的宣稱 benchmark 當成獨立測試結論。

總結:Flash 正在變成 Agent 的工作馬

Gemini 3.8 Flash 的核心價值,可以濃縮成三件事:1M context 讓大型工作資料能留在同一個任務裡;可調整的 thinking 讓品質、成本與延遲可以分級;工具與多模態支援則讓模型能參與真正的工作流。

如果你的需求是 repository 級別的程式碼工作、跨文件研究、需要搜尋與函式呼叫的企業 Agent,3.8 Flash 值得列入測試名單。它的定位不是「用最低價格回答一句話」,而是用 Flash 的成本結構承擔更長的推理與工具迴圈。導入時,請把 token budget、快取、工具權限、人工核准與可觀測性一起設計,才能把模型能力轉成可維運的系統。

參考資料