Claude Fable 5.1 模型介紹:長時間 Agent、1M Context 與更低快取成本
前言
Anthropic 在 2026 年 9 月 1 日宣布 Claude Fable 5.1 與 Claude Mythos 5.1。以台灣時間 9 月 2 日來看,這就是今天值得注意的新模型:它把重點放在可以連續工作數小時、跨越多個工具與應用程式的 Agent,而不是只把單次聊天回答得更漂亮。Anthropic 官方公告
這篇文章會整理 Claude Fable 5.1 的定位、規格、價格、benchmark、API 升級注意事項,以及實際導入後端系統時不能忽略的安全限制。文中的 benchmark 主要是 Anthropic 公布的發布測試,並不等於所有真實工作都一定會得到相同結果。
Claude Fable 5.1 是什麼?
可以先把它理解成 Anthropic 為「長時間、高複雜度、需要持續驗證」的工作設計的公開模型。官方列出的核心場景包括:
- 跨多個檔案的功能開發、重構、遷移、除錯與 Code Review。
- 從研究問題一路整理到文件、試算表或簡報成品的知識工作。
- 需要多輪搜尋、追問與交叉整理的研究任務。
- 閱讀 PDF 裡的圖表、表格與密集資料,並使用瀏覽器或桌面工具完成工作。
這裡的關鍵字是 long-horizon agentic work。一般 Chatbot 比較像「收到請求後產生回答」,而 Fable 5.1 想處理的是「理解目標、拆解工作、呼叫工具、觀察結果、修正方向,最後交付可檢查的成果」:
flowchart LR
A[大型任務] --> B[讀取程式碼與文件]
B --> C[拆解與規劃]
C --> D[多輪工具操作]
D --> E[測試與驗證]
E -->|需要修正| D
E --> F[交付結果]
不過,Anthropic 的開發者文件也提醒:多數工作仍可先從 Claude Opus 5 開始;當高 effort 的 Opus 5 仍不足,或任務確實需要長時間、多步驟 Agent 執行時,再考慮 Fable 5.1。Claude Fable 5.1 模型文件
規格與價格
截至 2026 年 9 月 2 日,Claude Platform 文件列出的規格如下:
| 項目 | Claude Fable 5.1 |
|---|---|
| API Model ID | claude-fable-5-1 |
| Context window | 1M tokens |
| 最大輸出 | 128K tokens |
| Thinking | Adaptive thinking,永遠開啟 |
| API 預設 effort | high |
| 相對延遲 | 較慢 |
| Knowledge cutoff | 2026 年 6 月 |
| 輸入/輸出 | 文字、圖片 → 文字 |
| 可用平台 | Claude API、Amazon Bedrock、Claude Platform on AWS、Google Cloud、Microsoft Foundry |
1M token context 對大型程式碼庫、長文件與多輪 Agent 對話很有吸引力,但它只是「可容納的上下文變大」,不是「模型一定能正確抓到每個細節」。實際系統仍需要檢索、摘要、分段驗證與測試,不能把整個可靠性問題都推給 context window。
在 Claude 的產品端,官方列出的付費方案包括 Pro、Max、Team 與 Enterprise;API 與雲端平台則依文件中的 model ID 和各平台規則提供。實際開通狀態、區域與方案限制仍應以 Claude Fable 產品頁 與 Claude Platform 模型文件 為準。
Token 價格
Fable 5.1 的基本 input/output 價格與 Fable 5 相同,真正明顯的變化是 prompt cache read:
| 用量 | 價格(美元/每百萬 tokens) |
|---|---|
| Base input | $10 |
| 5 分鐘 cache write | $12.50 |
| 1 小時 cache write | $20 |
| Cache read | $0.25 |
| Output | $50 |
| Batch API input/output | $5/$25 |
Cache read 從 Fable 5 的 $1 降到 $0.25,等於下降 75%。對每次請求都重新讀取相同 system prompt、文件前綴或對話歷史的 Agent 來說,這個改動可能比單純提升 benchmark 分數更直接地影響成本。Anthropic 以 2026 年 8 月四週的 Enterprise、Claude Code 與 API 用量估算,典型工作負載成本約降低 25%,高度 Agent 化、cache read 佔比很高的工作負載最高約降低 45%。Anthropic 公告:成本與可用性
但不要把「cache read 變便宜」直接解讀成「每個任務都更便宜」。外部評測機構 Artificial Analysis 在自己的 Intelligence Index 設定中觀察到,Fable 5.1 max 每個任務約 $3.76,比 Fable 5 的 $3.14 高約 20%;主要原因是 Fable 5.1 使用了約 1.7 倍的 output tokens。這兩組結果不是同一個工作負載,但共同提醒我們:token 單價、推理 effort、輸出長度與每個成功任務成本,必須分開衡量。Artificial Analysis 評測
Anthropic 公布的 benchmark 怎麼看?
Anthropic 在發布頁比較 Fable 5.1、Fable 5、Opus 5 與 GPT-5.6 Sol,部分結果如下:
| 評測 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
| Humanity’s Last Exam(with tools) | 65.0% | 63.8% | 63.6% | — |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
從官方數字來看,Fable 5.1 在科學研究、Agentic coding、知識工作與工具使用都有提升,尤其 Terminal-Bench-Science 0.1 從 Fable 5 的 24.7% 提升到 52.6%,是最醒目的差距。
不過這張表有三個重要前提:
- 這些是 Anthropic 的發布測試,不是獨立盲測。不同 harness、effort、工具權限與評分方式,都可能改變結果。
- Fable 5.1 是在 production safeguards 開啟的條件下測試。若安全分類器介入,某些任務會改由其他模型處理,或在特定測試中記為零分。
- Terminal-Bench-Science 0.1 的單一模型標準誤約為 ±3.5–4.5 個百分點,因此不能把很小的差距當成確定的領先。
比較實用的結論不是「Fable 5.1 在每項工作都贏」,而是它把長時間執行、持續修正與跨工具工作的上限往上推;接著仍需要用自己的程式碼庫、文件與成功標準做評估。
API 快速開始
Claude API 的 model ID 是 claude-fable-5-1。由於 adaptive thinking 永遠開啟,基本請求不需要另外設定手動 extended thinking:
1 | import anthropic |
如果要放進後端 Agent,建議把模型產生的工具參數視為不可信輸入,交給 Tool Gateway 做 Schema 驗證、權限檢查、冪等控制與審計。模型可以提出行動,但不應該自己決定「這個行動是否有權執行」。
從 Fable 5 升級時的相容性陷阱
1. 不再支援強制工具呼叫
Fable 5.1 不支援 tool_choice 的 any 或指定工具模式;送出這些設定會收到 HTTP 400。升級時應保留 auto,並在 prompt 中明確說明什麼條件下需要呼叫工具;若需要符合 Schema 的 JSON,搭配 strict: true 或使用 structured outputs。
1 | response = client.messages.create( |
這不是單純把 model name 換掉就一定沒事的升級,尤其是原本依賴強制工具呼叫來確保流程的自訂 Agent。
2. thinking block 有方向性的相容性
Fable 5.1 可以讀取較舊 Claude 模型留下的 thinking block,但較舊模型不能讀取 Fable 5.1 產生的 thinking block。當路由器或 fallback 把請求切回舊模型時,API 可能丟棄這些區塊,讓目標模型重新規劃;這也可能增加延遲與輸出量。
此外,Fable 5.1 的 thinking block 會綁定產生它之前的 system、tools 與對話歷史。如果程式每次請求都重建或修改前綴,下一次請求可能收到「block 綁定到不同 conversation」的 400 錯誤。對長時間 Agent 而言,較安全的設計是:
- 把歷史視為 append-only,不要任意改寫早期訊息。
- 需要單回合提醒時,使用 mid-conversation system message。
- 需要更新工具時,使用支援的 mid-conversation tool changes。
- 對自己的 Messages API wrapper 加入 migration test,確認 fallback、重試與訊息重建不會破壞 block binding。
完整規則可參考 Claude Fable 5.1 What’s new 與 Migration guide。
安全、資料保留與內容來源
Fable 5.1 與 Mythos 5.1 的底層模型相同,但 safeguards 不同。Fable 5.1 是一般可用版本;Mythos 5.1 則只提供給通過審核的組織與研究者,主要為了處理資安與生命科學領域的高風險能力。Anthropic:Fable 5.1 與 Mythos 5.1
Fable 5.1 的安全設計仍會影響實際行為:
- 它可以協助從原始碼中找出軟體漏洞,但滲透測試、漏洞利用程式生成、以 binary 為基礎的漏洞掃描等雙重用途工作,仍可能被導向 Opus 模型。
- Anthropic 表示,最新 biology safeguards 對良性基礎生物學與醫療問題的介入率,相較 Fable 5 初始版本降低 85%;但生命科學研究與開發仍會受到限制。
- Fable 5.1 預設需要 30 天資料保留,以便進行安全監控;若是企業環境,零資料保留不是自動可用,必須符合資格並獲得 Anthropic 明確授權。
- Enterprise Frontier Safeguards(EFS)正在分階段推出,目標是讓符合資格的企業把資料放在自己控制的雲端環境,同時保留自動化濫用偵測能力。
另外,Fable 5.1 產生的文字會帶有 Anthropic 的統計式文字浮水印;透過 Files API 取得的支援圖片與影片,也會帶有簽署過的 C2PA Content Credentials。這不會在文字中加入隱藏字元,也不代表內容因此自動變得正確,但對企業內容治理、來源追蹤與合規流程值得注意。Claude Platform:What’s new
後端團隊該怎麼評估?
如果團隊要把 Fable 5.1 放進生產環境,建議不要只跑幾個 demo prompt,而是建立一組接近真實工作負載的 eval:
- 準備代表性的多檔案功能、重構、除錯、Code Review 與文件工作。
- 以固定的權限、工具、資料集與 effort 比較 Fable 5.1、Opus 5 與現有模型。
- 同時記錄任務成功率、測試是否通過、工具呼叫次數、重試次數、fallback/refusal 比例、延遲、輸出 token 與每個成功任務成本。
- 先讓 Agent 在沙盒與最小權限下執行,對寫入、發布、付款、刪除與外部通知保留人工核准。
- 把升級相容性測試放進 CI,特別驗證 tool choice、thinking block、訊息重建與 cache prefix 是否穩定。
這樣才看得出 Fable 5.1 的優勢是否真的存在於自己的工作流,而不是只存在於發布頁的 benchmark 表格裡。
總結
Claude Fable 5.1 的重點不是「又一個更大的聊天模型」,而是把模型的價值單位往「可持續完成一個長任務」移動:它瞄準跨檔案程式開發、多步驟研究、文件產出與跨工具 Agent 工作,並透過更低的 cache read 價格降低長對話的重複輸入成本。
對一般問答或短任務,Fable 5.1 不一定是最划算的選擇;對需要長時間執行、持續驗證,而且能用測試或明確 rubric 判斷成果的工作,它才比較有機會發揮價值。實際導入前,請把能力、成本、延遲、權限與資料保留一起評估。
參考資料
- Anthropic:Introducing Claude Fable 5.1 and Claude Mythos 5.1(2026-09-01)
- Claude Platform:Claude Fable 5.1 Overview
- Claude Platform:What’s new in Claude Fable 5.1
- Claude Platform:Migrating to Claude Fable 5.1
- Claude Platform:Pricing
- Anthropic:Enterprise Frontier Safeguards(2026-09-01)
- Artificial Analysis:Claude Fable 5.1(2026-09-01)










