前言

Anthropic 在 2026 年 9 月 1 日宣布 Claude Fable 5.1 與 Claude Mythos 5.1。以台灣時間 9 月 2 日來看,這就是今天值得注意的新模型:它把重點放在可以連續工作數小時、跨越多個工具與應用程式的 Agent,而不是只把單次聊天回答得更漂亮。Anthropic 官方公告

這篇文章會整理 Claude Fable 5.1 的定位、規格、價格、benchmark、API 升級注意事項,以及實際導入後端系統時不能忽略的安全限制。文中的 benchmark 主要是 Anthropic 公布的發布測試,並不等於所有真實工作都一定會得到相同結果。

Claude Fable 5.1 是什麼?

可以先把它理解成 Anthropic 為「長時間、高複雜度、需要持續驗證」的工作設計的公開模型。官方列出的核心場景包括:

  • 跨多個檔案的功能開發、重構、遷移、除錯與 Code Review。
  • 從研究問題一路整理到文件、試算表或簡報成品的知識工作。
  • 需要多輪搜尋、追問與交叉整理的研究任務。
  • 閱讀 PDF 裡的圖表、表格與密集資料,並使用瀏覽器或桌面工具完成工作。

這裡的關鍵字是 long-horizon agentic work。一般 Chatbot 比較像「收到請求後產生回答」,而 Fable 5.1 想處理的是「理解目標、拆解工作、呼叫工具、觀察結果、修正方向,最後交付可檢查的成果」:

flowchart LR
    A[大型任務] --> B[讀取程式碼與文件]
    B --> C[拆解與規劃]
    C --> D[多輪工具操作]
    D --> E[測試與驗證]
    E -->|需要修正| D
    E --> F[交付結果]

不過,Anthropic 的開發者文件也提醒:多數工作仍可先從 Claude Opus 5 開始;當高 effort 的 Opus 5 仍不足,或任務確實需要長時間、多步驟 Agent 執行時,再考慮 Fable 5.1。Claude Fable 5.1 模型文件

規格與價格

截至 2026 年 9 月 2 日,Claude Platform 文件列出的規格如下:

項目 Claude Fable 5.1
API Model ID claude-fable-5-1
Context window 1M tokens
最大輸出 128K tokens
Thinking Adaptive thinking,永遠開啟
API 預設 effort high
相對延遲 較慢
Knowledge cutoff 2026 年 6 月
輸入/輸出 文字、圖片 → 文字
可用平台 Claude API、Amazon Bedrock、Claude Platform on AWS、Google Cloud、Microsoft Foundry

1M token context 對大型程式碼庫、長文件與多輪 Agent 對話很有吸引力,但它只是「可容納的上下文變大」,不是「模型一定能正確抓到每個細節」。實際系統仍需要檢索、摘要、分段驗證與測試,不能把整個可靠性問題都推給 context window。

在 Claude 的產品端,官方列出的付費方案包括 Pro、Max、Team 與 Enterprise;API 與雲端平台則依文件中的 model ID 和各平台規則提供。實際開通狀態、區域與方案限制仍應以 Claude Fable 產品頁Claude Platform 模型文件 為準。

Token 價格

Fable 5.1 的基本 input/output 價格與 Fable 5 相同,真正明顯的變化是 prompt cache read:

用量 價格(美元/每百萬 tokens)
Base input $10
5 分鐘 cache write $12.50
1 小時 cache write $20
Cache read $0.25
Output $50
Batch API input/output $5/$25

Cache read 從 Fable 5 的 $1 降到 $0.25,等於下降 75%。對每次請求都重新讀取相同 system prompt、文件前綴或對話歷史的 Agent 來說,這個改動可能比單純提升 benchmark 分數更直接地影響成本。Anthropic 以 2026 年 8 月四週的 Enterprise、Claude Code 與 API 用量估算,典型工作負載成本約降低 25%,高度 Agent 化、cache read 佔比很高的工作負載最高約降低 45%。Anthropic 公告:成本與可用性

但不要把「cache read 變便宜」直接解讀成「每個任務都更便宜」。外部評測機構 Artificial Analysis 在自己的 Intelligence Index 設定中觀察到,Fable 5.1 max 每個任務約 $3.76,比 Fable 5 的 $3.14 高約 20%;主要原因是 Fable 5.1 使用了約 1.7 倍的 output tokens。這兩組結果不是同一個工作負載,但共同提醒我們:token 單價、推理 effort、輸出長度與每個成功任務成本,必須分開衡量。Artificial Analysis 評測

Anthropic 公布的 benchmark 怎麼看?

Anthropic 在發布頁比較 Fable 5.1、Fable 5、Opus 5 與 GPT-5.6 Sol,部分結果如下:

評測 Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 55.8% 42.0% 52.3% 37.3%
GDPval-AA v2 1853 1723 1824 1711
Humanity’s Last Exam(with tools) 65.0% 63.8% 63.6%
CursorBench 3.2.0 73.4% 70.5% 70.0% 67.2%

從官方數字來看,Fable 5.1 在科學研究、Agentic coding、知識工作與工具使用都有提升,尤其 Terminal-Bench-Science 0.1 從 Fable 5 的 24.7% 提升到 52.6%,是最醒目的差距。

不過這張表有三個重要前提:

  1. 這些是 Anthropic 的發布測試,不是獨立盲測。不同 harness、effort、工具權限與評分方式,都可能改變結果。
  2. Fable 5.1 是在 production safeguards 開啟的條件下測試。若安全分類器介入,某些任務會改由其他模型處理,或在特定測試中記為零分。
  3. Terminal-Bench-Science 0.1 的單一模型標準誤約為 ±3.5–4.5 個百分點,因此不能把很小的差距當成確定的領先。

比較實用的結論不是「Fable 5.1 在每項工作都贏」,而是它把長時間執行、持續修正與跨工具工作的上限往上推;接著仍需要用自己的程式碼庫、文件與成功標準做評估。

API 快速開始

Claude API 的 model ID 是 claude-fable-5-1。由於 adaptive thinking 永遠開啟,基本請求不需要另外設定手動 extended thinking:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
import anthropic

client = anthropic.Anthropic()

response = client.messages.create(
model="claude-fable-5-1",
max_tokens=4096,
messages=[
{
"role": "user",
"content": "請先分析這個專案的模組邊界,再提出可驗證的重構計畫。",
}
],
)

for block in response.content:
if block.type == "text":
print(block.text)

如果要放進後端 Agent,建議把模型產生的工具參數視為不可信輸入,交給 Tool Gateway 做 Schema 驗證、權限檢查、冪等控制與審計。模型可以提出行動,但不應該自己決定「這個行動是否有權執行」。

從 Fable 5 升級時的相容性陷阱

1. 不再支援強制工具呼叫

Fable 5.1 不支援 tool_choiceany 或指定工具模式;送出這些設定會收到 HTTP 400。升級時應保留 auto,並在 prompt 中明確說明什麼條件下需要呼叫工具;若需要符合 Schema 的 JSON,搭配 strict: true 或使用 structured outputs。

1
2
3
4
5
6
7
8
9
10
11
response = client.messages.create(
model="claude-fable-5-1",
tools=[record_summary_tool],
tool_choice={"type": "auto"},
messages=[
{
"role": "user",
"content": "整理文件後,請呼叫 record_summary 工具保存結果。",
}
],
)

這不是單純把 model name 換掉就一定沒事的升級,尤其是原本依賴強制工具呼叫來確保流程的自訂 Agent。

2. thinking block 有方向性的相容性

Fable 5.1 可以讀取較舊 Claude 模型留下的 thinking block,但較舊模型不能讀取 Fable 5.1 產生的 thinking block。當路由器或 fallback 把請求切回舊模型時,API 可能丟棄這些區塊,讓目標模型重新規劃;這也可能增加延遲與輸出量。

此外,Fable 5.1 的 thinking block 會綁定產生它之前的 systemtools 與對話歷史。如果程式每次請求都重建或修改前綴,下一次請求可能收到「block 綁定到不同 conversation」的 400 錯誤。對長時間 Agent 而言,較安全的設計是:

  • 把歷史視為 append-only,不要任意改寫早期訊息。
  • 需要單回合提醒時,使用 mid-conversation system message。
  • 需要更新工具時,使用支援的 mid-conversation tool changes。
  • 對自己的 Messages API wrapper 加入 migration test,確認 fallback、重試與訊息重建不會破壞 block binding。

完整規則可參考 Claude Fable 5.1 What’s newMigration guide

安全、資料保留與內容來源

Fable 5.1 與 Mythos 5.1 的底層模型相同,但 safeguards 不同。Fable 5.1 是一般可用版本;Mythos 5.1 則只提供給通過審核的組織與研究者,主要為了處理資安與生命科學領域的高風險能力。Anthropic:Fable 5.1 與 Mythos 5.1

Fable 5.1 的安全設計仍會影響實際行為:

  • 它可以協助從原始碼中找出軟體漏洞,但滲透測試、漏洞利用程式生成、以 binary 為基礎的漏洞掃描等雙重用途工作,仍可能被導向 Opus 模型。
  • Anthropic 表示,最新 biology safeguards 對良性基礎生物學與醫療問題的介入率,相較 Fable 5 初始版本降低 85%;但生命科學研究與開發仍會受到限制。
  • Fable 5.1 預設需要 30 天資料保留,以便進行安全監控;若是企業環境,零資料保留不是自動可用,必須符合資格並獲得 Anthropic 明確授權。
  • Enterprise Frontier Safeguards(EFS)正在分階段推出,目標是讓符合資格的企業把資料放在自己控制的雲端環境,同時保留自動化濫用偵測能力。

另外,Fable 5.1 產生的文字會帶有 Anthropic 的統計式文字浮水印;透過 Files API 取得的支援圖片與影片,也會帶有簽署過的 C2PA Content Credentials。這不會在文字中加入隱藏字元,也不代表內容因此自動變得正確,但對企業內容治理、來源追蹤與合規流程值得注意。Claude Platform:What’s new

後端團隊該怎麼評估?

如果團隊要把 Fable 5.1 放進生產環境,建議不要只跑幾個 demo prompt,而是建立一組接近真實工作負載的 eval:

  1. 準備代表性的多檔案功能、重構、除錯、Code Review 與文件工作。
  2. 以固定的權限、工具、資料集與 effort 比較 Fable 5.1、Opus 5 與現有模型。
  3. 同時記錄任務成功率、測試是否通過、工具呼叫次數、重試次數、fallback/refusal 比例、延遲、輸出 token 與每個成功任務成本。
  4. 先讓 Agent 在沙盒與最小權限下執行,對寫入、發布、付款、刪除與外部通知保留人工核准。
  5. 把升級相容性測試放進 CI,特別驗證 tool choice、thinking block、訊息重建與 cache prefix 是否穩定。

這樣才看得出 Fable 5.1 的優勢是否真的存在於自己的工作流,而不是只存在於發布頁的 benchmark 表格裡。

總結

Claude Fable 5.1 的重點不是「又一個更大的聊天模型」,而是把模型的價值單位往「可持續完成一個長任務」移動:它瞄準跨檔案程式開發、多步驟研究、文件產出與跨工具 Agent 工作,並透過更低的 cache read 價格降低長對話的重複輸入成本。

對一般問答或短任務,Fable 5.1 不一定是最划算的選擇;對需要長時間執行、持續驗證,而且能用測試或明確 rubric 判斷成果的工作,它才比較有機會發揮價值。實際導入前,請把能力、成本、延遲、權限與資料保留一起評估。

參考資料