前言

Anthropic 在 2026 年 9 月 28 日發表 Claude Sonnet 5.5,主打把模型能力、速度與每項工作的成本一起往前推。官方表示,它比 Sonnet 5 快 30% 以上,多數工作成本最多降低 30%;應用重心則放在日常程式開發、Agent 任務,以及文件、簡報和試算表等知識工作。

這篇整理截至 2026 年 9 月 29 日 的官方資訊,包含模型定位、基準測試、價格與導入時要留意的地方。基準分數可以幫助理解改進方向,但不能直接當成每個團隊的實際成效保證。

Claude Sonnet 5.5 的定位

Sonnet 5.5 是 Claude 5.5 家族的第二款模型,接在 Opus 5.5 之後。Anthropic 將它定位為處理範圍明確、日常會反覆遇到的工作:修正程式錯誤、理解程式碼庫、產出文件與簡報,或在工具協助下完成一段工作流程。

模型 官方定位 適合優先評估的情境
Claude Sonnet 5.5 速度快、能力均衡的日常工作模型 程式修改、文件產出、常見 Agent 工作流程
Claude Opus 5.5 面向需要持續判斷的複雜工作 長時間、需求開放或需要謹慎取捨的任務
Claude Haiku 5.5 Anthropic 表示將加入家族,主攻高用量與成本敏感場景 發布公告當下尚未提供,需等正式上線資訊

因此,Sonnet 5.5 的重點不是要在所有任務取代 Opus,而是讓大量中等難度工作能以較短等待時間和較低的單次任務成本完成。Anthropic 也提醒,面對複雜、開放式且需要持續判斷的工作,Opus 5.5 仍較強。

這次升級主要在哪裡

官方公告展示的改進集中在程式開發、知識工作,以及速度和 token 使用效率。以下分數來自 Anthropic 公布的評測,代表特定測試設定,不等於所有工作都會得到相同幅度的提升。

程式開發與多步驟工具使用

在官方列出的 Terminal-Bench 4.0 評測中,Sonnet 5.5 得分為 70.6%,Sonnet 5 為 10.3%;在 CursorBench 4.0 上則分別是 55.5% 與 34.1%。這些測試評估 Agent 在命令列或真實程式開發情境中完成多步驟工作的能力。

Anthropic 表示,早期測試者觀察到 Sonnet 5.5 能更快掌握程式碼庫,也會把工具呼叫合併處理,減少完成工作的步驟。這對 Agent 工作流程尤其重要:如果任務品質相近,少幾次工具往返通常也代表較短等待時間和較少的執行成本。

文件、圖表與電腦操作

在 GDPval-AA v2.1 這項跨職業知識工作評測中,Sonnet 5.5 的分數為 1844,Sonnet 5 為 1449,Opus 5.5 為 1846。這組結果顯示 Sonnet 5.5 在這個評測上的表現已接近 Opus 5.5;它不是在所有知識工作都與 Opus 等同的證明。

Anthropic 也強調圖表辨識和電腦操作能力,並指出 Sonnet 5.5 是第一款只靠畫面截圖就能打敗 Pokémon Red 的 Sonnet 模型。這類能力適合進一步評估需要讀取畫面、操作介面或依照範本製作產出的流程,但正式使用前仍應以自己的介面、資料和任務驗證。

更快完成工作、減少每項任務成本

Anthropic 稱 Sonnet 5.5 的輸出速度比 Sonnet 5 快 30% 以上,而且每項任務使用的 token 較少,因此多數工作成本最多下降 30%。這裡說的是「完成一項工作所花的總成本」,不應直接理解成 API 每個 token 的單價便宜了 30%。

Claude Platform 公告列出的 Sonnet 5.5 標準價格為每百萬個輸入 token 2 美元、每百萬個輸出 token 10 美元。實際帳單還會受到輸入與輸出長度、快取、工具呼叫、重試和 effort 設定影響;如果透過雲端市集服務,也應另外確認該平台的計費方式。

如何解讀官方基準測試

同一個模型在不同 effort 設定下,可能用更多時間與 token 換取更完整的推理。Anthropic 指出,Claude App 與 Claude Code 的預設 effort 是 Medium,Claude Platform 的預設值則是 High;所以只比較模型名稱、不看測試設定,很容易把不同條件下的結果混在一起。

另外,Anthropic 說明 GDPval-AA 等部分分數由第三方使用 Sonnet 5.5 的預發布版本測得,當時平台有一個可能影響結構化輸出的問題,後來已修正。閱讀這些數字時,建議把它們視為選擇候選模型的線索,再用自己的程式碼庫、提示詞、工具和驗收條件進行測試。

若要評估是否導入,可以至少追蹤以下指標:

  1. 任務是否真的完成,以及產出是否需要人工大幅修改。
  2. 從提出需求到交付結果的時間,包括模型思考和工具往返。
  3. 每項任務的 token、工具呼叫、重試與總費用。
  4. 遇到錯誤、缺少資料或權限不足時,Agent 是否能安全停下來。

安全與使用限制

Sonnet 5.5 的資安能力提升到 Anthropic 認為需要額外保護的程度,因此它是第一款推出時就配備接近 Opus 等級資安防護機制的 Sonnet 模型。Anthropic 表示,一般軟體開發不受影響;部分高風險資安請求則可能改由 Sonnet 5 處理。這是平台安全政策的一部分,並不代表模型能自行判定所有任務的風險。

如果把模型接到終端機、程式碼管理平台或其他有副作用的工具,仍要由應用程式控制權限、限制可執行的操作,並記錄重要決策。模型能力變強,不會自動取代工具層的權限設計和人工覆核。

哪些情境值得先試

Sonnet 5.5 可以優先用在需求和驗收方式相對清楚的工作,例如修復已知錯誤、依規格修改多個檔案、整理技術文件、依範本產生簡報,或處理有固定步驟的 Agent 任務。這些情境容易定義「做對」的條件,也較容易與現行模型比較品質、時間和成本。

若任務需要在模糊目標間取捨、長時間規劃,或錯誤代價很高,應同時評估 Opus 5.5 或保留人工檢查。實務上可以先讓 Sonnet 5.5 處理常見路徑,再把高風險或未通過驗收的案例交給更強的模型或工程師。

API 與可用平台

截至本文日期,Sonnet 5.5 已在 Claude 產品與 Claude Platform 提供,官方公告也列出 Amazon Web Services、Google Cloud 和 Microsoft Azure。Claude Platform 的 API model ID 是 claude-sonnet-5-5。

若既有整合把 thinking 關閉,升級時要留意 Anthropic 公告中的遷移說明:Sonnet 5.5 需要改用 between_tools 設定,才能維持前置 thinking 關閉的行為。正式換版前,建議先檢查 SDK 支援、參數設定與錯誤處理,再用一組固定任務驗證輸出差異。

結語

Sonnet 5.5 的主要賣點,是把程式開發與一般知識工作中的能力提升,同時搭配更快的輸出和較低的單次任務成本。官方基準顯示它相較 Sonnet 5 有明顯進步,也在部分測試接近 Opus 5.5;但這些結果仍需放回各自的評測條件理解。

如果你的工作有清楚的成功條件,可以先用 Sonnet 5.5 跑一組代表性任務,與目前模型比較完成率、人工修改量、延遲和總費用。最後的選擇應由實際工作負載決定,而不是只看模型名稱或單一 benchmark。

參考資料