前言

AI 寫的文字有辦法被辨識嗎?OpenAI 在 2026 年 10 月 5 日公布文字浮水印技術 textGrain:它不會在句子裡插入看得見的標記,而是在生成時讓選字帶有統計訊號,再由偵測器判斷文字是否含有這種訊號。OpenAI 公告

這項消息和歐盟《AI Act》的生成內容透明度規範有關,但「偵測到浮水印」不能直接證明誰寫了文章,也不能證明整篇都由 AI 產生。本文以 2026 年 10 月 6 日為準,說明 textGrain 的基本原理、OpenAI 公布的測試結果,以及實際使用時需要保留的判斷空間。

AI 生成的概念插畫:紫色墨痕紙帶露出檸檬綠的規律符號,象徵文字浮水印中的隱性統計訊號。

封面為 AI 生成的概念插畫,用紙帶與隱約出現的規律符號表現統計浮水印;不是 OpenAI 產品畫面,也不是 textGrain 的演算法圖。

文字浮水印和一般 AI 偵測器有什麼不同?

一般 AI 文字偵測器通常會根據輸出文字的特徵,估算內容由模型生成的可能性。textGrain 則在生成文字時,把訊號放進選字的統計關係中,之後再由配套的偵測器尋找訊號。

這有點像在紙張中混入肉眼看不見的纖維。一般偵測器只能從文章外觀猜測來源;浮水印則需要生成端先嵌入訊號,偵測端才有特定線索可以驗證。因此 textGrain 不是能通用辨識所有 AI 文字的工具,也不會替每個字加上可見標籤。

textGrain 如何把訊號放進文字?

語言模型每次生成下一個 token(文字片段)時,都會計算各種候選 token 的機率。textGrain 會把模型使用的秘密金鑰和前文脈絡轉成偽隨機訊號,再依照這些訊號調整抽樣方式,讓選出的 token 和金鑰之間留下統計關聯。

OpenAI 的技術報告描述了更具體的設計:它先將詞彙切分成區塊,再以最佳傳輸方法建立區塊和偽隨機訊號之間的配對,並用熵預算限制生成隨機性被改變的幅度。區塊內的 token 仍依照原本的相對機率抽樣;設計目標是在保留生成品質的同時,留下可供統計檢驗的訊號。textGrain 技術報告

偵測端會使用相符的 tokenizer、設定和金鑰,從文字重建統計分數,再檢查觀察到的 token 是否呈現浮水印所預期的關聯。依技術報告描述,偵測不需要原本的生成模型或生成時使用的熵預算;它要回答的是「這段文字是否含有這種訊號」,不是「這段文字是誰寫的」。

flowchart LR
    A[模型的下一 token 機率] --> C[textGrain 調整抽樣]
    B[秘密金鑰與前文脈絡] --> C
    C --> D[輸出文字:含統計訊號]
    D --> E[偵測器重建統計分數]
    F[相符的偵測設定與金鑰] --> E
    E --> G[判斷是否偵測到浮水印訊號]

這次公告了什麼?與歐盟規範有何關係?

OpenAI 公布的是分階段推出計畫,而不是所有服務、所有地區都立即預設加入浮水印:

使用情境 OpenAI 公布的安排
API 全球客戶可為部分模型選擇啟用,預設關閉
ChatGPT 與 Codex 預計在接下來幾週,替歐盟符合資格的文字輸出加入浮水印
浮水印偵測器 開放研究人員和專業機構申請,初期採審核制

OpenAI 表示,這套偵測器不會顯示使用者身分、提示詞或對話內容,並計畫在未來將技術開源。這些是 OpenAI 公布的產品安排;實際支援範圍仍要以後續文件和服務狀態為準。OpenAI 公告

政策背景是歐盟《AI Act》第 50 條的透明度義務。歐盟執委會的說明指出,相關義務自 2026 年 8 月 2 日起適用;對模型提供者,重點是讓輸出能以機器可讀方式標示並可被偵測,實作也要考量技術可行性。對部署者,涉及向大眾發布、討論公共利益事項的 AI 生成文字,規範列有人工審查並承擔編輯責任的例外。歐盟執委會:AI 生成內容透明度實務守則

要留意的是,實務守則本身屬於自願遵循的工具,但執委會說明相關透明度要求是法律義務。textGrain 是 OpenAI 對文字來源標記提出的一種技術做法,不能單靠一篇產品公告就推論成所有規範細節都已解決。

公布的偵測數據呈現哪些限制?

OpenAI 公布的測試顯示,文字長度和內容類型都會影響偵測結果。以下數字來自 OpenAI 對英文文字的自家評估,不是跨語言、跨模型的獨立驗證:

測試條件 OpenAI 公布的結果 解讀
約 200 tokens 的心理學題材文字 偵測到約 80% 的浮水印文字 短文字較難累積統計訊號
約 400 tokens 的心理學題材文字 偵測到約 95% 的浮水印文字 篇幅增加後,測試中的偵測率提高
數學題材文字 偵測率明顯較低 可選用的文字表達較受限制
對 400-token 文字替換同義詞 替換 10% 時,偵測率約從 92% 降到 66%;替換 25% 時降到 17% 編輯會削弱統計訊號

前兩項測試設定的目標誤報率是 1%。這表示測試時將誤把未加水印文字判成有訊號的比例設為目標值;它不代表真實世界裡,任何語言、主題、模型與編輯情境都能保證 1% 誤報率。技術報告也指出,金鑰重複使用和有限精度計算等實作細節,仍需要在實際系統中做校準。

OpenAI 也表示,在它用來評估 Astra 的多個 benchmark 中,啟用與停用浮水印沒有造成顯著的整體表現差異。這仍是發布方的測試結果,不等於所有模型、所有提示與生成設定都不會受影響。

偵測結果能證明什麼,不能證明什麼?

OpenAI 對 textGrain 的定位是提供有限的來源線索。偵測到訊號,表示文字可能由支援此機制的 OpenAI 系統生成或處理過;它不會告訴你哪一位使用者產生文字、人工參與多少,也不會判斷內容是否正確、合法或由誰擁有。

反過來說,沒有偵測到浮水印,也不能證明文字是人寫的。文字太短、經過改寫或翻譯、來自未支援此技術的模型,或生成時間早於浮水印推出,都可能導致偵測器找不到訊號。OpenAI 自己也提醒,浮水印不能衡量人類貢獻比例或驗證文字真偽。OpenAI 對浮水印判讀範圍的說明

導入時如何避免把訊號當成判決?

如果產品要使用文字來源標記,可以把浮水印當成內容治理的一部分,再保留其他可稽核資訊。以下是工程實務上的建議:

  • 記錄功能是否啟用、支援的模型版本和內容產生時間,方便日後追查。
  • 若內容會經過人工編輯或翻譯,保留編輯歷程或來源欄位,避免只依賴最終文字的偵測結果。
  • 將偵測器結果呈現為來源線索,搭配人工審核及其他記錄再做決策。
  • 不要把單一偵測分數當成學術懲處、雇用決策或內容下架的唯一依據。

對平台而言,浮水印可以補足部分來源追蹤能力,但不會取代編輯流程、內容政策或申訴機制。尤其在文字很短、經過大量修改,或模型選字空間較受限的情境,系統應明確保留「無法判定」的結果。

總結

textGrain 的重點,是在生成過程中建立依賴秘密金鑰與上下文的統計訊號,讓配套偵測器能檢查文字是否帶有這種浮水印。OpenAI 公布的初步數據也指出,短文、特定內容類型和同義改寫會降低偵測率。

因此,文字浮水印比較適合被理解成內容溯源的一個訊號,而不是 AI 作者鑑定器。若要把它放進產品或政策流程,應同時保留來源記錄、人工審查和錯誤處理方式,並依真實使用情境持續校準。

參考資料