Pick Model

框架

Claude 開始在文字裡加浮水印,你該擔心嗎

Claude 從 8 月起在輸出的文字裡加浮水印,複製貼上也帶得走。但它證明的是「這段文字經過 AI」,不是「這個人偷懶」,而且改寫過後偵測率會從 99.8% 掉到 49.8%。這篇講原理、各家現況、法規怎麼要求,以及你實際上該做什麼。

目錄(23 節)
  1. 你聽過的 AI 偵測器,跟這次的浮水印不是同一件事
  2. 為什麼複製貼上帶得走,改寫卻會弄丟
  3. 密碼本
  4. 所以複製貼上會保留
  5. 為什麼短的測不出來
  6. 有些內容藏不進去
  7. 五個傳言,逐條對照
  8. ChatGPT 沒有,Gemini 有,差別在哪
  9. OpenAI 做出來了,然後選擇不上線
  10. 技術沒變,變的是法規
  11. 圖片是另一套機制,而且脆弱得多
  12. 它還沒準到可以拿來抓人
  13. 先把最大的誤解講死
  14. 問題一:它沒有你以為的那麼準
  15. 問題二:中文的情況沒人說得準
  16. 問題三:偽造比被抓更難處理
  17. 三件事其實是同一件
  18. 問題不是會不會被測到,是你講了沒有
  19. 講清楚,比躲起來省事
  20. 不要去買那些「去浮水印」工具
  21. 常見問題
  22. 比新聞小,但不會消失
  23. 資料來源

你用 AI 潤過一封信、改過一份報告、順過一則貼文。

然後八月的新聞說,Claude 開始在產出的文字裡加浮水印,而且複製貼上也帶得走。

第一個念頭大概是:所以我被標記了嗎?會被發現嗎?

先講兩個可以立刻放下的事實:目前還沒有任何工具開放給一般人檢查你的文章,而且 2026 年 8 月之前產出的內容根本沒有浮水印。

多數人不安的那幾點是誤解。但確實有一件事值得警覺,而它跟你想的不是同一件。

你聽過的 AI 偵測器,跟這次的浮水印不是同一件事

「AI 浮水印」這個詞底下,其實躺著三種技術。它們強不強、能證明什麼、誰驗得了,差別很大。混在一起談,是多數誤解的源頭。

統計浮水印 內容憑證 事後偵測
你可能聽過的名字 SynthID C2PA、Content Credentials GPTZero、Turnitin
訊號在哪 用字的選擇裡 檔案的簽章資料 沒有訊號,純粹用猜的
誰能驗 模型商(有密鑰) 任何人(公開可驗) 任何人
純文字複製 保留 不適用 不適用
截圖、轉檔 保留 消失 不適用
準確度 長文才穩,見下文 在就可信,不在不代表什麼 誤判率高,爭議大

差別最大的是最後一欄。

前兩種是模型商主動植入的,有明確的真相可以比對。第三種完全不同:它沒有任何植入訊號,純粹分析文章的統計特徵,判斷「讀起來像不像 AI 寫的」。

這件事值得單獨強調,因為很多人對 AI 偵測的恐懼,其實來自被第三種誤判的經驗。學生被 Turnitin 判定作弊、作者被讀者拿 GPTZero 檢驗,那些爭議跟這次的浮水印不是同一套技術。學術界對第三種的可靠度批評已久。

接下來這篇主要談第一種,也就是這次真正的新東西。第二種在後面談。

為什麼複製貼上帶得走,改寫卻會弄丟

先把最容易嚇到人的想像拆掉。統計浮水印不是隱形字元,不是藏在檔案裡的標籤,也不是任何被「加」進去的東西。

它利用的是選擇本身。

密碼本

想像你要在一份文件裡藏訊息,但規則是不能加任何一個字。

唯一的辦法是利用同義詞。文件裡有大量位置,寫「有效」可以,寫「管用」也可以,意思一樣、讀起來都自然。你事先跟收訊方約好一本密碼本,規定每個位置該偏好哪一個。

寫的時候照密碼本挑。單看任何一句都正常,因為兩個詞本來就都對。但收訊方拿同一本密碼本掃過全文,會發現你的選擇跟密碼本吻合的比例,高得不像巧合。

AI 浮水印做的事情跟這個比喻幾乎一樣。模型每寫一個字,本來就是在許多合理選項裡挑一個(更精確地說是挑一個 token),浮水印只是讓「挑哪一個」由一把密鑰決定。

再精確一點說:模型會從自己原本就算好的候選裡抽出幾個,讓它們兩兩比對密鑰算出的分數,像一場小型淘汰賽,最後勝出的那個就是輸出。

模型要填這個位置 這個方法很 ? 四個意思一樣的候選 第一輪 第二輪 管用 .87 有效 .31 好用 .52 實用 .19 管用 .87 好用 .52 管用 .87 勝出,成為輸出 讀者看到的只有這一句 這個方法很管用。
分數由一把密鑰算出來,跟這個詞好不好、常不常見都沒有關係。同一個「管用」換到別的句子裡,分數就完全不同。

候選本來就都來自模型自己的判斷,所以理論上選哪一個都不影響句子的品質。Anthropic 的說法是,讀者分辨不出帶浮水印與不帶浮水印的差別。

所以複製貼上會保留

這是最多人搞混的地方。

如果浮水印是貼在檔案上的標籤,那複製純文字、轉存、截圖,標籤就沒了。但它不是標籤,它就是那串字。你複製了字,就複製了訊息。

貼到 Word、LINE、記事本、部落格後台,訊息多半還在。編輯器的自動校正、全半形轉換這類動作會動到字,多少會磨掉一點。

反過來說,能弄掉它的方式只有改字。改越多流失越多,整段重寫就沒了。

為什麼短的測不出來

一枚做了手腳、55% 會出正面的硬幣,你丟 10 次,可能出 6 次正面,也可能出 4 次,完全看不出異常。丟 1000 次,偏差就藏不住了。

浮水印偵測是同一件事。掃幾十個字,吻合度再高也可能是巧合;要到四五百字,統計上才站得住。

人寫的 AI 寫的 橫條=分數可能落在的範圍 20 字 分不出 100 字 勉強 500 字 測得出 .40 .45 .50 .55 .60 .65 吻合密碼本的比例
兩條虛線是各自的平均值,位置永遠不變。變的是橫條的寬度:文章越短,分數的抖動越大,兩個範圍就重疊得越厲害。500 字時兩條完全分開,才有辦法下判斷。

這代表你的日常對話、一句訊息、一個標題,測不出來不是技術不夠好,是數學上不可能。

也代表反過來不成立:測不到不能當成沒用 AI 的證據,只說明樣本不夠長。

有些內容藏不進去

淘汰賽需要「有得選」。當合理答案只有一個的時候,就沒有選擇空間,訊號自然就稀疏。

  • 程式碼:多數情況必須精確,換個寫法就錯了
  • 事實性內容:專有名詞、數字、引用,沒得替換
  • 幫你校稿:多數字是你寫的,AI 只動局部,留下的記號很少

有一個方向常被搞反:拿 AI 生成的文章去別處翻譯,訊號會流失;但用 AI 做翻譯,產出的譯文本身是帶記號的,因為每個字都是它選的。

五個傳言,逐條對照

傳言 實際
藏了看不見的特殊字元 沒有。官方明確否認
是檔案裡的隱藏資料 不是。文字浮水印不靠這個
記錄了我是誰 沒有。詳見下段
會讓 AI 寫得比較差 候選都來自模型原本的判斷,不改變品質
會多花錢 不需要額外 token,Anthropic 說不會因此變貴

關於身分這一條值得單獨講。Anthropic 的官方說明寫得很清楚:浮水印與那把密鑰都無法回推使用者、所屬組織或對話內容。它能回答的問題只有一個,就是「這段文字是不是這個模型產生的」,回答不了「是誰產生的」。

如果你的不安來自「我被追蹤了」,這一條可以放下。

ChatGPT 沒有,Gemini 有,差別在哪

浮水印不是全業界的統一動作,各家差很多。

文字浮水印 圖片檔案憑證 一般人能驗嗎
Claude(Anthropic) 8 月起發布的新模型有,舊模型過渡中 有 還不行
Gemini(Google) 有,SynthID 有 限記者與研究者
ChatGPT(OpenAI) 沒有 圖片有 不適用
Meta AI 沒有公開部署 讀取並顯示標籤 不適用

幾個實際含義:

  • 用 ChatGPT 寫的文字,目前沒有這種浮水印
  • 用 Claude 或 Gemini 寫的長文有,但現在還沒有公開工具可以驗
  • Claude 的浮水印做在模型層,所以不管你從哪個介面用它,網頁版、API、還是雲端平台,結果一樣

OpenAI 做出來了,然後選擇不上線

同一套技術,OpenAI 在 2024 年就開發完成,然後按住不發。公開理由有三個:

  • 改寫就能破,投入跟效果不成比例
  • 特別容易誤傷非英語母語的人。他們用 AI 改善表達很合理,卻反而更容易被判成 AI 生成
  • 讓人以為查得出來。查得不完整的工具,反而會讓學校和公司拿它當裁決依據

到 2026 年,這三個問題一個都沒被解決。2026 年的學術評估反而佐證了它們。

換句話說,Claude 現在上線,不是因為技術變可靠了。原因在下一節。

技術沒變,變的是法規

歐盟 AI 法案第 50 條在 2026 年 8 月 2 日生效,要求生成式 AI 的產出要帶機器可讀的標記。Anthropic 的動作是為了符合這條,並且選擇全球一致,不只針對歐洲。

三個主要轄區的要求差很多:

地區 生效時間 要求
歐盟 2026 年 8 月 文字、圖、音、影都要加機器可讀標記。罰則可達全球年營業額 3%
中國 2025 年 9 月 更嚴。要畫面看得見的標示加上檔案裡的隱藏標記,還要含服務商名稱
台灣 未定 《人工智慧基本法》2026 年 1 月公布,但採原則性立法,具體標示規則還在各主管機關手上

對一般使用者來說,這一節的重點只有一句:這些法規管的是模型商,不是你。

第 50 條的義務落在「AI 系統提供者」身上,也就是 Anthropic、Google 這些公司。你用 Claude 寫一篇文章發在自己的部落格,不會因此變成受規範對象。除非你的產品本身內嵌了生成式 AI 對外提供服務,那角色就不一樣了。

台灣目前沒有強制標示規範,各部會的產業指引預計 2028 年 1 月前陸續完成。相對地,中國的標識辦法已經在 2025 年 9 月上路,而且要求最嚴。

圖片是另一套機制,而且脆弱得多

文字用的是統計浮水印,圖片和檔案用的是內容憑證(C2PA),差別很大。

那是一份加密簽章的來源紀錄,附在檔案上,記錄內容從產生到編輯的歷程。好處是任何人都能驗證、不需要密鑰。壞處是很脆。

剛產生 複製、轉存 上傳社群 內容被改寫 文字記號 圖片憑證 改字才會掉 這裡就沒了
兩種記號的存活曲線幾乎相反。文字記號因為就是那串字,一路撐到有人動手改寫;圖片憑證附在檔案資料裡,換個格式或上傳一次就被清掉。截圖對兩者都是終點,因為那時候文字也已經不是文字了。

社群平台在上傳、壓縮、轉檔的過程中會把這類資料剝掉。這不是刻意打壓,是壓縮流程本來就以縮小檔案為目標。email、通訊軟體、多數網站後台同樣不保留。

所以會出現一個矛盾的現象:AI 生成的圖片在原始檔案裡帶著完整憑證,但只要經過一次社群平台的轉發,就什麼都不剩了。

相機廠和國際媒體都在推這套簽章,但只要經過一次社群平台就前功盡棄。

它還沒準到可以拿來抓人

上面都是好消息。接下來是壞消息,而且比多數人以為的更值得注意。

先把最大的誤解講死

測到浮水印,只證明這段文字經過某個 AI,不證明內容是 AI 想的。

校稿、翻譯、摘要、換句話說、格式轉換,留下的訊號強弱差很多,但測到的時候意義是同一個:只證明這段文字經過機器,不證明想法是誰的。

工具能告訴你的是「這段文字經過機器」,不是「這個人偷懶」。這兩件事被當成同一件,是接下來會出很多麻煩的地方。

問題一:它沒有你以為的那麼準

官方與獨立研究測出來的結果差很多。

在最理想的條件下,沒被動過的文本偵測率可以到 99.8%。但只要經過中度改寫,就掉到 49.8%,等於擲硬幣。有研究專門測改寫攻擊,浮水印被洗掉的成功率是 98.3%,而這已經是同批測試裡最耐改寫的一種,另外兩種方法是全部被洗掉。

更值得注意的是另一份研究。2026 年有人把浮水印當成司法證據的標準來評估,換一組設定重測,結果是即使沒有任何人動手腳,也有八成沒被測出來。同一份研究裡,被改寫過的人類文本有 5.4% 被誤判成 AI 生成。

兩個數字不是誰造假,是「門檻怎麼設、測什麼樣的文本」不同就會差這麼多。而這件事本身就是重點:一個換組設定就能從 99.8% 掉到兩成的工具,不該拿來裁決個案。那份研究的結論也正是如此,它認為這類證據還沒到能當鑑識依據的程度。

這往兩個方向都解除焦慮。想拿它抓人的,抓不準;被它指控的,有話可講。

問題二:中文的情況沒人說得準

這套機制要有選擇空間才藏得住訊號,而不同語言的選擇空間不一樣。中文本來就跟英文吃不同的 token 帳,在浮水印上也一樣有自己的行為。問題是研究之間的結論並不一致:有的測出中文可藏的餘地比英文小,有的反而測出中文的偵測率比較高,日文則明顯最差。

更麻煩的是判定門檻多半拿英文校準,套到中文會不會偏鬆,目前沒有公開數據。各家都沒有公布分語言的偵測率。

所以中文使用者現在的處境不是「更危險」,是沒有人能告訴你準不準。這包括拿偵測結果來指控你的那個人。

問題三:偽造比被抓更難處理

不準這件事,最壞的後果不是抓不到用 AI 的人,是反過來。

浮水印可以被反向偽造。攻擊者反覆查詢模型、觀察規律,推出密鑰的近似行為,再把人寫的文章改造成「看起來有浮水印」。蘇黎世聯邦理工學院的實驗做到了不用 50 美元、成功率超過八成。

方向反過來想一次:不是你用了 AI 被抓到,而是你沒用 AI,卻被指控用了。

這種情況難處理,是因為你沒辦法證明一件事沒發生。而偵測結果看起來很像科學,你的辯解看起來只像辯解。

三件事其實是同一件

這東西不夠準,於是既抓不了該抓的,也擋不住不該發生的指控。公眾的擔心集中在「用 AI 會不會被抓」,但真正的問題在另一頭。

問題不是會不會被測到,是你講了沒有

沒有通用答案,看你是誰。

你是 該做的事
學生 先弄清楚學校的 AI 規定。規則不明確才是風險,浮水印不是
上班族 同上,先問公司政策。多數組織接受 AI 輔助,但要求講清楚用在哪
寫文章投稿的人 投稿前確認該媒體的 AI 政策,讓它變成流程的固定一步。事先講開了,測到什麼都不構成問題
審稿或帶團隊的人 不要拿偵測結果當裁決依據,理由見上一節。該做的是事前把規則寫清楚
經營自媒體的人 圖片如果要保留來源憑證,注意社群平台會剝掉。真的在意就自己留原始檔
一般使用者 不用特別做什麼。聊天、問問題、短訊息這種長度本來就測不到。但如果你請 AI 寫的是整篇長文,那就適用上面幾列

講清楚,比躲起來省事

問題從來不是「會不會被測到」,是「你講了沒有」。

講明的協作,測到什麼都在預期之內。沒講的,就算這次沒被測到,你也一直在賭。

不要去買那些「去浮水印」工具

接下來很可能會冒出一批標榜「去除 AI 浮水印」「AI 文字人性化」的付費工具。

要真的洗掉訊號,得改動大半內容。那個工作量比直接講開高得多,而且你付錢買到的是一個賭注,賭對方測不出來。更麻煩的是,這類工具通常同時破壞你的文字品質,為了躲一個還沒開放的偵測器。

常見問題

我複製貼上到 Word,浮水印還在嗎? 在。它就是那串字,不是附加在檔案上的東西。存成純文字檔一樣還在。

那圖片呢? 相反。圖片用的是另一套機制,附在檔案資料裡,上傳到社群平台通常就被清掉了。

我只是請 AI 幫我改錯字,也算嗎? 訊號會很稀疏。多數字是你寫的,AI 只動了局部,能留下的記號很少,長度不夠就測不出來。但即使測到,它證明的也只是「這段文字經過 AI」。

現在有人能檢查我的文章嗎? 還不行。Anthropic 說會提供偵測 API 但尚未開放,Google 的偵測工具目前限記者與研究者申請。這代表現階段的實際風險比新聞讀起來低很多。

我是自己寫的,會被誤判嗎? 有可能。研究裡測到的是:把人寫的文章拿去改寫過之後,有 5.4% 被判成 AI 生成。純粹自己寫、沒經過任何工具的文本誤判率會更低,但沒有公開數據。這也正是不該拿偵測結果單獨當證據的原因。

我以前用 Claude 寫的東西呢? 沒有浮水印。只有 2026 年 8 月 2 日之後發布的模型才帶記號,更早的模型還在過渡期,官方說會在未來數月陸續納入。已經產出的舊內容不會被回頭加上。

可以關掉嗎? 不行。官方公告沒有提供任何退出機制,付費的企業與 API 客戶也一樣。

我用的不是 Claude 官網,是別的 AI 寫作工具? 還是可能有。浮水印做在模型層,所以只要那個工具底層接的是 Claude,不管是直接走 API 還是透過 AWS、Google Cloud、Microsoft Foundry,產出都帶記號。換句話說,你可能在不知情的狀況下產出帶浮水印的文字。

這跟 GPTZero 那種偵測器是同一件事嗎? 不是。那類工具沒有任何植入訊號,純粹分析文章特徵來猜,準確度爭議大得多。兩者常被混為一談。

台灣有規定一定要標示 AI 內容嗎? 目前沒有強制規範。真正有強制力的是歐盟,而且規範對象是模型商,不是使用者。

比新聞小,但不會消失

這件事的實際影響,比新聞標題給人的感覺小很多。偵測工具還沒開放、準確度不足以定人罪、多數人的使用長度根本測不到。

但它確實標記了一個轉變:內容的來源開始變成可以被查的東西。

要準備的不是防備,是習慣。把「這份東西哪裡用了 AI」講清楚,本來就會讓合作變簡單。浮水印只是讓這件事從選擇題,慢慢變成預設值。

資料來源

  1. Anthropic 官方說明:Claude 的文字浮水印怎麼運作
  2. SynthID-Text 技術說明(Hugging Face)
  3. Google SynthID 官方文件
  4. SynthID 文字浮水印的穩健性評估與強化
  5. AI 浮水印證據未達鑑識可用標準:實證評估
  6. SynthID-Text 理論分析與實證驗證
  7. 以 entropy 為基礎的文字浮水印偵測方法(含語言差異)
  8. 針對浮水印模型的偽造攻擊研究(ETH Zurich)
  9. EU AI Act 第 50 條透明度規則實務指南
  10. 中國《人工智慧生成合成內容標識辦法》英譯
  11. 國科會揭 2026 年度科技發展布局、AI 基本法草案進展(iThome)