Claude 開始在文字裡加浮水印,你該擔心嗎
Claude 從 8 月起在輸出的文字裡加浮水印,複製貼上也帶得走。但它證明的是「這段文字經過 AI」,不是「這個人偷懶」,而且改寫過後偵測率會從 99.8% 掉到 49.8%。這篇講原理、各家現況、法規怎麼要求,以及你實際上該做什麼。
目錄(23 節)
你用 AI 潤過一封信、改過一份報告、順過一則貼文。
然後八月的新聞說,Claude 開始在產出的文字裡加浮水印,而且複製貼上也帶得走。
第一個念頭大概是:所以我被標記了嗎?會被發現嗎?
先講兩個可以立刻放下的事實:目前還沒有任何工具開放給一般人檢查你的文章,而且 2026 年 8 月之前產出的內容根本沒有浮水印。
多數人不安的那幾點是誤解。但確實有一件事值得警覺,而它跟你想的不是同一件。
你聽過的 AI 偵測器,跟這次的浮水印不是同一件事
「AI 浮水印」這個詞底下,其實躺著三種技術。它們強不強、能證明什麼、誰驗得了,差別很大。混在一起談,是多數誤解的源頭。
| 統計浮水印 | 內容憑證 | 事後偵測 | |
|---|---|---|---|
| 你可能聽過的名字 | SynthID | C2PA、Content Credentials | GPTZero、Turnitin |
| 訊號在哪 | 用字的選擇裡 | 檔案的簽章資料 | 沒有訊號,純粹用猜的 |
| 誰能驗 | 模型商(有密鑰) | 任何人(公開可驗) | 任何人 |
| 純文字複製 | 保留 | 不適用 | 不適用 |
| 截圖、轉檔 | 保留 | 消失 | 不適用 |
| 準確度 | 長文才穩,見下文 | 在就可信,不在不代表什麼 | 誤判率高,爭議大 |
差別最大的是最後一欄。
前兩種是模型商主動植入的,有明確的真相可以比對。第三種完全不同:它沒有任何植入訊號,純粹分析文章的統計特徵,判斷「讀起來像不像 AI 寫的」。
這件事值得單獨強調,因為很多人對 AI 偵測的恐懼,其實來自被第三種誤判的經驗。學生被 Turnitin 判定作弊、作者被讀者拿 GPTZero 檢驗,那些爭議跟這次的浮水印不是同一套技術。學術界對第三種的可靠度批評已久。
接下來這篇主要談第一種,也就是這次真正的新東西。第二種在後面談。
為什麼複製貼上帶得走,改寫卻會弄丟
先把最容易嚇到人的想像拆掉。統計浮水印不是隱形字元,不是藏在檔案裡的標籤,也不是任何被「加」進去的東西。
它利用的是選擇本身。
密碼本
想像你要在一份文件裡藏訊息,但規則是不能加任何一個字。
唯一的辦法是利用同義詞。文件裡有大量位置,寫「有效」可以,寫「管用」也可以,意思一樣、讀起來都自然。你事先跟收訊方約好一本密碼本,規定每個位置該偏好哪一個。
寫的時候照密碼本挑。單看任何一句都正常,因為兩個詞本來就都對。但收訊方拿同一本密碼本掃過全文,會發現你的選擇跟密碼本吻合的比例,高得不像巧合。
AI 浮水印做的事情跟這個比喻幾乎一樣。模型每寫一個字,本來就是在許多合理選項裡挑一個(更精確地說是挑一個 token),浮水印只是讓「挑哪一個」由一把密鑰決定。
再精確一點說:模型會從自己原本就算好的候選裡抽出幾個,讓它們兩兩比對密鑰算出的分數,像一場小型淘汰賽,最後勝出的那個就是輸出。
候選本來就都來自模型自己的判斷,所以理論上選哪一個都不影響句子的品質。Anthropic 的說法是,讀者分辨不出帶浮水印與不帶浮水印的差別。
所以複製貼上會保留
這是最多人搞混的地方。
如果浮水印是貼在檔案上的標籤,那複製純文字、轉存、截圖,標籤就沒了。但它不是標籤,它就是那串字。你複製了字,就複製了訊息。
貼到 Word、LINE、記事本、部落格後台,訊息多半還在。編輯器的自動校正、全半形轉換這類動作會動到字,多少會磨掉一點。
反過來說,能弄掉它的方式只有改字。改越多流失越多,整段重寫就沒了。
為什麼短的測不出來
一枚做了手腳、55% 會出正面的硬幣,你丟 10 次,可能出 6 次正面,也可能出 4 次,完全看不出異常。丟 1000 次,偏差就藏不住了。
浮水印偵測是同一件事。掃幾十個字,吻合度再高也可能是巧合;要到四五百字,統計上才站得住。
這代表你的日常對話、一句訊息、一個標題,測不出來不是技術不夠好,是數學上不可能。
也代表反過來不成立:測不到不能當成沒用 AI 的證據,只說明樣本不夠長。
有些內容藏不進去
淘汰賽需要「有得選」。當合理答案只有一個的時候,就沒有選擇空間,訊號自然就稀疏。
- 程式碼:多數情況必須精確,換個寫法就錯了
- 事實性內容:專有名詞、數字、引用,沒得替換
- 幫你校稿:多數字是你寫的,AI 只動局部,留下的記號很少
有一個方向常被搞反:拿 AI 生成的文章去別處翻譯,訊號會流失;但用 AI 做翻譯,產出的譯文本身是帶記號的,因為每個字都是它選的。
五個傳言,逐條對照
| 傳言 | 實際 |
|---|---|
| 藏了看不見的特殊字元 | 沒有。官方明確否認 |
| 是檔案裡的隱藏資料 | 不是。文字浮水印不靠這個 |
| 記錄了我是誰 | 沒有。詳見下段 |
| 會讓 AI 寫得比較差 | 候選都來自模型原本的判斷,不改變品質 |
| 會多花錢 | 不需要額外 token,Anthropic 說不會因此變貴 |
關於身分這一條值得單獨講。Anthropic 的官方說明寫得很清楚:浮水印與那把密鑰都無法回推使用者、所屬組織或對話內容。它能回答的問題只有一個,就是「這段文字是不是這個模型產生的」,回答不了「是誰產生的」。
如果你的不安來自「我被追蹤了」,這一條可以放下。
ChatGPT 沒有,Gemini 有,差別在哪
浮水印不是全業界的統一動作,各家差很多。
| 文字浮水印 | 圖片檔案憑證 | 一般人能驗嗎 | |
|---|---|---|---|
| Claude(Anthropic) | 8 月起發布的新模型有,舊模型過渡中 | 有 | 還不行 |
| Gemini(Google) | 有,SynthID | 有 | 限記者與研究者 |
| ChatGPT(OpenAI) | 沒有 | 圖片有 | 不適用 |
| Meta AI | 沒有公開部署 | 讀取並顯示標籤 | 不適用 |
幾個實際含義:
- 用 ChatGPT 寫的文字,目前沒有這種浮水印
- 用 Claude 或 Gemini 寫的長文有,但現在還沒有公開工具可以驗
- Claude 的浮水印做在模型層,所以不管你從哪個介面用它,網頁版、API、還是雲端平台,結果一樣
OpenAI 做出來了,然後選擇不上線
同一套技術,OpenAI 在 2024 年就開發完成,然後按住不發。公開理由有三個:
- 改寫就能破,投入跟效果不成比例
- 特別容易誤傷非英語母語的人。他們用 AI 改善表達很合理,卻反而更容易被判成 AI 生成
- 讓人以為查得出來。查得不完整的工具,反而會讓學校和公司拿它當裁決依據
到 2026 年,這三個問題一個都沒被解決。2026 年的學術評估反而佐證了它們。
換句話說,Claude 現在上線,不是因為技術變可靠了。原因在下一節。
技術沒變,變的是法規
歐盟 AI 法案第 50 條在 2026 年 8 月 2 日生效,要求生成式 AI 的產出要帶機器可讀的標記。Anthropic 的動作是為了符合這條,並且選擇全球一致,不只針對歐洲。
三個主要轄區的要求差很多:
| 地區 | 生效時間 | 要求 |
|---|---|---|
| 歐盟 | 2026 年 8 月 | 文字、圖、音、影都要加機器可讀標記。罰則可達全球年營業額 3% |
| 中國 | 2025 年 9 月 | 更嚴。要畫面看得見的標示加上檔案裡的隱藏標記,還要含服務商名稱 |
| 台灣 | 未定 | 《人工智慧基本法》2026 年 1 月公布,但採原則性立法,具體標示規則還在各主管機關手上 |
對一般使用者來說,這一節的重點只有一句:這些法規管的是模型商,不是你。
第 50 條的義務落在「AI 系統提供者」身上,也就是 Anthropic、Google 這些公司。你用 Claude 寫一篇文章發在自己的部落格,不會因此變成受規範對象。除非你的產品本身內嵌了生成式 AI 對外提供服務,那角色就不一樣了。
台灣目前沒有強制標示規範,各部會的產業指引預計 2028 年 1 月前陸續完成。相對地,中國的標識辦法已經在 2025 年 9 月上路,而且要求最嚴。
圖片是另一套機制,而且脆弱得多
文字用的是統計浮水印,圖片和檔案用的是內容憑證(C2PA),差別很大。
那是一份加密簽章的來源紀錄,附在檔案上,記錄內容從產生到編輯的歷程。好處是任何人都能驗證、不需要密鑰。壞處是很脆。
社群平台在上傳、壓縮、轉檔的過程中會把這類資料剝掉。這不是刻意打壓,是壓縮流程本來就以縮小檔案為目標。email、通訊軟體、多數網站後台同樣不保留。
所以會出現一個矛盾的現象:AI 生成的圖片在原始檔案裡帶著完整憑證,但只要經過一次社群平台的轉發,就什麼都不剩了。
相機廠和國際媒體都在推這套簽章,但只要經過一次社群平台就前功盡棄。
它還沒準到可以拿來抓人
上面都是好消息。接下來是壞消息,而且比多數人以為的更值得注意。
先把最大的誤解講死
測到浮水印,只證明這段文字經過某個 AI,不證明內容是 AI 想的。
校稿、翻譯、摘要、換句話說、格式轉換,留下的訊號強弱差很多,但測到的時候意義是同一個:只證明這段文字經過機器,不證明想法是誰的。
工具能告訴你的是「這段文字經過機器」,不是「這個人偷懶」。這兩件事被當成同一件,是接下來會出很多麻煩的地方。
問題一:它沒有你以為的那麼準
官方與獨立研究測出來的結果差很多。
在最理想的條件下,沒被動過的文本偵測率可以到 99.8%。但只要經過中度改寫,就掉到 49.8%,等於擲硬幣。有研究專門測改寫攻擊,浮水印被洗掉的成功率是 98.3%,而這已經是同批測試裡最耐改寫的一種,另外兩種方法是全部被洗掉。
更值得注意的是另一份研究。2026 年有人把浮水印當成司法證據的標準來評估,換一組設定重測,結果是即使沒有任何人動手腳,也有八成沒被測出來。同一份研究裡,被改寫過的人類文本有 5.4% 被誤判成 AI 生成。
兩個數字不是誰造假,是「門檻怎麼設、測什麼樣的文本」不同就會差這麼多。而這件事本身就是重點:一個換組設定就能從 99.8% 掉到兩成的工具,不該拿來裁決個案。那份研究的結論也正是如此,它認為這類證據還沒到能當鑑識依據的程度。
這往兩個方向都解除焦慮。想拿它抓人的,抓不準;被它指控的,有話可講。
問題二:中文的情況沒人說得準
這套機制要有選擇空間才藏得住訊號,而不同語言的選擇空間不一樣。中文本來就跟英文吃不同的 token 帳,在浮水印上也一樣有自己的行為。問題是研究之間的結論並不一致:有的測出中文可藏的餘地比英文小,有的反而測出中文的偵測率比較高,日文則明顯最差。
更麻煩的是判定門檻多半拿英文校準,套到中文會不會偏鬆,目前沒有公開數據。各家都沒有公布分語言的偵測率。
所以中文使用者現在的處境不是「更危險」,是沒有人能告訴你準不準。這包括拿偵測結果來指控你的那個人。
問題三:偽造比被抓更難處理
不準這件事,最壞的後果不是抓不到用 AI 的人,是反過來。
浮水印可以被反向偽造。攻擊者反覆查詢模型、觀察規律,推出密鑰的近似行為,再把人寫的文章改造成「看起來有浮水印」。蘇黎世聯邦理工學院的實驗做到了不用 50 美元、成功率超過八成。
方向反過來想一次:不是你用了 AI 被抓到,而是你沒用 AI,卻被指控用了。
這種情況難處理,是因為你沒辦法證明一件事沒發生。而偵測結果看起來很像科學,你的辯解看起來只像辯解。
三件事其實是同一件
這東西不夠準,於是既抓不了該抓的,也擋不住不該發生的指控。公眾的擔心集中在「用 AI 會不會被抓」,但真正的問題在另一頭。
問題不是會不會被測到,是你講了沒有
沒有通用答案,看你是誰。
| 你是 | 該做的事 |
|---|---|
| 學生 | 先弄清楚學校的 AI 規定。規則不明確才是風險,浮水印不是 |
| 上班族 | 同上,先問公司政策。多數組織接受 AI 輔助,但要求講清楚用在哪 |
| 寫文章投稿的人 | 投稿前確認該媒體的 AI 政策,讓它變成流程的固定一步。事先講開了,測到什麼都不構成問題 |
| 審稿或帶團隊的人 | 不要拿偵測結果當裁決依據,理由見上一節。該做的是事前把規則寫清楚 |
| 經營自媒體的人 | 圖片如果要保留來源憑證,注意社群平台會剝掉。真的在意就自己留原始檔 |
| 一般使用者 | 不用特別做什麼。聊天、問問題、短訊息這種長度本來就測不到。但如果你請 AI 寫的是整篇長文,那就適用上面幾列 |
講清楚,比躲起來省事
問題從來不是「會不會被測到」,是「你講了沒有」。
講明的協作,測到什麼都在預期之內。沒講的,就算這次沒被測到,你也一直在賭。
不要去買那些「去浮水印」工具
接下來很可能會冒出一批標榜「去除 AI 浮水印」「AI 文字人性化」的付費工具。
要真的洗掉訊號,得改動大半內容。那個工作量比直接講開高得多,而且你付錢買到的是一個賭注,賭對方測不出來。更麻煩的是,這類工具通常同時破壞你的文字品質,為了躲一個還沒開放的偵測器。
常見問題
我複製貼上到 Word,浮水印還在嗎? 在。它就是那串字,不是附加在檔案上的東西。存成純文字檔一樣還在。
那圖片呢? 相反。圖片用的是另一套機制,附在檔案資料裡,上傳到社群平台通常就被清掉了。
我只是請 AI 幫我改錯字,也算嗎? 訊號會很稀疏。多數字是你寫的,AI 只動了局部,能留下的記號很少,長度不夠就測不出來。但即使測到,它證明的也只是「這段文字經過 AI」。
現在有人能檢查我的文章嗎? 還不行。Anthropic 說會提供偵測 API 但尚未開放,Google 的偵測工具目前限記者與研究者申請。這代表現階段的實際風險比新聞讀起來低很多。
我是自己寫的,會被誤判嗎? 有可能。研究裡測到的是:把人寫的文章拿去改寫過之後,有 5.4% 被判成 AI 生成。純粹自己寫、沒經過任何工具的文本誤判率會更低,但沒有公開數據。這也正是不該拿偵測結果單獨當證據的原因。
我以前用 Claude 寫的東西呢? 沒有浮水印。只有 2026 年 8 月 2 日之後發布的模型才帶記號,更早的模型還在過渡期,官方說會在未來數月陸續納入。已經產出的舊內容不會被回頭加上。
可以關掉嗎? 不行。官方公告沒有提供任何退出機制,付費的企業與 API 客戶也一樣。
我用的不是 Claude 官網,是別的 AI 寫作工具? 還是可能有。浮水印做在模型層,所以只要那個工具底層接的是 Claude,不管是直接走 API 還是透過 AWS、Google Cloud、Microsoft Foundry,產出都帶記號。換句話說,你可能在不知情的狀況下產出帶浮水印的文字。
這跟 GPTZero 那種偵測器是同一件事嗎? 不是。那類工具沒有任何植入訊號,純粹分析文章特徵來猜,準確度爭議大得多。兩者常被混為一談。
台灣有規定一定要標示 AI 內容嗎? 目前沒有強制規範。真正有強制力的是歐盟,而且規範對象是模型商,不是使用者。
比新聞小,但不會消失
這件事的實際影響,比新聞標題給人的感覺小很多。偵測工具還沒開放、準確度不足以定人罪、多數人的使用長度根本測不到。
但它確實標記了一個轉變:內容的來源開始變成可以被查的東西。
要準備的不是防備,是習慣。把「這份東西哪裡用了 AI」講清楚,本來就會讓合作變簡單。浮水印只是讓這件事從選擇題,慢慢變成預設值。