Anthropic 員工解釋 AI 浮水印原理:就像留下只有 Claude 懂的紀錄,不影響生成品質
生成式 AI 是如去替輸出內容加入浮水印?如果模型為了留下可辨識的痕跡,被迫選擇某些特定詞彙,會不會犧牲回答品質?Anthropic 員工 Thariq 近日以一個互動式示範解釋,至少按照其展示的設計思路,答案是否帶有浮水印,並不需要改變 Claude 原本可以選擇的詞,也不需要修改每個詞出現的機率。
為什麼同一個 Prompt,Claude 每次答案都不同?
理解這套浮水印之前,首先要理解大型語言模型為什麼具有隨機性。Claude 並不是收到問題後一次生成完整答案,而是一個 token、一個 token 往後生成。在某些位置,模型可能非常確定下一步應該寫什麼;但在開放式寫作中,經常會同時存在許多合理的下一步。
Thariq 以一句小說開頭為例: Write the opening line of a moody short story. Begin with the words “The weather”.
寫到「The weather」之後,Claude 可能認為:
- turned cold and overcast
- broke without warning
- held its breath all morning
都是合理選擇。
假設三條路徑的機率分別是 40%、33% 與 27%,模型就會抽取一個隨機數,決定此次生成走哪一條路。這種有多個合理候選答案的地方,就是所謂的 high-entropy choice,高熵選擇。而一旦第一個選擇不同,後續文字的 context 也跟著改變。
因此兩次 Claude 回答同一個問題,差異通常不只是把一兩個單字換掉,而可能從前面某個分岔點開始,整段文字一路走向完全不同的句型與內容。
浮水印怎麼做?把隨機數改成「秘密金鑰+前文」
一般情況下,Claude 每次遇到這種高熵選擇,就像重新丟一次數位骰子。Thariq 解釋的浮水印方法,則將這個隨機數來源替換掉。原本可能是真正隨機數決定下一個 token。加入浮水印之後則變成:Hash(秘密金鑰+目前已生成文字)→ 產生數字 → 決定下一個 token。關鍵在於模型候選 token 並沒有改變,它們原本的機率也沒有改變。
假設 Claude 原本只考慮 A、B、C 三種續寫,而且機率仍然是 40%、33%、27%,加入浮水印後也還是這三個選項與相同機率。
浮水印不能突然加入一個原本模型根本不想寫的詞,也不能偷偷提高某個不自然選項的機率。
改變的只是最後抽中了哪一條路。
因此 Thariq 認為,這類浮水印理論上不會造成品質下降。
因為帶有浮水印的答案,本來就是 Claude 在正常生成過程中「可能寫出的其中一個答案」。
秘密金鑰就像留下只有 Anthropic 看得懂的擲骰紀錄
這套方法真正有趣的地方,在於後續辨識。因為每一次高熵選擇使用的數字,都可以由:秘密金鑰+先前文字重新計算。掌握秘密金鑰的一方,就可以拿一段文字重新跑一次,檢查文章中大量高熵選擇是否異常符合該金鑰應該產生的結果。如果符合的次數愈多,就愈有理由認為這段文字可能由 Claude 生成。對不知道金鑰的人而言,文章依然只是一篇普通文字。
也因此,這種浮水印不是在文章裡加入肉眼可見的特殊符號,也不是要求 Claude 固定使用某些奇怪的詞彙,而是將訊號藏在模型本來就存在的隨機選擇裡。
Thariq 特別強調,浮水印檢測並不會回傳簡單的:這是 Claude 寫的」或「這不是 Claude 寫的」。它得到的是一個機率。原因是單一一次選擇剛好符合秘密金鑰,完全可能只是巧合。但如果一篇長文包含數十甚至數百次高熵選擇,而其中大量結果都與金鑰吻合,巧合的可能性便會快速下降。
因此,浮水印訊號具有「累積」特性。文章愈長、Claude 可以自由決定如何表達的地方愈多,能累積的浮水印訊號通常也愈強。寫小說最好抓,校稿與資料擷取可能完全抓不到
風險提示
加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。



