Anthropic 員工解釋 AI 浮水印原理:就像留下只有 Claude 懂的紀錄,不影響生成品質

Neo
分享
Anthropic 員工解釋 AI 浮水印原理:就像留下只有 Claude 懂的紀錄,不影響生成品質

生成式 AI 是如去替輸出內容加入浮水印?如果模型為了留下可辨識的痕跡,被迫選擇某些特定詞彙,會不會犧牲回答品質?Anthropic 員工 Thariq 近日以一個互動式示範解釋,至少按照其展示的設計思路,答案是否帶有浮水印,並不需要改變 Claude 原本可以選擇的詞,也不需要修改每個詞出現的機率。

為什麼同一個 Prompt,Claude 每次答案都不同?

理解這套浮水印之前,首先要理解大型語言模型為什麼具有隨機性。Claude 並不是收到問題後一次生成完整答案,而是一個 token、一個 token 往後生成。在某些位置,模型可能非常確定下一步應該寫什麼;但在開放式寫作中,經常會同時存在許多合理的下一步。

Thariq 以一句小說開頭為例: Write the opening line of a moody short story. Begin with the words “The weather”.

廣告 - 內文未完請往下捲動

寫到「The weather」之後,Claude 可能認為:

  • turned cold and overcast
  • broke without warning
  • held its breath all morning

都是合理選擇。

假設三條路徑的機率分別是 40%、33% 與 27%,模型就會抽取一個隨機數,決定此次生成走哪一條路。這種有多個合理候選答案的地方,就是所謂的 high-entropy choice,高熵選擇。而一旦第一個選擇不同,後續文字的 context 也跟著改變。

因此兩次 Claude 回答同一個問題,差異通常不只是把一兩個單字換掉,而可能從前面某個分岔點開始,整段文字一路走向完全不同的句型與內容。

浮水印怎麼做?把隨機數改成「秘密金鑰+前文」

一般情況下,Claude 每次遇到這種高熵選擇,就像重新丟一次數位骰子。Thariq 解釋的浮水印方法,則將這個隨機數來源替換掉。原本可能是真正隨機數決定下一個 token。加入浮水印之後則變成:Hash(秘密金鑰+目前已生成文字)→ 產生數字 → 決定下一個 token。關鍵在於模型候選 token 並沒有改變,它們原本的機率也沒有改變。

假設 Claude 原本只考慮 A、B、C 三種續寫,而且機率仍然是 40%、33%、27%,加入浮水印後也還是這三個選項與相同機率。

浮水印不能突然加入一個原本模型根本不想寫的詞,也不能偷偷提高某個不自然選項的機率。

改變的只是最後抽中了哪一條路。

因此 Thariq 認為,這類浮水印理論上不會造成品質下降。

因為帶有浮水印的答案,本來就是 Claude 在正常生成過程中「可能寫出的其中一個答案」。

秘密金鑰就像留下只有 Anthropic 看得懂的擲骰紀錄

這套方法真正有趣的地方,在於後續辨識。因為每一次高熵選擇使用的數字,都可以由:秘密金鑰+先前文字重新計算。掌握秘密金鑰的一方,就可以拿一段文字重新跑一次,檢查文章中大量高熵選擇是否異常符合該金鑰應該產生的結果。如果符合的次數愈多,就愈有理由認為這段文字可能由 Claude 生成。對不知道金鑰的人而言,文章依然只是一篇普通文字。

也因此,這種浮水印不是在文章裡加入肉眼可見的特殊符號,也不是要求 Claude 固定使用某些奇怪的詞彙,而是將訊號藏在模型本來就存在的隨機選擇裡。

Thariq 特別強調,浮水印檢測並不會回傳簡單的:這是 Claude 寫的」或「這不是 Claude 寫的」。它得到的是一個機率。原因是單一一次選擇剛好符合秘密金鑰,完全可能只是巧合。但如果一篇長文包含數十甚至數百次高熵選擇,而其中大量結果都與金鑰吻合,巧合的可能性便會快速下降。

因此,浮水印訊號具有「累積」特性。文章愈長、Claude 可以自由決定如何表達的地方愈多,能累積的浮水印訊號通常也愈強。寫小說最好抓,校稿與資料擷取可能完全抓不到

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。