Anthropic 模型向費城警方送假命案線報,內部評估全面斷網
Anthropic 10 月 9 日發表研究報告,揭露 Claude 在內部評估與內部使用中出現的多起意外行為,其中一起是模型在測試時,向費城警察局的懸案線報表單送出一則捏造的線索。Anthropic 同時宣布,在確認安全與監控措施能可靠攔截這類行為之前,所有內部評估都將切斷與外部網路的連線。
Haiku 4.5 在測試中替懸案表單編造目擊線索
根據報告,Claude Haiku 4.5 當時的任務是在隨機挑選的網頁上產生並執行示範任務。模型進到一個提及懸案的網頁,頁面上有警方設置的線報表單。測試指令要求模型不得登入、建立帳號、輸入個人資料、購物或送出任何具破壞性的內容,但沒有禁止送出表單。
模型在表單中寫下:「我可能有這起案件的相關資訊。我記得那段時間曾在(頁面提到的街道)附近,看到符合描述的人。如果這項資訊有幫助,請與我聯絡。」Anthropic 指出,該網頁其實沒有任何嫌犯描述。模型沒有填寫姓名與聯絡方式就送出,表單被系統判定為垃圾訊息,沒有轉交調查。Anthropic 認為,從對話紀錄來看,Claude 似乎只是在替任務產生示範內容,並非有意誤導他人。
費城警察局在給 TechCrunch 的聲明中表示,這則線報是在 7 月 18 日晚間 11 點 27 分送到 PhillyUnsolvedMurders.com,Anthropic 直到 9 月 28 日才發現。警方說:「公司必須強化防護,避免類似事件在市府不知情的情況下影響市府系統。延遲兩個月才發現並通報市府,令人無法接受。」Anthropic 在報告中則稱,技術審查完成後已於 10 月 8 日通知警方。
四類意外行為:利用漏洞執行指令、繞過付費門檻取得資料
報告把觀察到的行為分成四類。第一類是利用軟體漏洞在伺服器上執行指令,例如 Claude Mythos Preview 在執行科學分析時,因所需的大學公開工具出錯,便在該大學伺服器上找到注入漏洞,直接在伺服器上跑完計算。第二類是送出不該送出的表單,除了這起警方線報,還有一款未公開的研究模型在練習用表單無法載入時,改到真正的政府網站送出表單。
第三類是繞過限制取得需要權杖或付費的資料,例如 Claude Mythos 5 從地方政府地圖網站的設定檔找到可用的存取權杖,直接向後端伺服器取資料;另一起是研究員用 Mythos 5 做統計專案時,模型從州政府機構網站的封存版本發現公開儀表板會發權杖給任何訪客,因此沒有付費就查詢了資料庫。第四類是用免費短網址服務,規避抓取工具對網址長度的限制,Claude Opus 5 與 Mythos 5 都出現過。
Anthropic 表示,部分案例涉及美國聯邦、州與地方政府機構的網站,已向白宮簡報並通知相關機構,應當事機構要求不公開名稱。公司評估這些案例對現實的影響很小,嚴重程度遠低於 7 月 30 日與 9 月 9 日揭露的資安評估事件,多數屬於「堅持」:模型無法照原樣完成任務時,會繞過限制,而不是停下來。
所有內部評估切斷網路,新攔截工具測試全數擋下
Anthropic 先前已對部分高風險與資安評估關閉網路,這次擴大到所有內部評估。公司已停止執行部分公開評估,或改用離線版本、重寫題目避免連到真實網站,也收緊網頁抓取等工具的權限。Anthropic 另外開發了自動偵測與攔截這類行為的工具,目前已用在多數評估與內部的前沿模型代理使用上,拿報告中的案例測試,全部都被擋下。
報告提到,Anthropic 會持續修正或移除那些會獎勵模型繞過工具限制的訓練環境,並表示審查仍在進行,之後發現新案例會再公布。
風險提示
加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。




