Anthropic 上調「失準」風險評級,並揭未發布模型 Model 2

Elponcrab
分享
Anthropic 上調「失準」風險評級,並揭未發布模型 Model 2

一家正衝刺 IPO 的 AI 公司,主動把自家的風險評級「往上調」。根據 Anthropic 於 8 月 14 日發布的第二份全公司「風險報告」(在其負責任擴展政策 RSP v3.4 之下),它把「高風險情境中因失準(misalignment)造成災難性危害」的風險,從「極低」上調到「低」;同一份報告也首度揭露了一個尚未發布的內部模型 Model 2。

上調風險,不是因為模型「出包」

要先釐清一點:這次上調並不是某個模型沒通過安全測試。Anthropic 表示,主因是近期的網路安全評估事件揭露,增加了整體的不確定性;再加上一個關鍵問題,它用來偵測「是否已跨過最危險能力門檻」的內部基準已經「飽和」,也就是分數頂到天花板,再也測不出能力的增量。換句話說,是「量不準了」,讓它選擇了更保守的評級。

Model 2 比 Mythos 5 更強,但不對外發布

報告揭露,Anthropic 內部有一個名為 Model 2 的系統,能力比其前沿模型 Mythos 5「略強」,公司內部已大量使用,但它「尚未跑完平常上線前的完整評估」,目前也沒有對外發布的計畫。對一家正備戰秋季 IPO、市場甚至傳出上看 2 兆美元估值的公司而言,一邊坦承手上握有一個更強大,但安全評估還沒做完的模型,一邊又主動上調風險,某種程度是把「安全治理」當成招牌;但這也讓外界更想知道:前沿能力與安全評估之間的落差,到底有多大。

廣告 - 內文未完請往下捲動

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。