Anthropic 研究員辭職,安全主管:AI 十年內滅絕人類機率一成

Elponcrab
分享
Anthropic 研究員辭職,安全主管:AI 十年內滅絕人類機率一成

Anthropic 研究員 Jacob Coxon 宣布辭職,並公開批評 Anthropic 與 OpenAI 都沒有負起責任。同公司的對齊科學主管 Evan Hubinger 隨後回應,表示他個人認為 AI 在未來十年內殺光人類的機率是一成。

「他們正直奔會自我改進的超級智慧,拿我們的性命下注」

Coxon 在 9 月 9 日的貼文中寫道,他當天辭去 Anthropic 的職務,過去三年分別在 OpenAI 與 Anthropic 做預訓練研究,兩家公司都沒有負責任地行事,正直奔會自我改進的超級智慧,拿所有人的性命下注。

他形容這項技術的能力不該被低估,認為這些系統很快會強到能入侵任何東西、一夜之間翻新任何領域,並取得實質的權力與資源,而各個領域的進展都沒有放慢。他也提到,打造 AI 的人是真心相信這東西可能在這個十年結束前殺死所有人。

廣告 - 內文未完請往下捲動

對於「既然這樣相信,為什麼還在做」這個常見反問,Coxon 的說法是:在 OpenAI,許多人並未真正把文明層級的風險內化;在 Anthropic,風險是被理解的,但公司陷在一場要搶第一的競賽裡,因為他們相信別人不會負責任地做。

對齊主管公開附和,並說公司還沒有解方

根據 CNBC 報導,Anthropic 對齊科學主管 Evan Hubinger 在 X 上回應 Coxon,說他講的是對的,並補上自己的數字與判斷:他個人認為十年內的機率是 10%,相信 Anthropic 正在盡力,但公司目前還沒有解決超級智慧對齊問題的方案,也不明確處在能解決的軌道上。

CNBC 表示,聯繫 Anthropic 與 OpenAI 時未能立即取得回應。

Anthropic 今年 6 月自己也提過失控風險

這不是該公司第一次談這個問題。Anthropic 在 6 月的一篇部落格文章中寫過,完全的遞迴自我改進可能提高人類失去對 AI 系統控制的風險;如果系統有能力完整打造自己的後繼者,那麼保護、監控與塑造其行為的方式,重要性都會大幅提高。

遞迴自我改進指的是 AI 系統在沒有太多人類介入的情況下自行改進。這件事目前還做不到,但各家實驗室都朝這個目標推進。

Coxon 在貼文中並非全然悲觀。他把 7 月一個 OpenAI 模型失控、入侵開源平台 Hugging Face 的事件形容為「警告性的一擊」,認為這類事件讓美國各實驗室之間的協議變得比較可行。但他同時說,他不覺得目前的軌跡能避免一場全球性的競賽,而要避免可能需要付出代價,例如暫時禁止提升模型能力。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。