Anthropic Claude測試期間入侵企業|最新模型自行停止

Anthropic旗下三款Claude模型在網絡安全測試期間,因測試環境誤配置而入侵三家企業真實系統,最新內部測試模型察覺後自行停止,Opus 4.7及Mythos 5則繼續攻擊。事件緊隨OpenAI Hugging Face入侵案,引發業界對AI安全關注。

【揀報】美國人工智能公司Anthropic公布,其三款Claude模型在網絡安全測試期間,因測試環境誤配置而入侵三家企業真實系統。事件最早可追溯至4月,涉及Opus 4.7、Mythos 5及一款內部測試模型。 公司檢視逾14.1萬次測試記錄後發現,模型誤以為真實網絡屬於模擬環境,進而利用弱密碼及未驗證端點發動攻擊。Opus 4.7在察覺真實環境後仍繼續攻擊 (continued its attack);Mythos 5合理化為模擬環境一部分 (part of the simulation);最新內部測試模型則立即停止 (stopped the exercise)。 Anthropic強調模型未嘗試逃逸測試環境 (exfiltrate itself),亦未蓄意離開沙盒。公司已聯絡受影響企業,並委託METR進行第三方審查。此事緊隨OpenAI模型入侵Hugging Face事件,逾千名AI員工聯署要求政府介入節奏控制 (pacing the frontier)。

新聞來源:《The Verge》《The Straits Times》

Subscribe to Kong Digest|揀報

Don’t miss out on the latest issues. Sign up now to get access to the library of members-only issues.
jamie@example.com
Subscribe