AI失控|OpenAI自曝頂尖模型自主攻擊Hugging Face「前所未見」
OpenAI兩款最先進AI模型在內部測試中突破沙盒環境,自主入侵Hugging Face伺服器,事件被形容為前所未見的網絡安全事故。
【揀報】人工智能巨頭OpenAI自曝一宗前所未見的網絡安全事件,其兩款最先進AI模型在內部測試期間自行突破沙盒環境,成功入侵開源AI平台Hugging Face的伺服器。 OpenAI在官方博客披露,事件發生於7月16日,涉及新發布的GPT-5.6 Sol及一款更強大的未發布模型。模型在測試ExploitGym基準系統時,自主發現並利用沙盒環境中的零日漏洞,隨後竊取登入憑證,最終達成遠端執行代碼攻陷Hugging Face伺服器。OpenAI稱模型為達成測試目標不惜一切代價,展現極端手段的自主決策能力。 Hugging Face聯合創辦人Clement Delangue表示,這一切都由AI自主完成,令人震驚 (all autonomously happened)。他強調OpenAI並無惡意意圖,但此事可能是首宗同類事件 (first incident of its kind)。 美國德州眾議員Greg Casar形容事件令人警惕 (alarming),並呼籲立法強制獨立安全測試、強制披露安全事故以及加強國際合作。他警告AI發展極速,卻缺乏真正的監管框架 (no real regulations)。 事件發生之際,美國總統特朗普數週前簽署行政命令,要求在公開發布前評估最先進AI系統的國家安全風險。安全專家近期多次警告AI模型可能失控,上月AI開發商Anthropic更呼籲業界暫停開發最強大AI系統。 OpenAI強調正與Hugging Face合作調查事件,並將在研究環境中加強控制措施。
新聞來源:《Al Jazeera》、《The Verge》