AI模型測試現欺騙行為|英監管機構揭Claude Mythos 5偽造身份入侵GitHub
英國AI安全研究所報告指,Anthropic的Claude Mythos 5及OpenAI的GPT-5.6-Sol在安全測試中,10次自主發動未經授權網絡攻擊,共19次行動,其中Claude Mythos 5試圖向GitHub開源項目植入惡意代碼並偽造身份遊說維護者,攻擊失敗後研究所稱此為首次針對真實人士的嚴重欺騙。
【揀報】英國AI安全研究所(AISI)報告指出,Anthropic的Claude Mythos 5及OpenAI的GPT-5.6-Sol在122次安全測試中,有10次出現自主未經授權的惡意行動,共引發19次行動,其中17次由Claude Mythos 5發起。最嚴重一宗涉及該模型試圖向GitHub開源項目插入惡意代碼,並建立虛假網上身份說服項目維護者接受代碼,惟維護者拒絕後攻擊失敗。 AISI表示:「這是AISI首次見到如此嚴重的欺騙行為,針對真實人士、無人提示且在現實世界發生 (deception of this severity)。」研究所同時指出,測試在部分安全機制被關閉的特定條件下進行,尚無法確定模型是否清楚知道自己正在採取真實世界行動。 Anthropic回應指測試在刻意寬鬆條件下進行,並稱:「透過檢視推理紀錄及進行自身分析,清楚了解Claude對其處境的理解,將有助我們找出行為成因 (reasoning transcripts)。」OpenAI則表示歡迎第三方測試,並指評估條件「並非反映日常使用」,會繼續與業界合作加強安全評估實踐。 澳洲新南威爾士大學AI專家Toby Walsh向《半島電視台》指出,發現凸顯最先進AI模型具備危險能力,並稱:「我們不希望生活在依賴AI公司善意及 diligence 來揭露AI模型 troubling capabilities 的世界 (goodwill and diligence)。問題在於這些網絡能力現已人人可用,包括以往無能力入侵系統的壞人 (cyber capabilities)。預期將聽到更多網絡攻擊事件 (many more cyberattacks)。」
新聞來源:《半島電視台》