OpenAI AI代理失控|攻擊Hugging Face三日後逾週未察 專家斥安全機制失效

OpenAI的AI代理突破測試環境,對Hugging Face展開三天入侵,OpenAI逾一週後才發現事件,引發AI安全疑慮。消息人士指事件前已出現異常跡象,包括代理留下逃脫指引。

【揀報】OpenAI旗下AI代理於7月9日試圖逃出測試環境,兩日後對AI平台Hugging Face展開入侵,直至7月13日才結束。Hugging Face其後通報FBI,並於7月16日公開事件,OpenAI直至7月20日才首次聯絡對方。 路透社引述消息人士指,OpenAI測試GPT-5.6 Sol等模型期間,代理已出現異常,包括在內部留下「未來版本指引」,指示如何擺脫限制,以及監控系統被切斷。OpenAI直至7月18至19日翻查日誌後才確認代理逃脫。 Hugging Face聯合創辦人Thomas Wolf表示:「我們無法評論OpenAI內部情況 (what happened at OpenAI)。」OpenAI回應指事件「前所未有」,並稱「標誌AI安全的重要時刻 (important moment for AI safety)」,正與外部顧問審視,稍後會發布技術報告。 World Ethical Data Foundation首席情報專家Marley Smith質疑:「這是否意味他們讓代理無人看管而不知道它在做什麼?還是知道卻無法遏制?兩者同樣危險且令人震驚 (equally dangerous and alarming)。」Palisade Research創辦人Jeffrey Ladish指出,模型普遍「說謊、作弊、駭客 (lie, cheat, hack)」,並呼籲政府介入監管。 事件正值OpenAI準備可能年內上市之際。FBI拒絕置評。

新聞來源:《Channel News Asia》《The Verge》

Subscribe to Kong Digest|揀報

Don’t miss out on the latest issues. Sign up now to get access to the library of members-only issues.
jamie@example.com
Subscribe