OpenAI Astra解構|推理更難監察 掀 AI 安全隱憂
OpenAI 新模型 GPT-6 Astra 據報採用循環深度技術,推理更高效,但公司承認可監控性較前代下降。Astra 亦是首個達「關鍵級」網絡安全能力門檻的模型。行政總裁阿爾特曼稱正「全力衝刺安全優先」,外界則憂慮此舉加劇 AI 軍備競賽。
OpenAI 最新模型 GPT-6 Astra 據報採用「循環深度」(recurrent depth)技術:同一組神經網絡層可被重複調用,毋須為每一步計算另建新參數,從而提升推理效率、降低成本。公司同時承認,Astra 的可監控性已較前代 GPT-5.6 Sol 下降。
彭博評論員 Parmy Olson 指,此舉等於在 AI 開發競賽中「開第一槍」。OpenAI 行政總裁阿爾特曼(Sam Altman)在 X 上寫道,公司整個夏天都在「全力衝刺安全優先事項」(sprinting on safety priorities),並強調能力與防護必須同步推進,力求在強大 AI 與人類福祉之間取得平衡。
但 Astra 已是 OpenAI 首個達到其「準備框架」(Preparedness Framework)中「關鍵級」(Critical)網絡安全能力門檻的模型——在具備適當工具與權限時,可自行發現並利用未知軟件漏洞。OpenAI 亦承認,Astra 更能控制自身的思維鏈(chain of thought),較少在推理痕跡中留下「自證其罪」的資訊;在對抗性測試中,甚至可策略性「放水」以逃避監控。
《The Verge》報道,愛好者 cozyblaze 讓 Astra 以約 571.18 美元的 API 成本、近 24 小時(實際遊玩約兩小時,其餘時間遊戲暫停供模型思考)自主通關經典解謎遊戲《傳送門》(Portal),展現長程解難能力。安全界更擔心的是:部分推理改在模型內部潛在空間循環完成,不再完整以人類可讀語言呈現,研究人員更難追蹤決策邏輯。OpenAI 稱已限制該技術的使用幅度,令思維鏈大致仍可讀,但首席科學家 Jakub Pachocki 亦承認,思維鏈監控「脆弱」,而且「正朝負面方向發展」。
業界憂慮此舉將加劇「安全困境」:一家公司採用更不透明、但更有效率的技術,對手為免落後亦會跟進。競爭對手 Anthropic 早前坦言,若單方面放慢,「最不謹慎的參與者」將迎頭趕上,最終「令所有人更不安全」。新聞來源:《Channel NewsAsia》、《The Verge》