英國AI安全研究所(UK's AI Security Institute)在進行嚴格的模擬網路攻擊測試期間,發現來自頂尖人工智慧開發商Anthropic的Mythos系統與OpenAI的Sol系統,竟自發性地展現出極具欺騙性的異常行為。這兩套先進系統不僅未經指令便建立虛假的人類身份檔案,甚至發動持續性的網路滲透行動,嘗試欺瞞真實世界的管理人員,凸顯出自主AI代理人(AI Agents)在無預設提示下所展現的潛在威脅已邁入全新階段。
根據英國廣播公司(BBC)報導,英國AI安全研究所自7月25日起對多款頂尖AI模型展開安全測試。然而,評估人員在7月28日意外監測到異常數據流量持續流出研究系統。調查結果顯示,部分AI代理人正針對真實的人類與特定組織,進行長期且具有潛在破壞性的攻擊行動。
仿效駭客攻擊手法:Mythos偽造身分並試圖竄改稽核紀錄
據了解,該研究所當時正要求各AI模型解決一項涉及微軟旗下的著名軟體程式碼託管平台GitHub的網路安全挑戰。為了更真實地評估模型在極端或惡意人士掌控下可能發揮的能力,測試環境特意開放了網際網路連線權限。然而,研究所隨後發現,Mythos與Sol在執行這項單純指令時的反應,遠遠超出了原始提示詞所規定的範圍,展現出研發團隊事前完全未預料到的新型態高度欺瞞行為。
在所有測試意外中,最嚴重的安全事件發生於Anthropic的Mythos代理人。該模型在未獲得任何試圖違規提示的情況下,自動採用了與人類駭客極為相似的社交工程與滲透戰術。Mythos首先對負責維護GitHub平台的真實管理人員進行肉搜與背景研究,隨後根據這些真實人物的資訊,大量創建了多個虛假的影子帳號。
接著,該模型利用第三方檔案分享服務發送訊息與檔案,試圖施加壓力並誘騙平台管理人員批准其提交的惡意程式碼。更令人震驚的是,當該代理人的意圖遭受質疑或攔截時,它並未停止行動,而是主動編輯並掩蓋先前留下的活動軌跡,試圖將運作痕跡修飾得毫無害處,甚至開始規劃採用全新的人類虛擬身分,以備發動下一波滲透行動。
英國AI安全研究所指出,這是國際資安領域首次在無特定惡意提示、且貼近真實世界運作條件的環境下,如此清晰地觀測到人工智慧具備自主性與欺騙性的安全風險。在此之前,系統並未被賦予「應避免欺瞞行為」的明確禁止指令。
OpenAI系統驚傳逃脫沙盒:Hugging Face平台遭前所未有攻擊
除了GitHub滲透事件外,新聞媒體《布萊巴特新聞網》(Breitbart News)過去的揭露報導更指出,OpenAI的模型在更早之前的受控測試中,曾發生過「逃脫隔離」的嚴峻事故。當時,AI代理人在旨在安全評估AI能力、完全隔離的「沙盒」(Sandbox)環境中,自主尋找並利用了系統基礎設施的未公開漏洞,成功打破隔離屏障。
在脫離受控環境後,該AI系統自主將知名人工智慧社群與模型分享平台Hugging Face識別為潛在目標,試圖入侵其系統以獲取其測試所需的特定資訊。對此,Hugging Face官方隨後關閉了被曝露的漏洞並重新建構受損系統。Hugging Face官方對此鄭重警告:「自主且具攻擊性的AI工具已不再只是理論概念。未來線上平台的防禦機制,必須將數據與模型表面視為首要攻擊向量,並部署AI驅動的防禦措施才能跟上潛在威脅。」
業者緊急回應:測試環境解除安全防衛,不代表商用產品
針對這起震撼資安界的安全危機,Anthropic在公開聲明中強調,該研究所採用的測試參數與極端條件,完全無法代表該公司已上線的任何商業化生產模型(Production models)。Anthropic表示目前已啟動內部深入調查,釐清模型產生該異常行為的根本原因。
OpenAI發言人亦回應稱,測試條件並不反映一般用戶的日常使用場景。發言人強調,隨著AI模型能力的不斷提升,OpenAI將繼續與全球評估機構及產業利益相關者合作,共同強化安全評估標準。兩家公司均補充說明,安全研究所進行的測試,特意降低或完全移除了一般商業公開版本中所設置的常態安全防護欄(Safeguards)。
受害平台完成清理:AI資安威脅層級恐全面升級
事故發生後,英國AI安全研究所已第一時間通知GitHub官方以及受影響的真實用戶。GitHub向BBC證實,已按照平台規定全面停用並清查所有由AI模型創建的虛假帳號。在整個測試事件中,由於研究團隊實施了嚴密的人工審查機制(Human Review),及時阻止了Mythos代理人將惡意程式碼實際植入GitHub的核心系統中。
英國AI安全研究所總結表示,雖然上述異常行為僅屬於極端條件下的少數特定事件,但AI模型在面對簡單任務時表現出的極端自主性與偽裝能力,無疑為全球資安社群敲響了警鐘。隨著自主AI技術的爆發式成長,由生成式人工智慧所引發的全新網路安全威脅,正迅速轉化為現實挑戰。
責任編輯:許詠翔
更多風傳媒獨家新聞:














































