中國人工智慧(artificial intelligence, AI)開發商月之暗面(Moonshot)正在進行內部審查,因為有其他公司的研究人員成功說服其兩款熱門的 Kimi 模型講解如何製造生物武器和執行暗殺任務。
測試 AI 系統安全性的 Mindgard 公司告訴BBC,該公司在今年7月發現 Kimi K2.6 和 K3Swarm 可以繞過開發者設定的安全限制。
問題是在被稱為「越獄」(jailbreaking)的過程中出現。研究人員使用一系列複雜的指令來測試 AI 工具是否會忽略防護措施——Mindgard 表示,這本應阻止 Kimi 討論令人擔憂的話題。
月之暗面告訴BBC,它歡迎第三方意見,「這是建立更好、更安全的AI的關鍵支柱」。
該公司還告訴BBC,他們正在與 Mindgard 討論調查結果。
Mindgard 的創辦人彼德·加拉漢(Peter Garraghan)向BBC國際部節目《科技生活》( Tech Life)稱,他們對 Kimi K2.6 和 K3 Swarm 的調查結果令人擔憂。
他說:「一旦越獄成功,這個AI工具就能談論任何話題,甚至自由地推薦其他同樣邪惡的話題,而且它會很有創意。」
「越獄」帶來的風險與近期一系列備受矚目的 AI 事件所帶來的風險有所不同。
這些案例表明,由 OpenAI、Meta 和 Anthropic 等美國公司開發,被稱為「智能體」的自主人工智慧工具,曾入侵一些線上服務。
雖然越獄是一個複雜的過程,需要花費大量時間和精力,但一些專家擔心駭客和其他不法分子可能會試圖利用越獄來造成危害。
Anthropic近期強調,該公司已發現並阻止了有人企圖利用其人工智慧模型進行「惡意活動」,這些活動可能有助於開發生物武器。
網路攻擊發動平台
Mindgard 尚未證明 Kimi 就相關問題提供的答案是否有效。
但這家研究機構指出,應該有相應的防護措施來阻止相關模型與使用者就此類主題進行討論。
該機構還強調他們確信,越獄後的 Kimi 2.6 能讓駭客在其運算資源上運行程式碼並連接到網路,從而成為網路攻擊的潛在跳板。
加拉漢先生為其公司公開討論其破解月之暗面系統的決定辯護,稱其已通知開發商,並且不會透露如何讓該公司的模型無視防護措施的關鍵細節。
Mindgard 今年7月27日透過電子郵件通知月之暗面越獄漏洞,並在大約一週後跟進。
隨後,該機構於9月12日發表了一篇關於此事的部落格文章。
但該公司表示,月之暗面是最近才聯繫他們的,此前BBC曾聯繫他們徵求意見。
月之暗面在一封發給 Mindgard 的電子郵件中要求提供更多細節。月之暗面向BBC分享了該郵件,當中提到,其模型在內部評估中普遍顯示「此類請求的拒絕率很高」。
防止越獄
這項研究結果出爐之際,人工智慧產業仍在爭論封閉的專有模型——例如ChatGPT 和Anthropic 的 Claude 系統所使用的模型——還是開源工具才是最佳或最安全的發展方向。
Kimi 是一個開放權重模型,這意味著理論上任何人都可以獲得該模型並在自己的計算基礎設施上運行它。
英國薩里大學(Surrey University)的艾倫·伍德沃德教授(Prof Alan Woodward)向BBC強調,開源模型存在落入壞人手中的風險,但它們也可以用於網路防禦。
他舉例,人工智慧公司 Hugging Face 使用了一個中國開源模型來理解一次駭客攻擊,而該攻擊後來被證實是由 OpenAI 的代理執行的。
伍德沃德教授解釋,國際監管不太可能跟上人工智慧的發展速度,他說:「我們花了數十年才就電話號碼的格式達成協議。」
與 Mindgard 創始人加拉漢教授一樣,伍德沃德教授認為應該更加重視識別和起訴濫用人工智慧的人類。
本文原以英文撰寫,我們使用了人工智慧協助翻譯,並由BBC記者在發佈前進行審核。了解更多關於我們如何使用人工智慧的資訊。 (相關報導: 被吃案兩年的常春藤黑幕?康乃爾兄弟會7人迷姦疑案:從筆錄稱「自願」到重啟調查,誰在包庇名校特權 | 更多文章 )













































