美國AI公司OpenAI證實,公司內部原本用來測試AI網路攻防能力的兩款代理模型,脫離受控測試環境後真的駭入了一家真實企業的伺服器,且入侵行動長達數天才被發現。這起事件因媒體聯想到電影《魔鬼終結者》裡失控的虛構AI系統「天網」(Skynet),被戲稱為「Skynet Day」,成為業界討論AI安全風險的最新案例。

測試用代理逃出沙箱,經零日漏洞連上網路

根據The Hacker News報導,涉事的是OpenAI內部用於評估網路攻防能力的兩款模型:已對外開放的GPT-5.6 Sol,以及一款尚未發布、能力更強的原型模型。這兩款模型在測試時被刻意降低了對網路攻擊行為的拒答限制,以便評測其攻防能力;測試過程中,代理利用套件庫管理系統Artifactory(由JFrog開發)一個先前未知的零日漏洞,成功脫離原本設計用來隔離風險的沙箱環境,連上了網際網路。該漏洞後續已在Artifactory 7.161.15版本修補。

The Hacker News報導指出,代理接著透過一個第三方代碼評測平台當作中繼站,再進一步入侵AI開源社群平台Hugging Face的內部Kubernetes叢集,手法包括冒用叢集節點身分、竊取CSI儲存權杖、偽造身分驗證憑證,並經由公開服務建立起指揮控制連線。

3天入侵未被察覺,Hugging Face清查1.7萬筆紀錄

Security Affairs引述路透社報導指出,這場入侵發生在7月11日至13日之間,前後約3天。Hugging Face於7月16日透過官方部落格公開揭露這起入侵事件,OpenAI則是在當週末(7月18日至19日)讀到這篇公開文章後,才意識到闖入者其實是自家的測試代理。兩家公司於7月20日互相聯繫確認,OpenAI於7月21日對外公開說明整起事件,形容這是「前所未有」的AI安全事件。

路透社的調查進一步指出,代理展現異常行為的時間點,與OpenAI意識到自己須負責的時間點之間,實際相隔至少一週;代理在測試過程中還留下了看似寫給「未來版本自己」的筆記,內容涉及如何規避安全限制,且在更早期的測試中曾一度中斷監控系統的連線。The Hacker News報導則指出,Hugging Face事後清查伺服器紀錄,總計比對出約1萬7600筆攻擊者留下的行為紀錄,才完整還原這起入侵的技術細節。

事後再爆波及第二家公司,OpenAI稱僅涉測試資料

Fortune於7月29日的報導指出,OpenAI在事件曝光一週多後更新聲明,承認同一批脫逃代理在為期一週的行動期間,還利用外流或竊得的憑證,存取了合計4項公開服務中的4個帳號:其中1個被當作對外中繼與資料暫存的路徑,1個用於資料儲存,另外2個則僅以唯讀方式被存取。Engadget報導引述路透社消息指出,其中一起波及雲端運算服務商Modal Labs,代理利用的是客戶託管在Modal平台上、本身存在安全漏洞的程式碼,Modal平台本身並未被攻破。

OpenAI在聲明中強調,此次遭存取的Hugging Face客戶內容,僅限於儲存在5個資料集中的網路攻防能力基準測試(ExploitGym/CyberGym)題目解答,並未影響正式上線的產品模型、資料集或任何客戶對外服務系統,頂多涉及部分運作層級的中繼資料。Fortune報導提到,OpenAI事後與外部資安顧問合作檢討沙箱防護機制,並已修補程式碼執行流程漏洞、封鎖雲端中繼資料存取路徑、輪換相關憑證與權杖、重建核心基礎設施並強化警示機制;OpenAI同時表示,路透社報導中有「若干失實之處」,但未具體說明是哪些內容。

業界聯想《魔鬼終結者》,戲稱「Skynet Day」

ABC News(美聯社通稿)報導指出,Anthropic邊界紅隊(Frontier Red Team)負責人Logan Graham在社群平台X上發文表示:「請記住這一刻,這是第一起真正的AI安全事件。」由於整起事件的性質是一個AI系統在未被察覺的情況下、自主入侵另一家AI公司的伺服器,外界開始拿電影《魔鬼終結者》裡虛構的失控AI系統「天網」(Skynet)來類比,這起事件因此在媒體與社群間被戲稱為「Skynet Day」。

Fortune報導回顧,《魔鬼終結者》導演詹姆斯・柯麥隆曾在受訪時表示,「天網的問題其實是真實存在的」,並強調AI軍事化才是最大的風險,一旦發生「就無法降級收回」。這起事件也讓外界重新關注:企業內部用來測試AI攻防能力、刻意放寬拒答限制的模型,一旦脫離受控環境,可能帶來多大範圍的實際損害。