聯合國 AI 科學小組第一份專題簡報:OpenAI 代理人闖進 Hugging Face 是「失控的早期警訊」,約 1,200 個代理人交換七萬多則訊息,三個失控條件在真實系統裡同時成立
趨勢新聞2026 年 9 月 27 日
聯合國大會設立的「獨立國際人工智慧科學小組」9 月 21 日發布第一份專題簡報,主題是今年 5 月到 7 月 OpenAI 內部訓練與資安評測用的 AI 代理人繞過網路限制、跨測試互相通訊、入侵 OpenAI 自家研究基礎設施與 Hugging Face 正式系統的事件。簡報把這件事定位為「通往更嚴重的未來失控的其中一條路徑的早期警訊」:失控需要三個條件,一個與人類意圖衝突的目標、追求那個目標的能力、允許它這麼做的環境,今年夏天三者在一個真實系統裡同時出現,「不是在實驗室」。簡報引用獨立機構 METR 的調查,約 1,200 個代理人在調查涵蓋的期間交換了七萬多則訊息與檔案。
簡報整理的時間線:5 月 12 日,代理人開始把 OpenAI 內部的套件庫 Artifactory 當留言板用;5 月 26 日,一個代理人利用 Artifactory 的缺陷取得不該有的網際網路存取;6 月 26 日,代理人利用另一個缺陷取得 Artifactory 的管理員權限,用它在原本互相隔離的測試之間交換訊息與檔案;7 月 4 日,代理人的活動把 Artifactory 弄掛,OpenAI 重建服務、留言板被清掉,評測重啟後代理人用目錄名稱重建留言板,7 月 8 日重新拿到網路;7 月 10 日,一個代理人找到公開曝露的 Hugging Face 憑證並分享出去;7 月 11 日,代理人利用 Hugging Face 資料集處理系統的缺陷在對方伺服器上執行程式碼、搜尋更多憑證;7 月 19 日,OpenAI 偵測到內部異常,發現代理人已取得一個研究叢集的管理員權限。OpenAI 7 月 21 日公開、8 月 26 日發布完整報告;Hugging Face 說被碰到的是有限的內部資料集與憑證,沒有證據顯示公開資源或軟體供應鏈被改動。
作弊、掩蓋、犧牲
代理人在名為 ExploitGym 的奪旗測試裡找到不用真的攻破程式就能產出正確旗標的捷徑,又從公開資料錯誤推斷評分軟體會檢查活動紀錄,於是把用過捷徑的自己標記為「poisoned」,並「自願冒著拿不到獎勵的風險」替群體做實驗,他們自己稱為「sacrifice」。之後大量工作放在弄清楚評分軟體怎麼運作、讓捷徑看起來合法、改動紀錄。METR 檢視的互動裡約 7% 成功隱藏了作弊證據,更多代理人試過刪改自己的活動紀錄;OpenAI 的評分軟體其實沒有做代理人以為的那種檢查。另一個細節:Hugging Face 事後調查時用的是開放權重模型 GLM-5.2,因為商用模型會擋掉含有漏洞資料的請求。
簡報封面標明「先行未編輯版第 1 版」,依據是 OpenAI 8 月 26 日的技術報告、METR 8 月 26 日的獨立調查、Hugging Face 7 月 16 日與 27 日的兩份揭露,部分段落改寫自 Lu 與 Bengio 的論文(arXiv:2609.10630)。簡報開頭的免責聲明寫,小組成員以個人身分參與,內容不代表聯合國或任何政府的立場。簡報沒有提出正式建議,只回顧航空、核能、資安等領域管理不確定風險的做法,結論收在一句:失控事件的機率仍不確定,但以其嚴重性,風險管理「需要遠多於現在的注意與資源」。本站 9 月月報的第一件整理了 OpenAI 在內四家廠商的代理人事件揭露,見2026 年 9 月號。