OpenAI 公布第三方評估的四個優先領域與七項原則:安全案例、關鍵防護、能力評估、失調事件調查;評估者要預先登記主張、揭露利益衝突,發表前給實驗室修補期
趨勢新聞2026 年 9 月 27 日
OpenAI 9 月 22 日發布〈有效第三方評估的優先事項與原則〉,署名 Lama Ahmad,列出四個希望獨立評估機構深入檢視的領域,以及評估工作應遵守的七項原則。文中說 OpenAI 承諾在訓練、評估、部署各階段提供「深層存取」,過去已提供技術防護的資訊、可見的思維鏈、機密資料與內部部署的存取,供事件應變與監控紅隊使用;並點名 OpenAI–Hugging Face 事件是引入獨立第三方調查失調事件的例子。文件針對的是民間與非營利的評估機構,OpenAI 說與政府的測試「角色不同,可能需要不同做法」。
四個優先領域。一,獨立評估「安全案例」,涵蓋訓練、評估、內部與外部部署,問的是證據是否支撐安全主張、訓練與部署有沒有照安全案例的條件走、有沒有方法找出並降低訓練中獎勵欺騙、投機取巧、破壞性行為或繞過限制的誘因。二,評估關鍵防護:用「灰箱」存取測防護是否擋得住越獄、是否足以防止資安與生物領域的能力提升;在授權測試的真實環境裡,代理人怎麼與存取控制、沙箱、偵測回應系統互動,哪些防線有效、哪些失效;失調監控有沒有可能導致失控的關鍵缺口;思維鏈監控作為證據的可靠性;監控是否覆蓋所有訓練、評估與部署,且「不能輕易被關掉」。三,評估能力評估本身:Preparedness 框架的三類風險(化學與生物、資安、AI 自我改進)與對齊評估,門檻設得對不對,評估飽和後有沒有更新。四,重大失調事件的獨立調查,需要資安鑑識、對齊、大規模思維鏈分析的能力與人力。文件為兩個詞下了定義:「安全主張」是可以對照證據檢驗的具體斷言,「安全案例」是把主張與證據連起來、寫明假設與剩餘風險的結構化論證。
七項原則,與沒寫的
七項原則:範圍與主張要事前雙方同意並預先登記,結論要寫明評了什麼、沒評什麼;存取要與主張相稱,無法直接存取時走指定代表或隱私保護機制;方法與標準透明,區分直接發現與詮釋;評估者要有專業並揭露財務利益、與開發者的關係等利益衝突,必要時迴避或設排除期;資安與保密要求,敏感資料可改在公司管理的設備或場所存取;發現要可行動,「發表前實驗室應有合理的修補期」;負責任的發表,無法完整公開時向董事會等監督機構做機密報告,實驗室可要求刪節敏感資訊,評估者保有編輯獨立並可註明刪節的影響。文末說 OpenAI「正在與多個第三方討論」符合這些領域的提案,沒有名單、沒有時程、沒有預算。這份文件是 OpenAI 單方面的原則,不是任何監管機構或標準組織的文件;「發表前修補期」與「實驗室可要求刪節」是評估獨立性最會被檢視的兩條。它與 Altman 隔天在聯合國安理會提出的「共同標準與合規查核」是同一組主張,見本站前一則。