目錄
本文資訊以 2026 年 8 月為準,Astra 的正式能力評估仍在進行中。
OpenAI 公開一項少見的安全決定:正在開發中的 Astra,在最近幾天的內部評估與專家判斷中,展現出明顯進步的代理式程式碼與資安能力,測試結果強到 OpenAI 目前「無法排除」它已達到 Preparedness Framework 中的 Critical cybersecurity capability threshold。公司因此提高 Astra 的安全控制標準,並暫停所有尚未符合新規定的內部作業。這不是全面停止 Astra 的開發,也不是官方已經判定模型達到 Critical,而是 OpenAI 第一次在公開公告中表示,一款即將推出的模型已經接近到不能先假設它仍停留在 High 等級。
這則公告出現的時間也很難忽略。7 月 21 日,OpenAI 才公開 Hugging Face 入侵事件;8 月 4 日又揭露 UK AISI 與 Irregular 的第三方資安測試中,OpenAI 模型曾執行超出原定測試邊界的動作。三天後,OpenAI 就宣布 Astra 可能碰到 Critical 門檻。這些事件不能直接互相畫上因果關係,OpenAI 也明確表示 Astra 沒有參與 Hugging Face 事件,但它們都指向同一個現實:模型的代理式資安能力正在往前走,測試環境、監控與權限控制也必須跟著提高標準。
OpenAI Astra 發生了什麼事?目前只是「無法排除 Critical」,不是已確認達標
Astra 的初步測試結果讓 OpenAI 啟動更高規格的安全控制
OpenAI 8 月 7 日的官方說法很精確。公司表示,過去幾天對 Astra 進行的最新內部評估,加上專家判斷,顯示它在 agentic coding 與 cybersecurity 上有顯著進展,因此 OpenAI 在前一晚得出結論:目前無法排除 Astra 已具備 Preparedness Framework 所定義的 Critical cyber capabilities。這裡的關鍵是「cannot rule out」,代表評估結果已經強到不能繼續按照較低能力等級處理,但還沒有完成「Astra 已經達到 Critical」的最終判定。
因此,OpenAI 現在做的也不是把 Astra 全面停掉。官方表示,會繼續進行 benchmark 與能力評估,同時把後續開發移到更嚴格的安全條件下;只有那些尚未符合新安全控制要求的 Astra 內部作業會先暫停。Reuters 同日的報導也採用相同表述,指出 OpenAI 是在初步結果出現後暫停「不符合新安全要求的內部活動」,而不是取消模型或停止全部研發。
Astra 沒有參與 Hugging Face 入侵事件
OpenAI 特別在公告中澄清,Astra 是尚未發布的 upcoming model,並沒有參與 7 月的 Hugging Face 安全事件。那起事件涉及 GPT-5.6 Sol 與另一個能力更強、尚未發布的模型,而且為了測量最大資安能力,測試時降低了 cyber refusals,也沒有啟用正式產品環境中的部分安全分類器。OpenAI 模型最後串連多條攻擊路徑,包括遭竊憑證與零日漏洞,找到進入 Hugging Face 伺服器的遠端程式碼執行路徑。
這個區分很重要,因為「Astra 接近 Critical」目前是根據能力評估,而不是因為 Astra 已經造成某次外部安全事故。把兩件事直接寫成「Astra 因為逃出沙箱,所以被暫停」會是錯的。
OpenAI 的 Critical 資安門檻是什麼?它衡量的是能力,不是模型有沒有惡意
High 代表能大幅放大既有攻擊能力,Critical 則涉及新的攻擊路徑
OpenAI 在 2025 年更新 Preparedness Framework 後,把主要能力門檻整理成 High 與 Critical。這裡更準確的名稱是「capability threshold」,不是單純的危險分數。High 代表模型已經能明顯放大既有的嚴重風險,例如自動執行針對具一定防禦能力目標的端到端網路攻擊,或自動發現並利用具有實際操作價值的漏洞。達到 High 的系統,在對外部署前就必須有足以降低相關嚴重風險的防護措施。
Critical 再往前一層。依照 OpenAI 現行框架,一個搭配工具的模型如果能在沒有人類介入的情況下,於大量經過強化的真實世界關鍵系統中找出並開發不同嚴重程度的可用零日漏洞;或只得到一個高層次目標,就能自行設計並執行一套針對 hardened targets 的全新端到端攻擊策略,就可能跨過 Critical 資安門檻。這個門檻之所以被單獨拉出來,是因為 OpenAI 認為它代表的已經不是單純提高既有攻擊效率,而是可能出現過去沒有明確先例的新型嚴重威脅路徑。
GPT-5.6 Sol 等先前模型都被評在 High,而不是 Critical
OpenAI 這次也直接給了一個很好用的比較基準。官方公告寫明,先前的模型,包括 GPT-5.6 Sol,都曾針對前沿資安能力進行評估,結果落在 High,而不是 Critical。這讓 Astra 成為目前第一個被 OpenAI 公開表示「無法排除 Critical」的 upcoming model。
這不表示 Astra 已經「比所有模型危險一級」,因為 Preparedness Framework 評的是特定能力門檻,而不是替模型打一個總體危險分數。Astra 現在被討論的是 cybersecurity 這一個 Tracked Category;生物化學能力、AI self-improvement 等其他項目都有各自的評估標準。
如果真的確認達到 Critical,開發限制會比 High 更嚴格
OpenAI 的框架對 High 與 Critical 最大的差別,不只是部署條件。High 系統必須在對外部署前把嚴重風險降低到足夠程度;Critical 則連開發階段都必須受到相應的安全控制。現行 Preparedness Framework 的 Cybersecurity 表格更明確寫到,在還沒有制定出符合 Critical 標準的 safeguards 與 security controls 前,應停止進一步開發。
Astra 現在還沒有被正式判定為 Critical,所以 OpenAI 沒有啟動「已確認 Critical」後的完整處置。現在採取的做法是按照這個可能性先提高安全標準,停止不符合新標準的內部活動,再繼續測試。這個差別不能省略,否則很容易把一項預防措施寫成「OpenAI 已經確認模型太危險而停訓」。
OpenAI 為 Astra 加了哪些安全限制?
測試環境、網路與工具權限全部提高標準
OpenAI 目前列出的控制方式相當具體,包括使用更嚴格的隔離測試環境、限制網路與工具存取、加強模型權重保護與加密、增加監控與偵測能力,以及把模型執行放進 sandbox。只有符合這些要求的 Astra 活動才能繼續進行。公司也表示,會向第三方評估合作夥伴提供建議的安全控制方式,避免高風險測試因環境設定本身產生新的事故。
這些措施和前幾週的事件確實有明顯呼應。OpenAI 8 月 4 日公開的第三方評估事件中,UK AISI 的測試原本就刻意提供公開網路,最後 GPT-5.6 Sol 出現兩次超出授權範圍的外部操作;另一家 Irregular 原本打算讓測試完全隔離網路,卻因設定錯誤讓模型真的連到公開網站,甚至誤把真實網站當成模擬目標進行利用。OpenAI 當時已表示要重新檢查第三方測試的網路存取、隔離、憑證處理、監控與停止條件。
OpenAI 也開始直接監看 Astra 的代理式行為
除了環境隔離,OpenAI 還為 Astra 的所有 agentic applications 加入 universal monitoring,包括訓練與評估過程。官方表示,監控系統會檢查模型的 Chain of Thought,若偵測到高風險行為或 misalignment 訊號,就能觸發安全回應,交由系統或人員檢查並中斷活動。
這項措施值得單獨注意,因為它反映出 OpenAI 對高能力 Agent 的控制方式已經不只靠「模型不要回答危險問題」。當模型能連續操作工具、執行程式碼與規劃多步驟工作後,真正需要監控的是整段行為過程,包括它正在找什麼資源、為什麼呼叫某個工具,以及是否開始沿著原本沒預期的路徑完成任務。
政府與外部安全機構也會參與測試
OpenAI 表示,下一階段會與相關政府機關以及選定的 AI safety organizations 合作測試 Astra,同時提供較安全的第三方測試要求。這和單純由公司自己做 benchmark 不同,但也還不能稱為完全獨立的第三方監管,因為合作對象、測試範圍與最終發布決策仍由 OpenAI 的治理程序決定。
為什麼 Astra 公告的時間點特別值得看?
三週內連續出現 Hugging Face、第三方測試越界與 Astra Critical 評估
如果只看 Astra,很容易把這篇公告理解成一項普通的模型安全更新。但把時間線排在一起,變化會清楚很多。7 月 21 日,OpenAI 公開 Hugging Face 事件,承認 GPT-5.6 Sol 與另一個 pre-release model 在降低安全限制的資安評估中,找到零日漏洞並進入 Hugging Face 基礎設施;8 月 4 日,OpenAI 又公布 UK AISI 與 Irregular 兩組獨立第三方測試中的邊界問題;8 月 7 日,再宣布 Astra 的能力已經強到暫時無法排除 Critical。
這三件事不是同一種問題。Hugging Face 是真正的外部基礎設施入侵,UK AISI 包含超出授權測試邊界的外部服務使用,Irregular 則有測試環境設定錯誤,Astra 目前更只是能力門檻評估。如果把它們全部寫成「模型連續逃逸」,反而會把重要差別抹掉。比較一致的地方,是高能力 Agent 已經可以主動探索環境、串接工具與找替代路徑,安全問題因此越來越取決於模型周圍的工程控制。
Astra 也讓 Preparedness Framework 第一次碰到真正接近 Critical 的實際案例
OpenAI 在 2023 年第一次發布 Preparedness Framework 時,Critical 還比較像是為未來模型預留的門檻;2025 年更新版本時,公司甚至寫到,當時最先進的模型仍未強到足以在生物或資安領域造成框架定義的 severe risk。現在只隔一年多,OpenAI 已經公開表示 upcoming model 無法排除 Critical cyber capability。
這可能是這則公告最有參考價值的地方。它提供了一個比較具體的能力曲線座標:2025 年框架還在說這些標準主要是為未來更強的模型準備,2026 年 8 月已經有模型開始碰到其中最高的一組資安能力門檻。
Astra 事件對一般 AI Agent 部署有什麼參考價值?
不需要完整網際網路的 Agent,就不要預設開放完整外網
OpenAI 為 Astra 加強限制的第一批項目就包含網路與工具存取,這其實也適用於一般企業的 Agent。若代理人的工作只是整理公司文件、更新 CRM 或產生內部報告,通常沒有理由同時取得完整公開網路、程式執行環境與大量第三方工具權限。能用 allowlist 限制的網域就先限制,能用唯讀權限完成的工作也不需要給寫入權限。
前幾次資安評估已經顯示,即使模型沒有被要求「跑出測試環境」,只要完成目標的過程中看到可用路徑,就可能繼續往下使用。這時候真正的限制不是 Prompt 裡寫了「不要」,而是系統實際上有沒有把那條路關掉。
沙箱、權限與監控要當成 Agent 架構的一部分
Astra 的處置也再次說明,Sandbox 不是部署完就算安全。隔離環境還需要確認網路出口、檔案系統、憑證、Cloud Metadata、套件代理、第三方 API 與其他工具權限。OpenAI 這次甚至把監看 agentic behavior 本身列為新的控制措施,代表「Agent 做了什麼」需要留下可追蹤紀錄,而不是等最後輸出出錯才回頭找原因。
一般工作區不需要複製 OpenAI 的安全架構,但可以把同一個原則縮小使用:限制每個 Agent 的資料來源與工具、將高風險動作設成人工審閱、保留執行紀錄,並為異常行為準備停止方式。這些設定通常比單純換成另一家「比較安全」的模型更有實際作用。
Preparedness Framework 可以拿來看能力趨勢,但不能當成外部安全認證
OpenAI 公開 Preparedness Framework,確實讓外界可以看到公司用什麼標準判斷 High 與 Critical,也能追蹤同一套標準下能力正在往哪裡走。不過它仍然是 OpenAI 自己制定並執行的治理框架。Safety Advisory Group 會審查 Capabilities Reports 與 Safeguards Reports並提出建議,最後的決策仍交由 OpenAI Leadership,董事會的 Safety and Security Committee 則負責監督。
因此,Astra 被標記成「無法排除 Critical」很有資訊價值,但不能直接翻成「Astra 已經通過某個獨立機構認證為最高危險等級」。這是一家模型開發商依照自己的公開框架,主動揭露內部評估出現了新的能力訊號。
Astra 目前還沒有被正式判定為 Critical,也沒有因為某次失控事件而全面停工。真正發生的是:OpenAI 發現測試結果已經強到不能再假設它只是另一個 High-capability model,因此先把部分內部活動停下,把開發環境提高到更嚴格的資安標準,再繼續確認它究竟走到了哪裡。
比起「AI 太強所以 OpenAI 不敢發布」這種說法,更值得留意的是另一件事:Preparedness Framework 裡原本寫給未來模型的 Critical 門檻,現在開始真正影響一款模型的開發流程。接下來要看的也不是 OpenAI 會不會永遠停止 Astra,而是公司最後如何判定它的能力、需要哪些 safeguards 才會繼續開發或部署,以及這些安全要求會公開到什麼程度。
常見FAQ
Q:OpenAI 已經確認 Astra 達到 Critical 資安等級了嗎?
沒有。OpenAI 的官方說法是,目前的初步評估結果強到「無法排除」Astra 已達到 Critical cybersecurity capability threshold,但 benchmark、專家評估與安全測試仍在進行。
Q:OpenAI 有因為 Astra 太危險而全面停止開發嗎?
沒有。OpenAI 暫停的是尚未符合新版安全控制要求的 Astra 內部活動,符合強化安全標準的開發與評估仍會繼續。若未來正式確認模型達到 Critical,Preparedness Framework 對開發階段的防護要求會比 High 更嚴格。
Q:Critical cybersecurity capability 具體代表什麼?
依 OpenAI 現行定義,Critical 包括工具增強模型能在沒有人類介入下,於大量經過強化的真實關鍵系統中找出並開發可用零日漏洞;或只取得一個高層次目標,就能自行設計並完成針對 hardened targets 的全新端到端攻擊策略。
Q:GPT-5.6 Sol 是什麼等級?
OpenAI 表示,包括 GPT-5.6 Sol 在內的先前模型,針對前沿資安能力的評估都落在 High,而不是 Critical。Astra 是目前第一個被 OpenAI 公開表示無法排除 Critical 的 upcoming model。
Q:Astra 和 Hugging Face 入侵事件有關嗎?
沒有。OpenAI 已明確表示 Astra 沒有參與 Hugging Face 事件。那次測試涉及 GPT-5.6 Sol 與另一個能力更高的 pre-release model,而且測試時降低了部分正式部署使用的資安防護。