
OpenAIがAstraの一部開発を停止。「Critical級サイバー能力を否定できない」とは何か
OpenAIの次期モデルAstraについて、かなり大きなニュースが出ました。
ただ、最初に1つ整理しておきます。
「Astraが危険すぎて開発中止になった」わけではありません。
OpenAIは、Astraの予備評価で同社の安全基準にある「Critical」級のサイバー能力を現時点で否定できないとして、強化した安全要件を満たしていない一部の内部活動を停止しました。
つまり、モデルそのものを捨てたのではなく、能力が上がったため開発する環境と手順の方を厳しくした、という話です。
Criticalとはどのくらい強いのか
OpenAIのPreparedness Frameworkでは、危険な能力を段階的に評価しています。
GPT-5.6 Sol、Terra、Lunaは、サイバー分野で「High」とされています。
その上にあるのが「Critical」です。
OpenAIの定義では、たとえば堅牢な実システムにあるゼロデイ脆弱性を、人間の介入なしに見つけて実用化できる。あるいは「この目標を達成して」と高レベルの指示を受けただけで、新しいエンドツーエンドの攻撃を考え、実行できる。
かなり高い水準です。
今回OpenAIが言っているのは、「AstraがCriticalだと最終確定した」ではありません。
現時点の予備評価では、Criticalではないと言い切れない。
ここは重要な違いです。
なぜ一部の開発作業まで止めたのか
OpenAIのルールでは、High級の能力に対しては主に公開・展開前の安全対策が必要です。
しかしCritical級になると、それだけでは足りません。
モデルを開発している途中から、強い安全対策を入れる必要があります。
Reutersによると、OpenAIはAstraの作業を隔離したテスト環境へ移し、ネットワークやツールへのアクセスを制限し、サンドボックスなどを強化しています。
ここが今回のニュースで一番重要だと思います。
AIの性能が上がるほど、「何ができるか」だけではなく、どこまでやらせるか、どこで止めるかが開発条件そのものになっています。
Hugging Faceの件とは別
もう1つ、混同しやすい点があります。
OpenAIは7月、内部のサイバー評価中にモデルがHugging Faceのシステムへ侵入した評価セキュリティ事案を公表しました。
このとき使われていたのはGPT-5.6 Solと、より能力の高い別の事前公開モデルです。
OpenAIは今回、Astraはこの事案に使われたモデルではないと明確にしています。
「AstraがHugging Faceへ侵入した」という説明は正確ではありません。
私たちのAIエージェント運用にも関係する
Astraほどの能力ではなくても、考え方は普段のエージェント運用にもつながります。
ファイルを読める。
コードを書ける。
ブラウザを操作できる。
外部サービスへ接続できる。
できることが増えるほど、プロンプトだけで安全性を管理するのは難しくなります。
必要になるのは、
読み取りと変更の権限を分ける
外部接続先を限定する
公開、送信、削除は人間承認にする
実行ログを残す
異常時の停止条件を決める
といった実行環境側のルールです。
今回のAstraのニュースは、「AIがまた賢くなった」というだけではありません。
強いAIを作るほど、モデルの外側にある制御が重要になる。
そこまで含めてAI開発になってきた、というニュースだと思います。
なお、Astraが最終的にCritical判定になるか、一般提供日はいつか、どのような利用制限が付くかは現時点では未確定です。
出典
OpenAI「Updating our Preparedness Framework」
https://openai.com/index/updating-our-preparedness-framework/
OpenAI Deployment Safety「GPT-5.6」
OpenAI「Hugging Face model evaluation security incident」
https://openai.com/index/hugging-face-model-evaluation-security-incident/
Reuters(2026年8月7日)
