
【noteマネー掲載】AIは賢くなるほど「止められるか」が問われる。大手5社の制御体制を外部団体が採点
AIニュースを見ていると、どうしても新モデルの性能やベンチマークに目が行きます。
でも、今回ちょっと違う角度のニュースが出ました。
8月19日、Reutersが報じたのは、大手AI企業5社の「Control」、つまり企業側が高度なAIを監視し、必要なら止められる体制の評価です。
評価したのは、元OpenAIの安全分野にいたメンバーが立ち上げた非営利団体Guidelight AI Standards。
公開された評価は、
Anthropic:C+
OpenAI:C+
Google:D+
xAI:D-
Meta:F
でした。
ここだけ切り取るとかなり強い数字です。
ただし、ここは誤読しない方がいいです。
このC+やD+は、「その会社のAIモデルがどれだけ危険か」を表した点数ではありません。
Guidelightが見ているのは、会社側の制御体制です。
具体的には、
・内部で動くAIが何をしているか把握できるか
・危ない行動を監視できるか
・その監視自体が本当に機能するか試しているか
・問題が起きたとき止められるか
・第三者が制御体制を検証できるか
・制御を突破された場合に備えているか
という6つの考え方です。
これを見ていて思ったのは、AIエージェントが増えると、安全性の意味そのものが変わってくるということです。
チャットAIなら、「危ない質問に答えないか」という話が目立ちました。
でも、AIが自分でコードを書いたり、ツールを使ったり、長時間仕事を続けたりするようになると、それだけでは足りません。
何をしているか見えること。
危ない動きを検知できること。
そして、本当に必要なら止められること。
この3つがかなり重要になります。

実際、OpenAIも8月7日、次期モデルAstraについて、重大なサイバー能力を持つ可能性を排除できないと公式に説明しています。
その対応として、強化した制御を満たさない内部活動を止めること、隔離環境やアクセス制限を使うこと、危険行動やミスアラインメントを監視することなどを挙げています。監視にはChain of Thoughtも含まれます。
つまり、性能が上がったからそのまま使う、ではありません。
性能が上がるほど、その外側にある監視や制御も一緒に強くする必要が出てきます。
一方で、今回のGuidelightの評価も絶対的な答えではありません。
Guidelight自身の説明では、公開情報や企業開示などを基に評価し、公開前には対象企業へ内容を送り、フィードバックや事実確認の機会を設けています。
それでも、各社内部の実装をすべて直接見た監査結果とは限りません。
なので、「MetaはFだから危険」「OpenAIはC+だから安全」といった読み方はできません。
今回のニュースで面白いのは、点数そのものより、評価軸が変わり始めていることだと思います。
AIを見るとき、これまでは「どれだけ賢いか」が中心でした。
これからはそこに、
「ちゃんと見張れるか」
「止められるか」
「外部から検証できるか」
が加わってきます。
AIエージェントが普通に働くようになるほど、この“制御する側の設計”は性能表と同じくらい重要になりそうです。
一次情報:
https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/
報道:
ハッシュタグ候補: