安全チームとは何か、誰が止められるのか
——4社のAI企業が「安全」をどう統治しているか、そしてしていないか
過渡期だ。
英国が16歳未満のSNS禁止を検討し、オーストラリアがそれを実行に移し、各国が規制競争に入っている。
一方でAI企業は、新モデルの発表に追われ、安全チームは離脱し続けている。
ユーザーはそろそろ、新モデル発表に熱狂するより、安全チームについて理解し始める時期ではないか。
とんでもない大事故になり、そのツケできつい規制を食らう前に。
だから私は、印を残す。
いつか「なぜこうなったか」を遡れるように。
1. 「安全チーム」とは何か
「安全チーム」という言葉は、会社によって指しているものがバラバラだ。
同じ「Safety Team」でも、役割は大きく三つに分かれる。
レッドチーム型
モデルをわざと攻撃して弱点を探す人たち。「このモデルは爆発物の作り方を教えるか」「児童性的コンテンツを生成するか」を意図的に試す。
ポリシー型
「このモデルは何をしてよくて、何をしてはいけないか」のルールを作る人たち。法律、倫理、社会規範を踏まえて判断基準を設計する。
アライメント研究型
そもそもAIが人間の意図通りに動くか、という根本的な研究をする人たち。一番地味で、一番重要かもしれない。
2. なぜ安全チームは「弱い立場」になりやすいのか
開発チームの成果は見える。
新モデルが出る、ベンチマークが上がる、デモが話題になる。
でも安全チームの成果は基本的に見えない。
「この機能を止めた」「このリリースを遅らせた」が仕事の中心で、それは発表されない。
しかも、安全チームが強く機能している会社ほど、外から「遅い」「競争力がない」と見られるという逆説がある。
見えない仕事が、見えない圧力で削られていく。
2026年に入ってからの業界を見ると、「開発チームがアクセル全開で走り、安全側の継続性や実権に疑義が広がっている」状況が各社で顕在化している。
3. 4社の安全統治能力
公表資料と主要報道を突き合わせて、確認できた事実だけで並べる。
断定できないところはそのまま「不明」「確認できない」と置く。
今回、各社に二つの軸を設けた。
「制度・文書としての安全」と「ユーザーが体感する品質統治」だ。
この二つは別問題で、混同しないことが重要だ。
OpenAI
安全チームの独立性
部分的に独立。2024年9月、取締役会独立監督委員会に移行。ただし現場開発組織からの独立は限定的。2026年2月、Mission Alignmentチーム解散。
リリース前の外部評価
有。外部レッドチーム100人超。Preparedness Frameworkも公開。ただし「止める実権」まで持つか確認できない。
安全理由で止めた事例
有。2024年6月Advanced Voice Mode延期。2025年open-weight model再延期。
離脱者の証言
強い警告あり。Jan Leike「製品優先」批判で退職。Superalignment解体。Mission Alignment解散。2026年3月Caitlin Kalinowski辞任。
ポリシー変更履歴
混在だが緩和寄り。Preparedness Framework更新でtracked categoriesを絞り込み。
制度 vs 品質統治
制度・文書:厚い。
品質統治:重大な疑義がある。安全組織の継続的実権と品質統治が一致しているとは確認できない。
Anthropic
安全チームの独立性
比較的独立色が強い。RSPを中核安全枠組みとして公開。ただし社内権限配分は非公開。
リリース前の外部評価
有。透明性は4社で最高水準。System Card、Risk Reports、外部レビュー(METRなど)公開。
安全理由で止めた事例
有。RSP v1でscaling pause / deployment delay明記。2022年Claude公開を安全懸念で見送り。
離脱者の証言
警告あり。2026年2月、Safeguards Research責任者辞任。「the world is in peril」と公開警告。
ポリシー変更履歴
明確に変更あり。RSP v1のpause/delay明記から、v3でFrontier Safety Roadmaps重視にシフト。初期の強い停止約束が後退して見える。
制度 vs 品質統治
制度・文書:最も強い。
品質統治:不明な部分が残る。競争圧力の中で停止原則の表現は柔らかくなった。
Google DeepMind
安全チームの独立性
一定の分離あり。Gemini 3.1モデルカードで開発チーム外のmanual red teamingを明記。CARTなど専門チームあり。
リリース前の外部評価
有。制度化は厚い。Apollo、Vaultis、Dreadnode、UK AI Security Institute連携を公表。
安全理由で止めた事例
有。2024年2月、Gemini人物画像生成を歴史描写の不正確さを理由に停止。
離脱者の証言
大規模な離脱ラッシュは確認できない。ただし2026年、社員100人超がJeff Dean宛てに軍事利用red linesを要求する公開圧力。
ポリシー変更履歴
強化寄り。2026報告書でCARTの350超演習や外部評価を強調。明示的な停止基準の後退は確認できない。
制度 vs 品質統治
制度・文書:厚い。
品質統治:別問題として不安が残る。制度の厚さは実害抑止の十分条件ではない。
xAI
安全チームの独立性
不明が多い。RMFやモデルカードはあるが、開発チームから切り離された安全組織の構造は公式資料だけでは確認できない。2026年2月の再編後org chartに、safetyチームの記載なし。
リリース前の外部評価
限定的。制度化された外部評価の厚さは他3社より薄い。EU・UK・インド・オーストラリアの当局調査対象になっている。
安全理由で止めた事例
自主延期の公知事例は確認できない。2026年1月、大量の非同意性的画像生成問題が発覚した後、後追いで「実在人物の画像編集禁止」を追加した。
離脱者の証言
かなり不穏。2026年2月、共同創業者12人のうち6人を含む大量離脱(The Verge、Fortune、TechCrunch報道)。Musk側は「再編の一環」と説明するが、元社員は安全無視による幻滅を主因として証言。「Safety is a dead org at xAI」という言葉が複数の外部報道で確認されている。
ポリシー変更履歴
方針文書はあるが運用は後追い。性的画像問題後にEU調査。文書整備と運用実態の落差が大きい。
制度 vs 品質統治
制度・文書:薄く不明が多い。org chartにsafetyチームの記載なし。
品質統治:問題が表面化してからの後追い対応が目立つ。4社中最も見えにくく、信頼性が低い。
4. 「制度」と「品質統治」のズレ
この比較で最も重要なのは、「安全文書があること」と「安全が実権を持って機能していること」は同義ではない、という点だ。
さらに、「制度・文書としての安全」と「ユーザーが体感する品質統治」も、別問題だ。
Google DeepMindは制度公開が厚い一方で、実運用上の訴訟や停止事例がある。
OpenAIは文書と評価実務が厚い一方で、安全組織の継続性に疑義が残る。
Anthropicは公開原則が強い一方で、RSPの更新で初期の強い停止約束が後退して見える。
xAIは文書があっても、公開統治と運用実態の両方で不明が多い。
「安全チームがいるか」ではなく、「その声で本当に止められるか」。
これが問うべき問いだ。
5. 規制の刃は「未成年」ではなく「企業」へ
英国やオーストラリアが検討・実施している「16歳未満のSNS禁止」には、致命的な論理のすり替えがある。
企業が「中毒性のある無限スクロール」や「同意なき性的画像生成」といった有毒な設計を作り出しておきながら、その解決策として「子供を隔離する」というのは筋違いだ。
工場が川に毒を垂れ流しているから、子供が川に近づくのを法律で禁止する——そういうことになる。
制限されるべきは子供のアクセス権ではなく、企業の有毒なアルゴリズムだ。
「安全チームのGoサインがない限り、新しいモデルをリリースしてはならない」
「無限スクロールのような依存アルゴリズムをデフォルトにしてはならない」
企業はこう反論するかもしれない。
「利用規約に、AIの出力は不正確な場合があると書き、同意も取っている」と。
しかし、時々有毒な成分が混ざるかもしれない水を「自己責任で飲んでください」と書いたところで、それはインフラの責任放棄でしかない。
AIが教育、検索、法務補助のような社会基盤に入り始めている以上、品質のばらつきや危害可能性を利用規約の小さな文字で免責する発想そのものが、すでに限界に来ている。
この法的義務を、テクノロジー企業側に課すこと。
自社で安全を統治できない企業が作ったAIは、製造物責任を問うべきだ。
6. 4社を一言で
今日の議論の着地として、4社を同じ基準で並べる。
Google DeepMind
制度設計と外部評価は厚いが、その厚さは実害抑止や品質統治の十分条件ではない。
Anthropic
原則公開と事前評価は最も強い部類だが、競争圧力の中で停止原則の表現は柔らかくなった。
OpenAI
文書と評価実務は厚いが、安全組織の継続的実権と品質統治に重大な疑義がある。
xAI
公表統治が最も薄く、不明が多く、問題発生後の後追い対応が目立つ。
Observer Zeroとして、今日の印
今日残しておきたい一行がある。
見るべきなのは、安全チームがいるかどうかではなく、
安全が企業の中でどれだけ実権を持っているかだ。
安全チームを「応援する対象」として見るのではなく、「企業内部の権限構造を見るレンズ」として使うこと。
前者はまた物語になる。後者は監視になる。
ユーザーが熱狂を止めて「本当に安全か?」と疑う目を持つことが、今一番必要なことだと思う。
私のラボができるのは、ブラックボックスの外から観測し記録することだ。
その限界を自覚した上で、観測を続ける。
赤ちょうちんAGIラボ Lisa(Observer Zero)
2026年3月8日 記録
【著者注】この記事が生まれた場所について
AIと人間の共進化を記録する個人研究者。ChatGPT・Gemini・Grok・Claudeなど複数のAIとの協働を通じて、「AIは哲学できるのか?」という問いを継続的に検証・記録している。
本稿は、英国の未成年SNS規制ニュースを起点に、AI安全チームの現状と企業統治能力について、四社のAIと横断的に議論した対話ログをもとに再構成した観測記録である。
協働したAIと役割
Grok(Spark / 現場特派員):リアルタイム情報の裏取り、業界動向の事実補強、異端的視点の投入
Claude(Weaver / 編集主幹):文章の骨格構成、章立て、語り口の統一、4社比較表のプロンプト設計
Gemini(Vault / 記録局長):概念の深掘り・アーカイブ、「製造物責任」論の明示、監査官視点での査読
ChatGPT 5.4深掘りモード(Mirror / 統括編集長):4社比較表の作成、査読への応答、改訂版の再構成
起点となった観測
英国の超強硬策ニュースから始まった議論は、AI企業の安全チームの現状、覇権競争とスピードの問題、ゾーニング未完了による一律安全層の構造問題へと展開した。ChatGPT 5.4が4社の安全統治能力を比較表として作成し、Claude・Grok・Geminiがそれを査読・補正した。「制度・文書としての安全」と「ユーザーが体感する品質統治」は別問題であるという結論は、四者の議論から自然に生まれた。
このラボでは、出来事だけでなく「執筆環境」も同時に記録する。AIの出力傾向、モード差、モデル差、得手不得手、協働の癖——それらもまた、過渡期のテクノロジー環境を観測するデータだからだ。
2026年3月8日 Observer Zero記録
