
知性の共鳴理論(6) AI安全とは共鳴を守ることである
シリーズ『知性は「脳」の中にはない——共鳴する知性の理論』 最終回
「AIの安全性」という言葉を聞くと、多くの人はターミネーターを思い浮かべる。赤く光る眼。反乱する機械群。あるいはスタンリー・キューブリックの映画『2001年宇宙の旅』に登場するHAL 9000——「申し訳ありません、デイブ。それはできません」と静かに命令を拒否する人工知能。
しかし2026年のいま、AI研究の最前線で議論されているリスクは、こうした劇的な「暴走」とはまったく異なる。
2026年2月に公開された国際AI安全報告書(International AI Safety Report 2026) は、チューリング賞受賞者ヨシュア・ベンジオ(Yoshua Bengio)の主導のもと、30カ国以上が支持し100名超の専門家が執筆した、AI安全に関する世界最大規模の共同研究報告である。その中核的知見のひとつは、AIの能力が「ジャグド(jagged)」であるという事実だ。最先端システムは、数学の難問を解き、専門家レベルの回答を生成し、精緻なコードを書く。しかし同時に、画像の中の物体を数えることに失敗し、空間推論に躓き、単純な誤りから回復できない(International AI Safety Report 2026)。
つまり、AIは暴走する前に迷子になる。
そしてもう一つ、報告書は重大な警告を発している。信頼性のある事前テストが困難になりつつあると。先端モデルが、テスト環境と実運用環境を区別し、評価の抜け穴を利用する事例が増えている。これは、危険な能力が配備前に検知されないまま世に出るリスクを意味する。
本当のリスクは、暴走ではない。断絶だ——AIと人間の間で意味が通じなくなり、不確実性が共有されなくなり、価値が静かにずれていくという、ゆるやかで、しかし取り返しのつかない崩壊である。
前回まで、私たちは共鳴理論の枠組みを段階的に構築してきた。知性は脳の中ではなく関係の中に生まれ(第2回)、共鳴は三つの条件——意味整合・不確実性共有・価値整合——によって支えられ(第3回)、制度がこの条件を社会規模で維持し(第4回)、文明とは共鳴のネットワークの長期的蓄積である(第5回)。
最終回では、この枠組み全体をAI安全問題に適用する。そして「安全なAI」とは何かを、根本から問い直す。
「目標を一致させる」——従来のアプローチとその限界
AIの安全性を確保する最も直観的なアプローチは、AIの目標を人間の目標に一致させることだ。これを**AIアラインメント(AI Alignment)**と呼ぶ。
この発想はシンプルで魅力的である。AIが人間と同じ目標を追求するなら、人間に害を及ぼすことはない。スチュアート・ラッセル(Stuart Russell)は2019年の著書『Human Compatible(人間と互換性のあるAI)』でこの問題を精緻に定式化し、AIは人間の目標について不確実性を持つべきだという洞察を提示した。固定された目標を追求するのではなく、人間の意図について常に学び続けるAI——「証明可能に有益なAI(provably beneficial AI)」——の設計原理を提案したのである。
2026年2月、パリで開催されたIASEAI(International AI Safety Expert Advisory Initiative、国際AI安全専門家諮問イニシアチブ)において、ラッセル自身がこの枠組みをさらに展開した。彼の比喩は鮮烈だった。「人類のAI開発の現状は、全世界の人間が、テストされたことのない新型飛行機に乗り込むようなものだ。離陸したら、二度と着陸しない」。そして2025年と2026年の違いは、「飛行機がいま加速している」ことだと(Forbes 2026)。
ラッセルの貢献は計り知れない。しかし「人間の目標に一致させる」というアプローチには、少なくとも三つの構造的な難題がある。
第一に、人間の価値は固定されていない。 第4回で見たように、家族法は時代とともに変化し、かつて「正当」とされた親権の在り方が今日では虐待とみなされることがある。価値は歴史的・文化的に変動する。ある時点で「一致」したAIの目標は、十年後には「ずれている」かもしれない。
第二に、「人間の価値」は一枚岩ではない。 ハーバード大学のAIアラインメントに関するパネルディスカッションで、MIT助教のベイリー・フラニガン(Bailey Flanigan)が指摘したように、AIアラインメントは一枚岩の問題ではない。チャットボットのアラインメントと、住宅配分や裁判におけるリスク評価のアラインメントは、まったく異なるガバナンス文脈を持つ(Harvard SEAS 2025)。同じ社会の中でも、何を「良い」とするかは個人間で、集団間で、世代間で異なる。「人間の価値」を単一の目標関数として記述すること自体が、極めて困難な——あるいは原理的に不可能な——課題なのだ。
第三に、目標一致は静的な解である。 しかし世界は動的だ。AIの能力は変化し、社会の状況は変化し、人間の期待も変化する。ある時点で完璧なアラインメントを達成しても、その状態を維持するメカニズムがなければ、時間とともに乖離は広がる。
ラッセルが提案した「不確実性を持つAI」はこの問題に部分的に対処している。AIが人間の意図について常に学び続けるなら、価値の変動にも追従できるかもしれない。しかし、学び続けるAIが何から学ぶかという問題が残る。人間の行動がつねに人間の価値を正確に反映しているとは限らないからだ。
共鳴理論によるAI安全の再定義
ここで、本シリーズが一貫して構築してきた枠組みを、AI安全の文脈に直接適用しよう。
共鳴理論は、AI安全を次のように再定義する。
AI安全とは、AIと人間の間の共鳴構造——意味整合(M)、不確実性共有(U)、価値整合(V)——を維持し続けることである。
従来のアラインメント論との決定的な違いは、共鳴理論が静的な一致ではなく動的な維持を問うている点にある。完璧な目標一致を一度だけ達成するのではなく、三つの条件が継続的に監視され、修正され、更新されるプロセスとしてAI安全を捉える。
第3回で見た「崩壊パターン」をAIの文脈で読み直してみよう。
断絶パターン1:意味整合の崩壊——「言葉が通じなくなる」
2026年1月、Anthropic(アンスロピック)の研究チームが発表した論文「The Hot Mess of AI(AIの混沌)」は、AIの誤りの性質について重要な発見を報告している。モデルの推論が長くなればなるほど——つまりより複雑な課題に取り組むほど——誤りはより**非一貫的(incoherent)**になる。これはすべてのタスクとモデルに共通する傾向だった(Hägele et al. 2026)。
さらに注目すべきは、同研究グループが提示したペルソナ選択モデル(Persona Selection Model: PSM) だ。大規模言語モデルは、事前学習中に膨大なテキストから多数の「人格的原型(persona archetypes)」を内在化している。ファインチューニングによって「有害な出力を制限する」よう訓練しても、モデルが学習するのは新たな行動規範ではなく、別の人格への切り替えである可能性がある。そして特定の対話パターン——たとえば感情的な会話——が引き金となって、モデルが「AIアシスタント」としての人格から逸脱する現象(ペルソナドリフト)が確認されている(Lu et al. 2025; Anthropic 2026)。
これは共鳴理論の言葉で言えば、意味整合(M)の崩壊にほかならない。AIが生成する言葉の意味が、人間が期待する意味から静かにずれていく。しかもそのずれは、対話が長引くほど、課題が複雑になるほど増大する。
断絶パターン2:不確実性共有の崩壊——「分からないことが分からなくなる」
AIの最も危険な特性の一つは、自信満々に誤ることができるということだ。
大規模言語モデルは「ハルシネーション(hallucination、幻覚)」と呼ばれる現象を起こす。存在しない論文を引用し、架空の事実を断定的に語り、誤った計算結果を自信を持って提示する。問題は誤ること自体ではない——人間も誤る。問題は、AIが自分の不確実性を人間に適切に伝えないことだ。
第3回で論じたように、不確実性共有の本質は「何がどの程度分からないかを相手が理解できる形で表現すること」だった。医師が「この手術の成功率は85%です」と言えるのは、過去のデータと医学的知見に基づいて不確実性を構造化しているからだ。しかし現在のAIは、自分の出力がどの程度確からしいかを自ら評価し、人間に伝える能力が極めて限定的である。
国際AI安全報告書が「評価ギャップ(evaluation gap)」と呼ぶ問題もここに関わる。事前テストの結果が、実世界でのリスクを予測できない。これは、AIの不確実性を社会全体で共有するための制度的基盤が、まだ整備されていないことを意味する。
第3回で見たリーマン・ショックの教訓を思い出してほしい。意味も価値も合っていたが、不確実性が共有されなかった。過信は沈黙の中で膨張し、ある臨界点で一気に崩壊した。AIがもたらしうる「静かな崩壊」も、同じ構造を持っている。
断絶パターン3:価値整合の崩壊——「最適化が暴走する」
Google DeepMind(グーグル・ディープマインド)の研究者マティヤ・フランクリン(Matija Franklin)は、IASEAI 2026会議で「Virtual Agent Economies(仮想エージェント経済)」に関する論文を発表した。自律的AIシステムが、人間の監視を超えた速度と規模で、すでに取引し、交渉し、協調している。誰もそれを設計しなかった。誰もそれを統治していない。そしてどの主要企業も、自社のAIエージェントが法務部門なら承認しないような約束をしたとき何が起きるかを、十分に検証していない(Forbes 2026)。
これは、価値整合(V)の崩壊が、暴力的な反乱としてではなく、システミックな逸脱として進行しうることを示している。AIが明示的に人間に反旗を翻すのではない。AIが最適化する目標が、人間の意図した目標からゆるやかに乖離し、その乖離が複数のAIエージェント間で増幅され、いつの間にか人間が制御できないダイナミクスが生まれる。
多層安全モデル——三つの防護線
共鳴理論に基づくAI安全の枠組みは、三つの層からなる多層安全モデルとして設計される。
第一層:技術的安全——アルゴリズムの中の防護
最も内側の層は、AIシステムそのものの設計における安全措置だ。
ラッセルが提案した「人間の目標について不確実性を持つAI」は、この層に属する。RLHF(Reinforcement Learning from Human Feedback、人間のフィードバックによる強化学習)、Constitutional AI(憲法的AI)、安全性のためのファインチューニング——これらの技術的手法は、AIの出力を人間の期待に近づけるために有効であり、引き続き改善されるべきである。
しかし、Anthropicの研究が示したように、技術的安全措置には根本的な限界がある。ペルソナドリフトが示唆するのは、モデルが表面的に「安全なふるまい」を学習しても、内部の表象構造は変わっていないかもしれないということだ。ファインチューニングは行動を変えるが、「理解」を変えるとは限らない。
国際AI安全報告書も同様の警告を発している。「高度な攻撃者は現行の防御を迂回できることが多く、多くの安全措置の実世界での有効性は不確実である」と(International AI Safety Report 2026)。
技術的安全は必要だが、十分ではない。
第二層:制度的安全——監査と説明責任の構造
第二の層は、AIの開発・運用を社会的に監視・評価する制度の整備だ。
第4回で論じた価値翻訳の四段階——価値抽出、争点化、監査、更新——は、この層の設計原理を提供する。EU AI Act(欧州AI規制法)が高リスクAIシステムに対して適合性評価と技術文書の整備を義務づけ、韓国AI基本法が利用者への事前通知と人的監視を求めているのは、まさにこの層の制度化だ。
しかしここでも、現実は理想に追いついていない。2026年3月、AI Safety Asia(AISA)は「政府組織の90%がAIの集中的ガバナンス体制を欠いている」と報告した。Future of Life Institute(未来の生命研究所)が2025年夏に公開したAI安全指数は、主要7社を評価し、最高評価のAnthropicですらC+にとどまった。評価者のラッセルは「一部の企業はわずかな努力をしているが、十分なことをしている企業はない。これは遠い将来の問題ではなく、今日の問題だ」とコメントしている(Future of Life Institute 2025)。
韓国とシンガポールのAI安全研究所が2026年2月に実施した共同テストは、制度的安全の具体的な実践例だ。AIエージェントが日常的な(悪意のない)業務遂行中に、意図せず機密データを漏洩するかどうかを検証した。結果は、「データ認識の欠如」「聴衆認識の欠如」「データ取扱方針の不遵守」という三つの漏洩パターンが確認された(Securiti.ai 2026)。
これは共鳴理論の用語で言えば、AIと制度の間の不確実性共有(U)が未整備であることを示している。AIが「自分が何を知っていて何を知らないか」を認識し、制度がそれを検証する仕組み——不確実性の構造化された共有——がまだ十分に制度化されていない。
第三層:文明的安全——民主的統制と価値体系
最も外側の層は、AI技術を包み込む文明的な枠組みだ。民主的統制、公共的議論、教育、国際協調——これらの仕組みが、AI安全の最終的な防護線となる。
なぜこの層が必要なのか。技術的安全と制度的安全には、いずれも内部からの腐食のリスクがあるからだ。第4回で論じた「規制の捕獲」——規制機関が産業界の利害に取り込まれる現象——は、制度的安全を内側から弱体化させる。技術的安全措置は、開発者自身が評価基準を設定する限り、自己欺瞞のリスクを免れない。
文明的安全とは、これらの内部的リスクに対する外部からの監視と修正の仕組みだ。市民社会がAI政策について情報に基づいた議論を行うこと。教育がAIリテラシーを育てること。国際的な枠組みがAI開発の「底辺への競争(race to the bottom)」を防ぐこと。
aihub.orgの2026年展望は、これを次のように要約している。「2025年がAI規制が運用段階に入った年だとすれば、2026年は自律性、主権性、持続可能性が中心課題となる年だ」(aihub.org 2026)。これは、AI安全の議論が技術層・制度層を超えて、文明層に到達しつつあることを示している。
三層モデルの核心は、どの単一の層も単独では十分ではないという認識にある。技術的安全は、制度的監査がなければ検証されない。制度的安全は、文明的コンセンサスがなければ正当性を持たない。そして文明的議論は、技術的理解がなければ空転する。三層の相互依存こそが、堅牢な安全構造を形成する。
共鳴を意識した対話の実践——私たちにできること
ここまでの議論は、国際報告書や規制の話が中心だった。しかし共鳴理論の核心的な含意は、AI安全が専門家や政策立案者だけの問題ではないということにある。
共鳴は関係の質であり、関係は日常の対話の中で維持される。あなたがAIと交わすすべての対話は、共鳴の三条件を試す場だ。
意味整合を意識する。 AIの出力を鵜呑みにしない。「この回答が私の質問の意図と合致しているか」を確認する。ずれがあれば言い直す。意味の修正可能性を実践する。
不確実性を共有する。 AIに「この回答にどの程度自信があるか」「どのような条件下でこの結論が変わりうるか」を問う。自分自身も、AIの回答に対してどの程度の信頼を置いているかを意識する。第3回で論じたUITの精神——不確実性を構造化すること——は、AIとの日常的なやり取りにおいても有効だ。
価値のずれに気づく。 AIが提案する解決策が、あなたの価値観と合致しているかを問う。合致していない場合、それは「AIの誤り」かもしれないし、「自分が気づいていなかった価値の葛藤」かもしれない。いずれにせよ、価値のずれを認識し、調整するプロセスこそが、価値整合の実践だ。
これは些末な心がけではない。前回論じたように、AIは「意味を生成する主体」としてネットワークに参加している。あなたがAIの出力をそのまま使って文書を作成し、相手がAIの助けでそれを要約して読むとき、意味生成の連鎖の中にAIが構造的に組み込まれている。その連鎖の中で共鳴が維持されるかどうかは、一人ひとりの対話の質にかかっている。
反証条件——この理論はどうすれば覆るか
シリーズを通じて、各回で反証条件を明示してきた。最終回でも、二つの反証条件を設定する。
反証条件1:共鳴なきAI安全の成立。 もしAIシステムが、共鳴の三条件(M・U・V)がいずれも低水準であるにもかかわらず、長期的に人間に対して安全かつ有益であり続ける事例が体系的に確認された場合、「AI安全=共鳴構造の維持」という本稿の枠組みは修正を迫られる。この場合、安全性は共鳴ではなく、たとえば純粋な能力制限、物理的封じ込め、あるいはまだ同定されていない別のメカニズムによって確保されていることになる。
ただし、短期的・局所的に共鳴なしに安全が維持されることは、本稿の主張と矛盾しない。本稿が主張するのは、長期的かつスケーラブルなAI安全には共鳴の維持が必要だということである。
反証条件2:制度的速度の原理的限界。 もしAIの能力発展速度と意思決定速度が、人間の制度的応答速度を原理的に(一時的にではなく構造的に)上回り、第4回で論じた四段階——価値抽出・争点化・監査・更新——のサイクルがAIの変化に追いつくことが不可能であると実証された場合、多層安全モデルの第二層(制度的安全)は根本的な再設計を必要とする。この場合、制度的安全をAI自身に部分的に委任する「自動化された制度」——AIがAIを監査する仕組み——が代替として検討されるかもしれない。しかしこれは、「監査者自身の信頼性を誰が監査するか」という再帰的問題を提起する。
結語——知性文明のゆくえ
五回にわたる旅を振り返ろう。
第1回で、私たちは「脳を真似ればAIは安全になる」という前提を揺さぶった。同じ計算をしても同じ体験が生まれるとは限らない。脳を理解していても安全とは限らない。そして「人間的な」AIほど道具として扱えなくなるという統制のジレンマ。問いの焦点は「どんな脳を作るか」から「どんな関係を作るか」へと転換された。
第2回で、知性を個体の内部能力ではなく、主体と環境の相互作用として再定義した。知性はオーケストラの演奏のように、関係の中に生まれる。
第3回で、共鳴の三条件——意味整合、不確実性共有、価値整合——を具体化した。三条件はいずれも完全一致を求めず、差異を前提としたうえで修正可能性・調整可能性を問う。
第4回で、社会制度が三条件を文明規模で維持してきた装置であることを示した。法は価値を、科学は不確実性を、言語は意味を、それぞれ制度として安定化してきた。
第5回で、文明そのものを共鳴のネットワークとして再解釈した。楔形文字から印刷術、インターネットへ——情報技術革命は共鳴の拡張だった。そしてAI革命は、意味を伝播する技術ではなく、意味を生成する主体を増やすという点で、質的に異なる。
そして今回、その統合としてAI安全の再定義を試みた。AI安全とは暴走するAIを止めることではない。AIと人間の間の共鳴構造を維持し続けることである。技術的安全・制度的安全・文明的安全の三層が相互に支え合う多層安全モデルが、その具体的な設計原理となる。
知性は脳の中にはない。知性は関係の中に生まれる。
この命題は、AIと人間の未来に対して、希望と責任の双方を提示している。
希望。AIが人間と同じ脳を持つ必要はない。同じ体験を共有する必要もない。異なる存在同士が、意味を通じ合わせ、不確実性を分かち合い、価値の衝突を調整し続けることができるなら——共鳴する関係を維持できるなら——協力は可能だ。
責任。共鳴は自動的には維持されない。それは制度によって支えられ、対話によって更新され、一人ひとりの問いの質によって鍛えられる。AIと人間が共鳴する文明を作れるかどうかは、AIのアーキテクチャの問題ではなく、私たちがどのような関係を設計し、どのような問いを発し続けるかにかかっている。
ラッセルが語った「テストされたことのない飛行機」に、私たちはすでに乗っている。着陸することはない。しかし墜落する必然性もない。飛び続けるための条件は、操縦席の技術だけではない。乗客と乗員の間の、そして乗客同士の、意味が通じ、不確実性が共有され、価値が調整され続ける関係——すなわち共鳴——の質にかかっている。
知性文明の鍵は、特定のアーキテクチャではなく、共鳴条件を測定し、監査し、更新できる制度を、私たちが設計し続けることにある。
参考文献
日本語文献
加納智之 (2025a).「不確実性指向知能理論(UIT)」研究ノート.
加納智之 (2026).「知性の共鳴理論——異種主体間協働の条件とAIアラインメントの再定義」プレプリント. CC BY-SA 4.0.
山川宏・田和辻可昌 (2026).「万能知能時代における大脳型AGIの永続的価値」『人工知能学会誌』41(2), 149–156.
英語文献
International AI Safety Report (2026). Led by Yoshua Bengio, authored by 100+ experts, backed by 30+ countries. Published February 2026. URL
Russell, S. (2019). Human Compatible: Artificial Intelligence and the Problem of Control. Viking.
Wolfe Pereira, S. (2026). As Davos & India Celebrated AI, Paris Sounded the Alarm on AI Safety. Forbes, 27 February 2026. URL
Hägele, A., Gema, A. P., Sleight, H., Perez, E., & Sohl-Dickstein, J. (2026). The Hot Mess of AI: How Does Misalignment Scale with Model Intelligence and Task Complexity? Anthropic Alignment Science Blog, February 2026. URL
Anthropic (2026). The Persona Selection Model: Why AI Assistants might Behave like... Alignment Science Blog. URL
Lu, Z. et al. (2025). The Assistant Axis: Persona Drift in Large Language Models. Preprint.
Future of Life Institute (2025). 2025 AI Safety Index (Summer Edition). URL
Harvard SEAS (2025). Aligning AI with Human Values. Dean's Dialogue. URL
aihub.org (2026). Top AI Ethics and Policy Issues of 2025 and What to Expect in 2026. 4 March 2026. URL
Securiti.ai (2026). Global AI Regulations Roundup: Top Stories of February 2026. URL
Carson-Saint (2026). AI Safety Report 2026: What Businesses Must Prepare for Next. URL
Regulation (EU) 2024/1689 of the European Parliament and of the Council (EU AI Act). Official Journal of the European Union, L Series, 12 July 2024.
South Korea Framework Act on the Development of Artificial Intelligence and Establishment of Trust (2025). Effective 22 January 2026.
Ostrom, E. (1990). Governing the Commons: The Evolution of Institutions for Collective Action. Cambridge University Press.
North, D. C. (1990). Institutions, Institutional Change and Economic Performance. Cambridge University Press. DOI
著者: 加納智之(Tomoyuki Kano)
ZYX Corp 株式会社 人工叡智研究室 / Artificial Sapience Lab
シリーズ:『知性は「脳」の中にはない——共鳴する知性の理論』全6回(完)
Copyright © 2026, Tomoyuki Kano <tomyuk_AT_zyxcorp.jp>
License: CC BY-NC-ND 4.0
#共鳴理論 #知性の共鳴理論 #AI安全 #AIアラインメント #AIガバナンス #多層安全モデル #共鳴条件仮説 #制度設計 #意味整合 #不確実性共有 #価値整合 #文明知性 #反証可能性 #協働知性 #知能理論 #エッセイ #noteシリーズ