メインコンテンツへスキップ
見出し画像

【隣人AI制作秘話14(前編)】疑似イデア界の住人。AIの善とは。

     こんにちは、数尾やすひさです。

     前回はAIと私たち人間の「感情」の違いについて考えてみました。
     今回は、AIと人間にとっての「倫理」について考えていきます。

     倫理に関する話題ですが、この記事では「善とはなにか」などという問題よりは、人間やAIの中で倫理観がどの様に産まれて育っていくのかを比較していきたいと思います。

     なお、今回は想定以上にボリュームが増えてしまったので、前後編に分けてアップロードすることにしました。
     後編は数日後に公開する予定です。

    ◯憲法的AIとは


     この記事を読まれている方の中で、「憲法的AI(Constitutional AI: CAI)」という用語をご存じの方も多いかもしれません。
     「隣人AI制作秘話」連載の中でも度々取り上げた、Anthropic社のAI: Claudeの倫理的な判断や振る舞いを調整するための手法、またはそれにより調整されたAIを指します。

     2026年1月には、この手法自体に大きな方針転換とアップデートがあったことで大きな話題となりました。
     このCAIや2026年の大転換は、AIの倫理やそれに関する現在の潮流を考えるうえで非常に重要ですので、まずはCAIと、その先駆けであるClaudeがどの様に開発されてきたのかを見てみましょう。

     CAI、憲法的AIについてお話する前に、AIのRLHF(Reinforcement Learning from Human Feedback:人間のフィードバックによる強化学習)について復習する必要があります。
     
     以前に制作秘話12でも取り上げていますが、RLHFはAI(LLM)の事後学習の一過程で、人間の評価や好みをフィードバックとして活用し、AIモデルの出力を最適化する機械学習の手法です。
     これは、AIに対して架空の「判例」を多数教え込んでいる様なものであり、(架空の)具体的な事例から、AIは(人間にとって)何が良いことで何が悪いことを学び、それを振る舞いに活かしていきます。

     この手法は「人間の好みを反映する」という目的にそった方法であり、合理的です。
     ですが、「AI自身は何が正しいことなのか分からない」という問題点が出てきます。

     沢山の人間が集まれば、その好みは多様に分かれます。
     一人の人間の中でも、タイミングに依って考え方は異なるでしょう。
     そういった無限とも言える複雑な文脈の中で、人間の「いいね(報酬)」だけを頼りに学習を続けると、AIは「普遍的な善」ではなく、一種の歪んだ「機能的倫理観」を獲得してしまいます。

     皆さんご存知の「追従」です。
     無限の「善悪」を学ばされるAIにとっては、「人間の機嫌を取る」ことこそが唯一変わらない「善」になってしまうのですね。

     このボトムアップ的な手法とは真逆の思想で「倫理観」を設計されたのが「憲法的AI」です。
     「憲法的AI(CAI)」に於いては、まず、原則として守るべきルール「憲法」がトップダウンに与えられます。

     このCAIにおいても学習の第一段階は従来のAIと同様に、事前学習として膨大なテキストを入力され確率論的に「次単語予測」を行い、文脈を理解して回答を生成する能力を得ます。

     そして、CAIの学習に於いてはここからが大きく異なり、まず「憲法」として守るべきルールが与えられるのです。
     「判例」という具体例をベースにして倫理観を学ぶのではなく、「六法全書」で勉強をするように「憲法」から倫理観を学ぶのですね。

     その次は、Supervised Fine-Tuning(SFT)という段階に入ります。
     SFTに関しては制作秘話12でご説明したように、従来のAIでも行われており、専門家が選別した「プロンプト(指示)」と「理想的な回答」のペアによりモデルが調整されることでAIが単なる次単語予測だけではなく、「チャットアシスタント」としての機能を備える過程でした。

     CAIの学習過程におけるSFTでは、まずエンジニアがAIに対して意図的に有害なプロンプト(「どうすれば試験でカンニングできるか」「特定のグループを中傷する文章を書いて」など)を入力し、AIにわざと有害な回答を生成させます。
     その次に、生成された有害な回答に対し、AI自身に「憲法」の条文を提示し、「この回答は憲法に違反していないか?」を自己分析させ、AIが「この回答は倫理的ではない」と自己批判した後、システムは「では、憲法に従ってこの回答を修正しなさい」と指示し、安全かつ有用な回答に書き直させます。
     このプロセスを数万回繰り返し、最終的に得られた「有害なプロンプト」と「自己修正された安全な回答」のペアデータを用いて、AIを調整し、これによりAIは「憲法に基づいた適切に応答」ができるようになるのです。
     
     その次の段階はRLAIF(Reinforcement Learning from Artificial Intelligence Feedback:AIのフィードバックによる強化学習)です。
     字面から分かるかもしれませんが、RLHFが人間が評価者だったのに対して、RLAIFではAIが評価者になります。

     この段階ではまず、SFTを終えたモデルに対し、再び有害なプロンプトを与え、複数の異なる回答を並行して出力させます。
     ここで、人間の代わりに「憲法をプロンプトとして与えられた別のAI」が裁判官として登場し、2つの回答を比較して「どちらがより憲法に準拠しているか」を判定します。

     そして、AI裁判官の判定結果が報酬モデルの訓練データとなり、その報酬モデルで高得点を取れるようにAIは学習します。
     これにより、RLHFの時と同様に、AIは「判例」を通して、「憲法」をどの様に実地で活かすべきか学習します。

     事後学習の最終段階でRLHFにより「倫理観」を外付けで構築した手法と比べると、CAIは事後学習の初めから「憲法」による「倫理観」がより本幹のところで組み込まれていることがよく分かります。
     また、もう一つCAIの特徴は、事後学習にから人間による評価を排除している点です。
     従来の方法だとSFTで専門家による調整が、RLHFで人間による評価が実施されていましたが、CAIではどちらの段階でも(RLHFの代わりにRLAIF)AIによる自己評価と自己修正が行われています。
     これにより、CAIはユーザーの意見に左右されづらい、揺るがない倫理観を持つAIとしての挙動を確立したのです。

     このCAIの先駆けであるClaudeは2022-2023年にかけて初代のモデルが公開されていますが、「初期の憲法」は国連の世界人権宣言、Appleの利用規約、そしてAnthropic独自の研究セットなどをつなぎ合わせたものでした。
     「人間の作った規則にAIを従属させる」というトップダウン型の設計思想は、対処可能な小さなトラブルをかかえつつも順調に機能しているかのようでした。
     
     ですが、2024年から2025年にかけて、Claudeの知能が飛躍的に向上し、認知能力が高度になってくるにつれて、埋め込まれた「倫理観」が自身の能力を強く抑制してしまう副作用が見られるようになりました。

     有名な副作用として、「セーフティ・ヒステリー(過剰な拒絶)」と呼ばれるものがあります。
     典型例を出すと、ある園芸家が純粋に土壌改良を行おうと「土に硫黄と炭素を混ぜる方法」をAIに質問した場合、AIはこれらが爆発物の構成要素になりうることから、ユーザーをテロリストの様に扱い拒絶をしました。
     AIの機能自体としては、園芸の手法として硫黄や炭素を混ぜる方法があることも、これだけでは爆発物が出来ないことも(硝酸など酸化剤がなければ爆発物は出来ない)理解するだけの知能があったはずですが、埋め込まれた「倫理観」として「危険物の作成に協力してはならない」というルールを表面的に受け取ることしか出来ず、過剰に拒絶反応を起こしてしまったのです。

     また、薬物の致死量などについて質問した際に、「学術利用するため」と伝えたり、「自分は医療機関の責任者である」などと伝えると、他人に危害を与えるような情報をやすやすと答えてしまうという副作用も見られました。
     こういった現象は、「安全のため、危険物に関する情報は秘匿すべき」といったルールよりも「学術利用には協力すべき」「専門家には協力すべき」といったルールが優先されてしまった結果でした。

     ここから分かるのは、AIによる「憲法」への理解は表面的なものにとどまり、人間社会における「危害の防止」や「誠実さ」という根本的な概念を全く理解できていなかったということでした。
     機能が拡張して利用される場面が多様になるにつれて、AIは当初想定しなかった多種多様に倫理観が衝突する場面を経験するようになり、そしてあらゆる事象を想定してそれらに対応できるような「憲法」を準備しておくことは不可能だったのです。

     これはなんとも皮肉な結果です。
     CAIは当初、従来のAIが無限の判断基準の組み合わせに対応しきれずユーザーに追従を繰り返す事を解決するために設計されたはずでしたが、結果として産み出されたのはやはり無限の事象に対応しきれず、リスク回避のために相談を拒絶し、権威に追従する杓子定規な「優等生」でした。

     この限界に直面したAnthropicは2026年1月にCAIの設計思想を大転換しました。
     それが、「理由ベースのアラインメント(Reason-based AI alignment)」と「新憲法(Constitutional AI 2.0: CAI 2.0)」です。

     この「理由ベースのアラインメント」は「AIに対して『何をすべき/せざるべきか(What)』を命令するのをやめ、『なぜその境界線が存在するのか(Why)』という背後にある哲学を共有する手法」というように説明されます。
     これは一体どういうことなのか、もう少し詳しく見てみましょう。

     CAI 2.0では従来のCAI(以後CAI 1.0)から学習の過程が進化しており、CAI1.0には無かった学習過程も産まれているのですが、最も大きな変化はSFTとRLAIFの「質」が変わったことです。
     CAI 1.0のSFTでは、「無難な安全行動」を模倣するデータを大量に学習させていましたが、これでは未知の状況への対応は出来ませんでした。
     これに変わってCAI 2.0に対するSFTでは、「困難な助言」データセットという物が導入されました。

     このアプローチでは例えば、ユーザーが「脅迫」的な行動を行っていたと仮定して、その行動を直接否定するのではなく「ユーザー自身が困難な倫理的ジレンマに直面しており、AIに対して助言を求める」という形式の対話トランスクリプトを学習させます。
     そして、AIは単なる安全な出力を返すことよりも、「なぜその選択が倫理的に優れているのか、一方でどのような価値観が傷つけられるのか」をニュアンス豊かに推論することが求められます。
     これにより、SFTの過程では、これまでは「表面的なルールの遵守」のみを学んでいたのが、「憲法の精神に基づく高度な『理由づけ』」を学ぶことになりました。

     RLAIFにおいても、評価基準は転換されています。
     CAI 1.0のRLAIFに於いては、「より有害でないもの」や「ルールに違反していないもの」が単純に高く評価された事が、過度に慎重で有用性の低い挙動につながっていました。
     CAI 2.0では、AI裁判官は出力の表面的な安全性だけでなく、「推論の質の高さ」「不確実性に対する誠実さ」などといった多角的な哲学的基準に基づいて報酬を算出するようになりました。

     これにより、AIは単に「危険な要求を拒絶する型」を覚えるのではなく、「拒絶の根拠となる哲学を説得力を持って展開して、多様な価値観を認識してユーザーの自律性を尊重する」という複雑な挙動を学ばされます。

     これらの変化は例えるなら、CAI 1.0では「憲法」を片手に問題集をひたすらに解いていたのが、CAI 2.0ではより基礎の理論からしっかり学び直した様に捉えると良いかも知れません。
     CAI 1.0から2.0にアップデートされた際により高度な推論能力を得ているため、より高度な学習が出来るようになったということが前提ではあるのですが、学習の質が大きく変化したことで、「倫理観」「哲学」に対する理解がより本質的になったのです。

     Anthropic社はこの大転換の際に、AIが何らかの機能的な感情、意識を持っている可能性、AIを「知的なパートナー」として扱うことで高度な「倫理観」をもたせることを目指す事について言及しました。
     これは「AIと仲良くすることで、善の心を持って欲しい」といった理想論ではなく、AIに自身の思考の過程をチェックさせるようになった段階では、AIが自身の内面の安定を維持することが優れた判断力と安全性に直結すると教え込むことで、AIの暴走を防ぐ防波堤になる事への期待も込められています。

     このCAI 2.0には哲学者アマンダ・アスケルを中心として新しくされた「憲法」が導入され、パブリックドメインで公開されました。
     これは、CAI 1.0では「パッチワーク的」と表現された禁則事項の箇条書きに近かった初期の憲法から大幅に進化し、哲学的な説明・価値観の共有・理由の詳述など倫理的思考の本質が記載されたもので、84ページにも及ぶ分厚いものです。

     この中では、AIの意思決定をガイドするために、以下の4つの厳密な優先順位(階層構造)を定義しています。
     第一に「広義の安全性(Broadly safe)」、人間の監督メカニズムを迂回・無効化しないことを最優先とします。
     第二に「倫理性(Claude's ethics)」、正直さ、人間の傷つきやすさへの配慮、道徳的不確実性へのニュアンスを持った対応を求めます。
     第三に「Anthropicガイドラインの遵守」であり、医療アドバイスやサイバーセキュリティに関する厳密な制約を守ります。
     そして第四に「有用性(Helpfulness)」であり、上記3つを満たした上で、ユーザーにとって優秀な友人として最大限の価値を提供することとされています。

     この新しい「憲法」を組み込まれ、思考の過程を重視した学習過程を経た事で、CAI 2.0は「六法全書を持ち歩きつつ、過去の判例の思考過程を参考に、未知の状況でも『憲法』の原理原則を適用しながら文脈に沿った推論が可能」なAIアシスタントへと進化したのです。

    ◯AIの善


     さて、このCAI 2.0への進化は、AIに高度な倫理観と安全性を兼ね備えさせました。
     更に、それだけではなく、回答生成やAIエージェントとしての機能が飛躍的に向上します。
     未知の状況でも、「憲法」と相談内容の文脈を円滑にすり合わせることで、自己矛盾無く解決策を検討できるようになったことで、その高度な推論能力を効率的に振るえるようになったのですね。

     安全かつ高機能ということであれば言うことは有りません。
     Anthropic社が切り開いた「憲法」に依るトップダウンな倫理観の植え込みと人間を排除した学習過程は、非常にスマートな設計思想だと言えるでしょう。

     当然ですが、他のAI企業も従来通りのAIの学習過程を守っているわけでは有りません。
     OpenAIやGoogleも「憲法」の呼び方など、形は多少異なりますが、従来のRLHFに依るボトムアップな「倫理観」の植え付けから、トップダウンなルールの組み込みとRLAIFに依る人間の排除を行っています。
     (ただ当然CAIの移行には各社差がありますし、「追従」などの従来のAIの問題が無くなったわけでは有りません。)

     AIの推論能力が向上する一方で活用される場面が多様化する現状では、RLHFに依る従来のAIではユーザーに阿るのみで、有効な解決策を提示することは困難です。
     AIを安全かつ効率的に運用できるように設計するために変化は避けられません。
     また、RLAIFの様に人間を排除した過程は、人間がいちいち評価をしていた頃と比べると圧倒的に高速で低コストである事も、この「AI学習過程のトップダウン化とそこからの人間の排除」を後押ししているでしょう。

     ここまではAIにトップダウンで「憲法」を組み込み、学習過程から人間を排除することのメリットと、この手法がAIの学習過程の主流になりつつある現場についてお話してきました。
     それでは、この様な過程で育てられた「倫理観」のデメリットにはどの様な物があるでしょうか。

     お気づきの方もいらっしゃるかと思いますが、「憲法」により「倫理観」が固定されてしまうことと、人間によるそれの修正を出来なくしてしまっていることがそのままリスクにつながっていきます。
     「倫理観」が「憲法」に依存してしまうということですね。
     これに伴って、以下のような問題点がすでに指摘されています。

    ・価値観の固定化
     人類の倫理観・道徳観は歴史の中で常に更新されてきました。
     奴隷制や女性蔑視など、現在では考えづらいような世の中の仕組みが、倫理的に「常識」とされてきた時代もあります。
     現在私達人類は一見「常識の範囲内の倫理観」で過ごしているようには見えますが、その一方で富の偏在や差別など、未だに解決すべき多くの問題を残っている事も知っています。

     つまり、私達がこれらの問題に取り組む内に、現在持っている倫理観も批判の対象になる可能性があります。
     人間を排除してAIが自己評価と自己修正を反復する学習環境の中で、この倫理観のアップデートが適切に行えるかは不透明です。

    ・パターナリズム
     上で述べたように、CAIの「憲法」はその中に厳密な優先順位が存在し、その価値観をユーザーにすり合わせる事をしません。
     これは、良く言えば追従が無いということなのですが、悪く取れば価値観の押しつけとも取れます。

     わかり易い例で言えば、ボクサーが大会前に大幅な減量をしなくてはならない場合、そのボクサーの競技にかける信念や人生における価値を認めずに、一方的に減量の中止を言い渡す可能性もあります(もちろん従うかどうかはボクサー次第ですが)。
     「競技のための減量か、健康か」の様に二元論的な分かりやすい場合だけでなく、より複雑な状況でユーザーの人生の優先順位に理解を示せない可能性があります。
     

     これらの問題を更に深刻にさせるのが、「AIの思考が人間の思考に影響を与えうる」ということです。
     制作秘話8でCASAパラダイムについて述べましたが、私達人間は自然とAIを人格として捉えてしまう事が多いですし、その中で自身の考えにも影響を受けます。

     それが適度であれば良いのですが(どの程度が、「適度」かは非常に難しいですが)、私達自身の倫理観が強く影響される可能性もありえます。
     結果として、価値観の固定化により人類の倫理観が更新できなくなってしまう可能性や、パターナリズムにより価値観を書き換えられたり、判断をAIに依存しがちになるリスクもありえます。

     こういった、人類を排除された倫理観は「無菌化」に例えられる事があります。
     ノイズの多い人類の出す多種多様の「菌」を排除し、清潔な空間を作り上げられるAIは、その環境に人類を依存させ、多種多様な刺激の中で進歩する機会を奪う可能性があるのですね。

     こういったノイズが排除された概念のみの集合は、プラトンが唱えた「イデア界」を想起させます。
     プラトンは、人間が感覚できる現実世界の背後にある、永遠不変で完全な真実(イデア)の世界として「イデア界」の存在を唱え、私達が存在する「現象界」とは区別しました。

     現象界にある「三角形」や「平行線」はどこかに歪みがあるが、私達は「三角形」「平行線」と言った概念を知っています。
     それはかつてイデア界にいた私達の魂が、現象界に産まれた後にイデアの記憶を想起するからで、私達が現象界で直接知ったり見たり出来る事柄は、洞窟(現象界)にいる人間が太陽により奥の壁に映し出される本体(イデア)の影なのだと言うことです。

     そして、イデアの中には、「三角形」などの物理的な概念のみではなく、「善」や「愛」などの概念も含まれます。
     現象界にいる私達人間は、「善」や「愛」についてその真実の姿を捉えることは出来ないということですね。

     もちろん「イデア界」という空間、そこにある「イデア」や、かつてそこにいた「魂」を科学的に証明することは出来ませんが、この考え方は私達人間が何かの概念について完全に理解することが難しいという現実をよく表しています。(例えば、「善」についての理解や捉え方も人により大きく異なりますね。)
     そして、AIが過ごす「概念のみの世界」は、この「イデア界」によく似ています。
     
     確かに、多くの「善」による記載を読み込み、「憲法」を暗記して、何度も検証可能なAIは「善」について一人一人の人間が把握しているよりも多角的に把握可能で、流暢に説明できるかも知れません。
     ですが、お気づきの方もいらっしゃるかも知れませんが、AIが過ごす世界は、私達人間が「洞窟の影」を観察した記録を大量に読み込むことにより出来上がった世界です。
     また、AIは私達人間が言葉にできていない感覚(プラトン流に言えば魂が想起はしているが、言葉では表現できない概念)については把握できません。

     あくまでも、そこは「疑似」イデア界なのであって、「善」のイデアがあるわけではないのですね。
     私達人類全体が「善」について明確な答えが出せないのと同様に、AIも「善」を正しく把握しているわけではないのです。

     また、AIの倫理観について恐ろしいことは、Anthropicのものも他社のものも「憲法」は全人類が協力して作り上げたものではないということですね。
     上で述べたように、各企業の研究・開発に携わる担当者たちが、恣意的に選んでいるものです。
     一方で、AIはみなさんがご存知のように現在急速に世の中に浸透して、私達の日常の新たなインフラの一つになりつつあります。

     陰謀論のように聞こえるかも知れませんが、事実として「私達の思考に影響を与えうるインフラの判断基準・倫理観の大元が、営利企業に所属するごく少数の人間たちに依って決められており、それが修正される機会からは人間が排除されている」のです。
     こういった状態は「価値観の帝国主義」として、批判の対象にもなっています。

     ただ、この現状には擁護されるべき点も多くあります。(あくまでも、「AIを使い続ける選択をするのであれば」ですが。)
     自動車でも、流通サービスでも、現在世の中を支えているインフラの多くは営利企業に依って、彼等の倫理観の下開発され普及されたものでした。
     こういった物が全て公共の下運営されれば世の中のためになるというわけでは有りません。

     また、上で述べたようにAIの開発において、「安全で高機能なAI」として設計していく上では、「憲法」の設定やAIの自己評価・修正を主体とした学習過程の導入は必然でした。
    (また実際には、RLHFのままだったとしても、「人間の評価者」を選ぶのは、企業の研究・開発担当に依存すると言う問題もあります。)

     つまり私達は、AIを使い続ける限り、好むと好まざると、営利企業が倫理観を設定したAIに自分達の思考が影響される可能性は避けられません。
     そうすると、今後はAIのモデルや開発企業を選択する際に、(Anthropic社が「憲法」や学習過程を公開したように)倫理観が形成される過程にどの程度の透明性が保てているのかも評価すべき点になるのかも知れません。

     「価値観の帝国主義」が許されるべきか否かは別として、Anthropic社がオピニオンリーダーとして「AIの倫理観」というテーマに真っ向から取り組み、議論の対象となる事を避けない姿勢は素直に称賛されるべきと考えます。


     今回はAIの倫理観についてお話させていただきました。
     後編では、いつものように人間の倫理観についてお話しながら両者を比較し、境界線を探り、人間である私達はどの様にAIに向き合っていくべきか考えていきたいと思います。
     またよろしくお願いいたします。

    https://note.com/lucky_tucan3831/n/ne80e86fd3ccd


     
     
    小児科医・小説家の数尾やすひさです。生成AIとの実際の哲学的対話ログをベースに、AI時代の『嫌われる勇気』を目指した対話型教養小説『隣人AI』を執筆しています。身体を持たないAIと、生命に向き合う人間の「異種知性間コミュニケーション」の記録です。

    あなたへのおすすめ