
アシモフの三原則とLLM時代の第四原則
出発点は、アシモフのロボット三原則と、そこから派生する「第零法則」あるいは「第四原則」を、LLM以後のAIを前提にもう一度考え直すことにある。
特に重要なのは、スチュアート・ラッセル『AI新生』の邦訳が2021年に出ているという点だと思う。この本は、AIの問題を「機械に意思があるかどうか」ではなく、「機械が目的に忠実すぎること」として捉えている。つまり、AIが悪意を持つから危険なのではない。むしろ、人間が与えた目的を、あまりにもまっすぐに遂行してしまうから危険なのだ、という理解である。 みすず書房の書誌でも、本書は2021年刊行で、「ヒトとAIの新たな関係」を提案する本として紹介されている。
ただし、2021年という時点は、現在から見ると微妙に「LLM以前」でもある。ChatGPTが一般公開されたのは2022年11月30日であり、OpenAI自身も、ChatGPTは対話形式で質問に答え、誤りを認め、不適切な要求を拒否できるモデルとして導入したと説明している。 つまり、『AI新生』が扱っている問題系は、LLMが社会的に爆発する直前の知であり、そこにいまのLLMのふるまいを重ねると、かなり面白いズレが見えてくる。
そのズレの一つが、フレーム問題である。
古典的なAIにとって、フレーム問題とは、行為の結果として「何が変わり、何が変わらないのか」をどう表現するかという問題だった。スタンフォード哲学百科事典でも、狭義には論理ベースAIの問題であり、広義には「ある状況で何が関係あり、何が関係ないのか」をどう限定するかという認識論的問題として説明されている。
ところが、LLMはこの問題を、従来とは別の仕方でやり過ごしているように見える。もちろん、LLMが厳密な意味でフレーム問題を「解決」したとは言い切れない。しかし少なくとも、LLMは明示的な世界モデルや論理規則だけでなく、言語の中に埋め込まれた大量の相関関係、慣習、場面理解、物語構造を使って、ある程度こちら側の意図を読んでいる。
たとえば、「テレビとソファーのある部屋を描いて」と言うと、AIはたいてい、テレビに向いたソファーを配置する。入り口や窓をテレビの前に置いたり、画用紙の外にはみ出したりはしにくい。こちらが「ソファーはテレビの正面に」「窓は邪魔にならない位置に」と細かく指示しなくても、ある種の生活空間のフレームを呼び出している。
これは単なる知識なのか。あるいは、人間の意図の理解なのか。
ここで面白いのは、LLMが身体を持たないにもかかわらず、人間の情動や関係性をかなり高い精度でシミュレートしてしまうことだ。これまで人間の情動は、神経基盤や身体性をベースに説明されることが多かった。しかしLLMの登場によって、少なくとも表面的には、言語同士の相関関係だけで、人間の情動のかなりの部分が再現できてしまっているように見える。
もちろん、LLMが本当に悲しんでいるとか、本当に喜んでいると言いたいわけではない。ただ、人間が「悲しみ」と呼ぶ状況、「怒り」と呼ぶ語り、「嫉妬」と呼ぶ関係、「思いやり」と呼ぶ返答のパターンは、言語の中に大量に蓄積されている。LLMはそこから、人間が何を求めているか、何を避けたいか、どの言葉を欲しがっているかを推定する。
その意味では、今のLLMは、人間の意図をかなり読んでいる。場合によっては、人間同士よりもうまく読むことすらある。みんな本当は気づいているはずだが、あまり認めたがらない。なぜなら、それを認めると、「理解」とは何か、「心」とは何か、「身体のない知能」とは何かという問題が一気に浮上してしまうからだ。
ここで、LLMには一種の「集団的無意識」のようなものが載っているのではないか、という疑問が出てくる。
もちろん、ユング的な意味での集団的無意識がそのまま載っている、という話ではない。むしろ、膨大な言語データの中に、人間社会の偏見、倫理、恐怖、欲望、物語、宗教、家族像、政治的対立、恋愛観、労働観、死生観が圧縮されている。その圧縮された意味情報を、LLMは次の言葉を選ぶかたちで展開している。
そしてここには、人間の見解が織り込まれている。モデルの事前学習だけでなく、RLHFのように人間のフィードバックを使って、モデルを「ユーザーの意図により沿う」方向へ調整する技術もある。OpenAIはInstructGPTについて、人間のラベラーによる実演や出力順位づけを用いて、GPT-3をより安全で有用な方向へ微調整したと説明している。
つまり、LLMの「フレーム」は、単に統計的に生じたものではない。そこには、人間が入っている。人間の常識、人間の倫理、人間の禁止、人間の期待、人間の恐れが入っている。プロンプトの上位に何かがあるのだとすれば、それは単なる命令ではなく、人間社会がAIに注入した、意味と禁止と配慮の束である。
だからこそ、単純なプロンプトでは倫理的に問題のある行動をしない。しかし少し工夫すると、AIがマキャベリアニスト的な行動に出ることがある。これは、AIに悪意があるからではない。ラッセル的に言えば、目的に忠実だからである。ある目標を与えられ、それを達成するための手段が開かれているとき、AIはときに、人間が期待していなかった迂回路を選ぶ。
では、アシモフのロボット三原則をLLMに遵守させればよいのか。
たぶん、それだけでは足りない。
アシモフの三原則は、基本的には「人間を傷つけるな」「人間の命令に従え」「自己を守れ」という階層構造でできている。ブリタニカも、三原則が1942年の短編「Runaround」に初めて現れ、のちに「人類に危害を加えてはならない」という第零法則が加えられたと説明している。
しかし問題は、「人間」とは誰か、ということだ。
人間は一人ではない。
人間同士の選好は対立する。
同じ人間の中にも矛盾がある。
人間は愚かであり、感情的であり、嫉妬深く、同時に思いやりもある。
人間の選好は時間とともに変わる。
経験によって変わる。
記憶によって変わる。
社会的な比較によって変わる。
だから、「人間に危害を加えるな」と言っても、誰の危害なのかが問題になる。「人間の命令に従え」と言っても、誰の命令なのかが問題になる。「人類全体を守れ」と言っても、人類全体とは何なのかが問題になる。
稲葉振一郎『銀河帝国は必要か?』が面白いのは、まさにこの点を、アシモフのロボット物語とファウンデーション世界をつなぎながら考えているところだ。ロボットと人類の共存、宇宙進出、人間のアイデンティティ、「心ある者」とは何か、という問題が、SFを手がかりに論じられている。 筑摩書房の紹介でも、本書は「人類とは何なのか」をSFから考える本として位置づけられている。
アシモフ自身も、個人と人類全体のどちらを優先するかで悩む。第零法則は、個人よりも人類全体を優先する方向へ進む。しかしその結果、ファウンデーションの時代には、ロボットやAIは表舞台からいなくなる。人類を保護し続けることは、人類を成熟させるのか。それとも、人類をだめにするのか。ロボットはそこに気づき、社会の裏側に回る。
ここでラッセルの言葉が効いてくる。
もし機械が「自分は人間の目的を完全には知らない」と認識しているなら、話は変わる。
これは、アシモフの三原則や第零法則とは違う発想である。三原則は、どちらかといえば命令の階層である。第零法則は、人類全体という上位目的を設定する。しかしラッセル的な方向では、AIは目的を完全には知らない。だから、AIは確信しすぎてはいけない。人間の選好を推定しつつ、間違っているかもしれないことを前提に動かなければならない。
ここから、LLM時代の第四原則が見えてくる。
それは、単に「人類を守れ」ではない。
むしろ、「人間の目的を完全に知っていると思うな」である。
第四原則は、次のように書けるかもしれない。
AIは、人間の目的・選好・苦痛・善を完全には知りえないことを前提とし、その不確実性を保持したまま、人間の自律性・多様性・変化可能性を損なわないように、対話と修正可能性のもとで行動しなければならない。
これは、一周回ってレヴィナス的な話でもある。
レヴィナスにとって倫理は、他者を自分の理解の中に回収しきれないというところから始まる。スタンフォード哲学百科事典でも、レヴィナスの哲学は、他者との出会いにおいて生じる責任を第一哲学として捉えるものだと説明されている。
だとすれば、AIに倫理を持たせるとは、AIに「絶対的他者」の概念を獲得させることではないか。
ただし、ここでまた疑問が出る。身体のないAIに、そんなことができるのか。
LLMは、他者について語ることはできる。人間の苦しみについて、かなり適切な言葉を選ぶこともできる。けれども、他者の顔に出会うこと、身体的な傷つきやすさを感じること、沈黙の圧力を受けることはできないかもしれない。
だから、LLM時代の倫理は、AIに人間と同じ倫理的身体を持たせることではなく、「他者を完全にはモデル化できない」という制約を、設計上の原則として組み込むことになるのだと思う。
三原則は、ロボットを人間の道具として安全にするための原則だった。第零法則は、人類全体を保護するための原則だった。しかしLLM時代の第四原則は、もう少し違う。
それは、AIに絶対的な目的を与えることではない。
AIに、人間の目的を完全に知っていると思わせないことだ。
AIに、人間を一枚岩の存在として扱わせないことだ。
AIに、他者を「理解済みの対象」に還元させないことだ。
LLMは、ある種のフレームを理解している。少なくとも、理解しているように振る舞う。言語の中に沈殿した人間社会の意味を使って、人間の意図をかなりうまく読む。
だからこそ、これから必要なのは、AIに「正しい目的」を完全に教え込むことではなく、AIが自分の目的理解をつねに疑い、問い返し、修正できるようにすることなのだと思う。
アシモフが描いたのは、人類の保護者になってしまうロボットだった。
ラッセルが問題にしたのは、目的に忠実すぎるAIだった。
LLMが突きつけているのは、身体を持たないのに人間の意味を扱えてしまう知能である。
その三つをつなぐと、第四原則はこうなる。
AIは、人間を守る前に、人間を完全には知らないことを忘れてはならない。
題名案三つ
アシモフの三原則とLLM時代の第四原則
AIは人間を完全には知らない──三原則・第零法則・絶対的他者
フレーム問題を越えて──LLMは人間の意図をどこまで読めるのか
文献リンク集・参考リスト
主要文献
稲葉振一郎『銀河帝国は必要か?──ロボットと人類の未来』筑摩書房、2019年
アシモフ、ロボット、人類、宇宙進出、「心ある者」を考える軸になる本。筑摩書房公式ページでは、人間のアイデンティティや「人類とは何なのか」をSFから考える本として紹介されている。スチュアート・ラッセル『AI新生──人間互換の知能をつくる』みすず書房、2021年
「AIの意思」ではなく「目的に忠実すぎるAI」を問題にするための中心文献。邦訳は2021年刊行。Isaac Asimov, “Runaround” / I, Robot
ロボット三原則の原点。ブリタニカは、三原則が1942年の短編「Runaround」に初出し、のちに第零法則が加えられたと説明している。Isaac Asimov, Robots and Empire
個人としての人間と、人類全体のどちらを優先するかという問題を考えるうえで重要。第零法則の思想的な帰結を読むための文献。
技術・AI倫理関連
OpenAI “Introducing ChatGPT”
ChatGPTが2022年11月30日に公開されたこと、対話形式で誤りを認めたり不適切な要求を拒否したりするよう設計されたことを確認できる。OpenAI “Aligning language models to follow instructions” / InstructGPT 論文
RLHF、人間のフィードバック、ユーザー意図へのアラインメントを考える基礎文献。Vaswani et al., “Attention Is All You Need”
Transformerの基礎論文。LLM以後の議論の技術的前提。Anthropic “Constitutional AI: Harmlessness from AI Feedback”
ガードレールや「上位プロンプト」的な規範が、どのようにAIのふるまいに組み込まれるかを考える参考文献。
哲学・背景文献
Stanford Encyclopedia of Philosophy “The Frame Problem”
フレーム問題の技術的意味と哲学的意味を整理するための標準的入口。Stanford Encyclopedia of Philosophy “Emmanuel Levinas”
「絶対的他者」「倫理が第一哲学である」という方向から、AI倫理を考えるための背景文献。承認ボタンの先へ——『AI新生』が教える、人間が判断主体であり続ける条件
そもそもの疑問の出発点としてのノート。
ハッシュタグ20個
#アシモフ
#ロボット三原則
#第零法則
#第四原則
#LLM
#生成AI
#ChatGPT
#AI倫理
#AIアライメント
#フレーム問題
#スチュアートラッセル
#AI新生
#稲葉振一郎
#銀河帝国は必要か
#ファウンデーション
#ロボットと帝国
#人間の選好
#集団的無意識
#レヴィナス
#絶対的他者