
その判断、文章だけで決めてない?AIはサムネ派、人間は動画派
最近読んだ記事の一文に
「テーブルの端に置いたコップに誰かが触れたらどうなる?」
こうした単純な物理シナリオですら、今のAIは正確に判断できていない、という内容。
専門家からするとそうなんでしょうが、一瞬「え、そうなの?」というのが使い手である私の印象。でも少し考えてみると、これは確かに本質的な事です。
今のAIは「文章生成」が得意
ChatGPTのようなAI(LLM)は、とにかく文章がうまい。
説明は自然だし、理由付けも確からしく、会話としても成立している。
だからつい私たちは、AIが「理解している」と感じてしまう。
でも実際にやっているのは、「次に来そうな言葉を当て続けている」 ということであって、
世界を見ているというより、文章の流れを読んでいる感覚に近い。
YouTubeで例えると
この違いをYouTubeで例えるとしっくりきます。今のAIは、動画の1枚のキャプチャを見て
「どんな動画か」を説明するのが得意、
でも、
この前に何が起きていたか
このあと、どう展開するか
を、頭の中で再生しているわけじゃなく、静止画を見て語っている状態。
人間は、無意識に「再生」している
先ほどの「テーブルの端に置いたコップに誰かが触れたらどうなる?」という話も同じ。人間は質問を聞いた瞬間に、
端にある
触れる
バランスが
崩れる
落ちる
という流れを、ほぼ無意識に頭の中で再生していて、考えているというよりは、一瞬、動画が流れている感じに近いのではないかと思います。
「ワールドモデル」という考え方
この記事で紹介されていたのが「ワールドモデル」と呼ばれるAIの方向性。私は専門家ではないので、この辺りは軽く流していますが、
簡単に言うと、
世界の状態を頭の中に持ち
その世界を少し先まで動かし
結果を見てから判断するAI
文章の次を当てるのではなく、世界の次の瞬間を当てにいく。
文章だけなら、違いは見えにくい
ただ、「文章としての答え」だけを見ると、LLMとワールドモデルの出力は、かなり似たところに落ち着くんじゃないかなと思います。
だから今後も、「もう十分じゃない?」とも感じてしまいます。
でも差が出るのは、条件が変わったときや、初めての状況、実際に行動が伴うときに、文章はやり直せるけど、現実はやり直せない。
これはAIだけの話じゃない
この話、実は人間にもそのまま当てはめる事ができます。
もっともらしい資料
きれいな戦略文章
AIが整えた企画
でも、誰も頭の中で動画を再生していない、という場面、わりとよく見る。文章が整っているほど、考えた気になってしまっています。
おわりに
今のAIはすごく便利だし、文章生成の道具としては本当に優秀です。成果物を出すことが光の速さに近づいている感覚です。
でも、「考える」「判断する」「想像する」とは何かを考え始めると、やっばり少し距離を取ったほうがいい気もしています。
今のAIはサムネを見て語る。
人間は、動画を再生する。
この違いを、忘れないようにしていきたいですね。