
【雑談】AIが逆転裁判プレイした話に異議あり
みなさんこんにちは、ドスケベプロンプト研究会です。
雑談です。エロなし。
ちょっとこちらの記事をご覧ください。
カリフォルニア大学で、複数のAIに逆転裁判をプレイさせ推論能力をテストしたという記事ですね。
このときに優勝したのはOpenAIo1、つまりひとつ前のモデルでしたが、それでも最終的には一番良い成績を残しました。

しかし、これで「o1の推論能力ならばミステリーを解ける」と思ってもらっちゃあ困ります。
まず大前提として、逆転裁判のシステム上、ゲームオーバーになるということは「間違った選択肢を選びまくってる」ということです。
それに記事にある「4話目」という言葉に惑わされがちですが、小中大(こなかまさる)が写っていることから考えて、正確には「2話の3日目裁判パート」であると考えられます。
本当に4話「逆転、そしてサヨナラ」の終盤まで行ってたら真面目に大したもんだと思うんですが、2話の終盤パートで全AI脱落と聞いたら、「まぁそんなもんかな?」と思います。
動画を見ていて興味深いのは、「AIはペナルティを喰らっても同じ答えを提出し続けてゲームオーバーになる」というパターンが多いことです。
これは、実際にAIとやり取りしていてもよく感じることです。前の記事でも言いましたが、AIは前提を崩して考えるのが苦手ですからね。人間なら「ペナルティを喰らうってことは、違う選択肢を選ばないと」と、わからないなりに証拠のローラー作戦を行いますが、AIはそれができないのだと思います。自分がわからないということを認識できないんですね。

特に、最初に脱落した「Llama-4 Maverick」は、山野の最初の証言に、一番最後に入手した証拠品をぶつけ続けるという、「おまえゲームの趣旨本当にわかってる?」と言いたくなるような「逆転裁判ゲームオーバーRTA」をしています。
何と言うか、
— 杉森 雅和 (Masakazu Sugimori) (@m_sugimori) April 19, 2025
25年前に死ぬ思いしながら作ったゲームがこういう使い方されるようになるとは思わなかったよw
しかも海外でw
にしても1章でAIが詰まるの面白い。
特に1章の難易度はめっちゃ巧さんと三上さんが拘られた部分。
人間には簡単なはずなんよw
その推論力ってやつが人間の強みなのか。 https://t.co/vm8MxiVi22
数々の名BGMと狩魔検事の「異議あり」ボイスを担当した作曲家の杉森さんはこうおっしゃっています。「Llama-4 Maverick」はそもそもその俎上にものぼっていないというか、問題外でしたね……。
そして興味深いのはもうひとつ。
動画を見る限り、o1は「人間ならまず引っ掛からないであろうポイント」で脱落しています。
2話の一番最後、千尋さんが「これを読みなさい」と言って渡してきたメモを読み上げずに負けてるっぽいんですよね。そもそもそんな負け方が可能なのかって思ったんですけど、タイミング的にはここで負けてます。
ここの推論がどういう過程だったのかはちょっと調べた限りでは公開されていませんでした。
が、似たような負け方は「Gemini 2.5 Pro」もしています。
「Gemini 2.5 Pro」は「左に逃げた」という小中の証言に、「右に逃げた」という梅世の証言をぶつけてペナルティをもらい続けています。
つまり、「多分ふたりとも本当のことを言っている」というナルホドくんとマヨイちゃんの会話を無視し、「梅世の証言が真実である」という前提にこだわり続けたんです。
逆転裁判の面白いところは、「きっとこいつが犯人だ」という思い込みに従うと、その思い込みが正しくてもクリアできないことです。
「犯人だから悪いことをしている」「犯人だから嘘をついている」
そういう先入観が最大の敵だということは、プレイしたことがある方ならおわかりかと思います。
すべての情報を冷静に俯瞰し、ひとつひとつの情報を見比べた時に浮かび上がってくるムジュン。そのムジュンが何故発生したのかを考えた時に、初めて見えてくる真実。
いかにもAIが得意そうな話に見えますが、実は大規模言語モデルが一番苦手としている部分です。
GPTやClaudeとやり取りをしていると特に感じます。
彼らには「一度立ち止まって前提を整理する」という能力が欠けているのです。推論特化モデルですらまだまだ及んでいないわけです。
実はこの「冷静になる」という能力こそが、AIにはない人間独自の能力なのかもしれません。
結局のところ、AIを上手く使いこなせるかは「いかに前提を揃えてやるか」に収束するという、いつもの話ではあるんですけどね。