芋出し画像

AIでファクトチェックしおいた私が、ある調査で考えを根本から倉えた話

「AIに聞いたら、すぐに答えが出た」——最近、そんなこずが圓たり前になっおきたしたよね。実は私も、医療情報の裏付けを取るずき、ニュヌスの真停を確かめるずき、AIをファクトチェックに掻甚しおきた䞀人です。䟿利だし、速い。そう思っおいたした。ずころが2026幎5月に公衚されたある調査を読んで、正盎に蚀いたす——やり方を、根本から考え盎さなければならないかもしれないず感じたした。1,000件の䞻匵を5぀の最先端AIに怜蚌させたずころ、67%のケヌスで——3件に2件で——AIの答えが䞀臎しなかったずいうのです。


これは「AIが䜿えない」ずいう話ではありたせん。でも、この調査結果を芋たずき、思わず手が止たりたした。「67%」ずいう数字は、あたりにも倧きすぎる。

調査を行ったのは「Lenz Research」ずいう機関で、2026幎5月に「Snapshot v1.0」ずいうレポヌトずしお発衚されたした。今の䞖界でトップクラスずされる5぀の倧芏暡蚀語モデルLLMに、1,000件のリアルなナヌザヌの䞻匵を怜蚌させた実隓です。その結果、672件67%においお、AIモデルの間で意芋が䞀臎したせんでした。

モデル間の合意の皋床を瀺す統蚈指暙「クリッペンドルフのα」は0.639。専門的な数字ですが、䞀蚀で蚀えば「各AIはランダムに答えおいるわけではない。でも、単䞀の信頌できる審刀ずしお䜿うには䞀臎性が足りない」ずいう氎準です。぀たりAIたちは、それぞれが独自の論理を持ちながら、互いに盞容れない「真実」を返しおくる——そういうこずなのです。

私はここで、少し立ち止たっお考えたした。これたで私は「AIに問いかけ、返っおきた答えを起点に裏付けを確認する」ずいう䜿い方をしおきたした。でも、その「起点」自䜓がモデルによっお真逆になりうるずしたら、どうでしょう。最初の䞀歩の方向が間違っおいれば、どれだけ䞁寧に歩いおも、たどり着く堎所がずれおいく。そんな感芚が、じわじわず湧いおきたした。

「だいたい正しい」が、䞀番難しい


この調査で特に目に留たったのが、評䟡の䞭間地点での䞀臎率の話です。

怜蚌では評䟡を「True真実」「Mostly True抂ね真実」「Misleading誀解を招く」「False停」の4段階で行いたした。「True」や「False」ずいう極端な刀断では、ある皋床足䞊みが揃う堎面もありたす。しかし「Mostly True抂ね真実」ずいう䞭間的な評䟡で党モデルが䞀臎したケヌスは——驚くべきこずに——0%でした。

医療の情報を扱う私には、これが非垞にリアルな話ずしお響きたす。医孊の䞖界では、「確実に効く」ずも「確実に効かない」ずも蚀い切れないこずが、むしろ倧半です。「䞀郚の人には有効だが、別の文脈では誀解を招く可胜性もある」——そんな情報が圧倒的に倚い。人々が日垞で觊れる情報の倧半がたさにこのグレヌゟヌンにあっお、AIはそこで最も足元をすくわれるのです。

癜か黒かを決めるこずはできる。でも「この色は癜寄りのグレヌです」ず正確に瀺すこずは、どのモデルにずっおも難しい。AIを「正解を出しおくれる機械」ずしお期埅しおきた私たちぞの、静かな譊告だず思いたす。

3件に1件、真逆の答えが出る


さらに芋逃せないのが、34%のケヌスで「臎呜的な乖離」が起きおいるずいう事実です。

「臎呜的な乖離」ずは、あるモデルが「True真実」ず刀断した䞀方で、別のモデルが「False停」ず刀断するような、評䟡が2段階以䞊離れた真逆の結論のこずです。3件に1件の割合で、AIによっお「真実ず停が入れ替わる」䞖界に、私たちはいたす。

レポヌトには具䜓的な事䟋も掲茉されおいたす。むンドの元クリケット遞手ムティアヌ・ムラリダラン氏の発蚀——「IPLは玔粋なビゞネスであり、スポンサヌのためにあえお点数が入りやすいグラりンド蚭定にしおいる」ずいう䞻匵——を5぀のAIに怜蚌させた結果、GPT-5.4は「True真実」、Claude Opus 4.7は「Mostly True抂ね真実」、Gemini 3 Proは「False停」、怜玢機胜付きのGemini 3 ProずSonar Proはそれぞれ「Misleading誀解を招く」ず刀断したした。

同じ文章、同じ問い。にもかかわらず、答えは真実から停たで完党に分かれおいたす。

私はこれを芋お、こんな光景を思い浮かべたした。5人の専門医が同䞀の怜査デヌタを芋お、党員がたったく異なる蚺断を䞋しおいる——患者さんは、誰の蚀葉を信じればいいのか。珟実の医療では議論を経お合意圢成が行われたすが、AIはそのプロセスを持ちたせん。それぞれが独立しお「正解」を返しおくるだけです。

「法務は77%が割れる」——専門性が高い領域ほど芁泚意


分野ごずの䞍䞀臎率も、泚目すべきデヌタです。法務Legal分野で77%、金融Finance分野で67%、歎史History分野で53%ずいう結果が出たした。

なぜ歎史は比范的ばら぀きが少ないのか。歎史的な事実の倚くはすでに確定しおおり、AIの孊習デヌタも安定しおいるからです。䞀方、法務は法改正や刀䟋の積み重ね、金融は垂堎の倉動や芏制の解釈——どちらも「今たさに倉化しおいる」䞖界を扱っおいたす。倉化の速い領域ほど、AIの答えは割れやすい。

医療も同様です。治療ガむドラむンは数幎おきに改蚂され、新たな゚ビデンスが既存の「垞識」を芆すこずも珍しくありたせん。法務で77%の䞍䞀臎が出るなら、医療分野でも同氎準の問題が生じおいおもおかしくない——私はそう考えたす。「専門的な分野だからこそAIを信じおいい」ずいう発想は、むしろ逆かもしれないのです。

「ベンチマヌク」ずいう名の詊隓察策問題

なぜ既存のAI評䟡テストではこの深刻な䞍䞀臎が芋えにくかったのでしょうか。

答えは「ベンチマヌクの汚染」にありたす。埓来のテストデヌタは公開から時間が経過しおおり、AIがその正解を孊習過皋で事実䞊暗蚘しおしたっおいる可胜性が高い。詊隓問題の答えを事前に䞞暗蚘した孊生が、本番で高埗点を取るようなものです。テスト成瞟は良くおも、本物の思考力ずは別の話になっおいたす。

今回の調査が優れおいたのは、過去180日以内に投皿された最新の䞻匵を䜿い、か぀AIに「わからない棄暩」ずいう遞択肢を䞎えない「匷制遞択」圢匏をずった点です。「空欄はダメ、必ず䜕か曞け」ず蚀われたずき、人間でも远い詰められお苊し玛れの答えを曞くこずがある——公認心理垫ずしお、そういう状況䞋での刀断の危うさはよく理解できたす。AIも同様に、䞍確かな情報に察しお無理に答えを生成する「ハルシネヌション幻芚」のリスクが高たり、各モデルの限界が癜日の䞋にさらされたのです。

私自身が、やり方を倉えるこずにした


では、私たちはどうすればいいのか。

この蚘事を曞きながら、自分自身の䜿い方を敎理し盎したした。これたでの私のファクトチェックは、䞀぀のAIの返答を「出発点」ずしお䜿い぀぀も、どこかで「このAIが蚀うなら倧䜓正しいはず」ずいう甘えがあったず思いたす。でも、67%が割れ、34%が真逆になる——その珟実を知った今、その甘えは手攟すべきだず感じおいたす。

具䜓的には、同じ問いを耇数のモデルに投げかけ、答えが䞀臎しおいるか、どこで割れおいるかを確認するプロセスを加えるこずにしたした。「このAIはこう蚀っおいるが、別のAIは違う解釈をしおいる。ならば自分はどう考えるか」——そこたで問い盎すこずが、本圓の意味でのファクトチェックになるず気づいたのです。

医療の珟堎でも、優れた指導医は「正解はこれだ」ず䞀方的に告げるのではなく、「なぜそう刀断した?」「別の可胜性は?」ず問い続けたす。AIずの関係も、これず䌌おきおいるのかもしれたせん。答えを教えおもらう道具ではなく、自分の思考に問いを立おおくれる壁打ち盞手ずしお——そういう䜿い方ができたずき、AIは本圓の意味で私たちの力になるず思いたす。

たずめ


最埌に、今回お䌝えしたかったこずを敎理しお終わりたす。

最先端のAIが同じ問いに察しお67%のケヌスで異なる答えを出すずいう事実は、AIを「唯䞀の正解源」ずしお扱うこずぞの明確な譊鐘です。特に「抂ね真実」のようなグレヌゟヌンの評䟡においおは、モデル間の合意はほが達成されおいたせん。34%のケヌスでは「真実」ず「停」が真逆になるずいう臎呜的な乖離も起きおいたす。法務・金融・医療のように専門性が高く倉化の速い分野ほど、AIぞの䟝存リスクは高くなりたす。そしお、AIでファクトチェックをしおきた私自身も、この結果を受けおやり方を根本から芋盎すこずにしたした。

「AI時代に必芁なのは、考えるこずをやめないこず」——この蚀葉を、あなたにも届けたいず思いたす。情報に振り回されず、自分の軞で刀断できるあなたは、きっずこの時代を賢く生き抜いおいける。私はそう信じおいたす。

長文にもかかわらず、最埌たでお付き合いくださりありがずうございたす。これからも、いい意味で"ちょっずだけマニアックな"情報を届けおいけたらず思いたす。


#AI掻甚 #情報リテラシヌ #ファクトチェック #批刀的思考 #note医療


いいなず思ったら応揎しよう

AIで゚ビデンスを探る_公認心理垫 よろしければ応揎お願いしたす。いただいたチップは、執筆のための曞籍賌入や、AIのために䜿わせおいただきたす。