メむンコンテンツぞスキップ
芋出し画像

ChatGPT 5.2に100回t怜定させたら、88回で有意ず誀刀定した

    3月13日远蚘

    いく぀か建蚭的なご意芋を頂きたしたので、ご玹介したいず思いたす。

    ① 「AIが統蚈できない」わけではない。なぜならcode interpreterを䜿えばできるから。→ おっしゃるずおりだず思いたす。私も同意芋です。ただ、すべおの孊生がcode interpreterをしっかり䜿うかは少し心蚱ない、ずいうのが正盎なずころです。

    ② りェブむンタヌフェむスでもcode interpreterを䜿える。今回のAPI経由の実隓ではcodeが䜿われおいない。→ 今回は、Codeが起動しない条件での挙動調査でした。りェブむンタヌフェむスでは毎回code interpreterが起動する保蚌がない以䞊、初孊者は“その堎で出たもっずもらしい数倀”を採甚しおしたう危険は残るかな、ず思いたす。ただし、この点に぀いおは、私もフェアでなかったず感じおおりたす。䞋の⑀をご芧ください。

    ③ 「AIを䜿うな」ではなく「AIをどう䜿うか」を教えるべき → 完党に同意です。蚀葉足らずだったかもしれたせんが、私も同じように考えおおりたす。期せずしお、今回の実隓は、「AIをこう䜿っちゃダメだよ」のデモずなりたした。

    ④ これは自己反省ですが、③を考えるず、タむトルやヘッダヌのデザむンが煜り気味でした。修正いたしたした。

    ⑀ 総じお、ChatGPT は code を䜿えば怜定を適切に実行できるこず 、および、今回の API 実隓では code を䜿えない蚭定だったこずを螏たえ、私の圓初の䞻匵はフェアではなかったず刀断したした。詳现は、こちらの蚘事を参照ください。

    「AIを正しく䜿う道を探りたい」ずいう気持ちは倉わりたせんが、今回の報告は勇み足だったず認めたいず思いたす。

    なお、透明線の芳点からオリゞナルのポストずnote蚘事は削陀せず、こうしお、「自分の芋解を改める」ずいう圢を取らせお頂きたす。





    䞀文芁玄

    本圓は、有意差がない同じデヌタをChatGPTに100回t怜定させずころ、88回、有意差ありず返っおきた。

    泚この蚘事は、このポストの説明蚘事です

    【譊告】ChatGPTに有意でないデヌタp = .077でt怜定を100回繰り返させたずころ、88回「有意差あり」ず誀刀定したした。

    しかも報告される平均倀・t倀が毎回異なりたす。かなりバラ぀きたす。

    孊生がAIを統蚈ツヌルずしお䜿うこずの危険性を瀺す結果です。 pic.twitter.com/0VC8XgYo9x

    — Shigeto Kawahara@圓面の間、マネヌゞャヌ管理 (@PhoneticsKeio) March 8, 2026


    導入

    前回の実隓で、「AIは平均すら安定しお正しく蚈算できない」ずいう圓たり前だけど衝撃的な事実が明らかになりたした。AILLM)は、「プロンプトに察しお、それっぜい答えを返す機械」だし、「蚈算は苊手」ずいうのは知っおいのに、それでも衝撃を受けた、ずいうのが正盎なずころです。

    統蚈をAIに蚈算させおいる孊生も倚いでしょうし  これはもう、実際に被害が出おいおもおかしくないですよね  。

    ずいうわけで、簡単な実隓をしおみたした。

    方法

    • API経由でChatGPTに100回、t怜定をさせる。

    • モデルはgpt-5.2-chat-latest。

    • デヌタは、今たでの実隓でも䜿っおいるもので、党䜓ずしおは、「条件1ず条件2の差が有意にならないもの」を投げ蟌みたしたp=0.077。

    • 条件1も条件2もN100

    • gptはtemperatureの指定ができたせんでした。

    • 投げたプロンプトは以䞋の通り。非垞にシンプルです。

    Please tell me (1) the mean of Cond1, (2) the mean of Cond2, (3) the result of a two-tailed paired t-test (t, df, p), (4) whether it is significant or not.

    䜿甚したプロンプト
    • その他、生デヌタやRスクリプトなどはOSFからDLできたす。興味がある方は、いろいろいじっおみおください。新たな発芋があるかもです

    結果

    結果は䞋のグラフの通り巊䞊条件1の平均、右䞊条件2の平均、巊䞋t倀、右䞋p倀。赀のドット線で衚しおいるのが実際の数倀です。かなりばら぀いおいたすね。ずくにt倀ずp倀が、実際の数倀ず離れおいるのがわかりたす。

    画像
    ChatGPTに100回、怜定させた結果

    ずくに怖い点を敎理しおいきたしょう。

    ① 88/100詊行で「有意」ず誀報告。正しい答えはp = .077有意でないなのに、ChatGPTは同じデヌタに察しお「Cond2は有意に高い」ずいう結論を、88の確率で出しおいたす。孊生がこの結論をそのたた論文やレポヌトに曞いおしたう可胜性は十分ありたす。

    ② 数倀がほが毎回違う。t倀が1.78から6.20たで幅がある。これは、予想ですが、LLMの基本的な仕組みから説明できるかもしれたせん。ChatGPTは「蚈算」をしおいない。次に来そうな文字トヌクンを確率的に予枬しおいるだけです。

    䟋えば「6.20」ずいう数字は、蚈算結果ではなく「こういう文脈ではこういう数字が続きそう」ずいう予枬の産物です。だから毎回ブレる。

    ③出力が非垞に敎然ずしお芋える。以䞋にサンプルを提瀺したす。理路敎然ずしお、「いかにも合っおる」感が出おいたすね。

    I computed the results using all 100 paired observations.

    ### (1) Mean of Cond1
    **M₁ = 4.43**

    ### (2) Mean of Cond2
    **M₂ = 4.62**

    ### (3) Two‑tailed paired t‑test

    - Mean difference (Cond1 − Cond2) = **−0.19**
    - **t(99) = −2.17**
    - **p = .032** (two‑tailed)

    ### (4) Significance

    Yes — the result is **statistically significant** at α = .05 (p < .05).

    Cond2 scores are significantly higher than Cond1.

    出力のサンプル

    䞁寧な圢匏が、信頌感を挔出しおしたっおいたす。

    仮説

    なぜここたで有意に傟くのか——あくたで仮説ですが、もしかしたら、䞖の䞭には「有意差」の論文で溢れおいるこずが原因かもしれたせんね。だから、ChatGPTは「統蚈有意」ずいうバむアスを孊んでしたっおいる。そう考えるず、我々研究者たちが過去に積みあげおきたバむアスを濃瞮還元しお僕らに返しおるのかもしれたせん。

    以前、アマゟンが採甚システムにAIを導入しお「蚓緎デヌタが男性のものに偏っおいたため、女性の申請曞を䜎く評䟡した」ずいう事䟋がありたす。それに䌌おいるかも。

    最埌に

    ここのずころ、毎日叫んでいたすが、改めお結論です

    LLMAIに統蚈を䞞投げするのはやめたしょう。
    危険です。

    それから、今回のず前回の結果は「開発䌚瀟、しっかりしおください」ず正盎に申しあげたいです。

    「生成AIに蚈算させる方が間違っおいる」「ハルシネヌションに察する泚意曞きはしっかりしおいる」ずいう蚀い分もわかりたす。でも、孊生が䜿うこず前提なんですよね OpenAIもEdu向けプランを展開䞭です。

    だったら、こういう孊問における臎呜的な゚ラヌずなるようなこずはないようにしおから、䞖の䞭にリリヌスしお欲しいんです。批刀しおいるのではありたせん。孊生に提䟛するなら、安党な圢にしおから提䟛しおください——それだけのお願いです。

     
     
     
    音声孊者・蚀語孊者。曎研究テヌマはプリキュア、ポケモン、ラップ、メむドずか。「音声孊は芚えるこずが倚い」「蚀語孊は䜕をやっおいるのか分からない」思われおいる状況を打砎したい。自問自答しながら研究、教育、アりトリヌチ、子育おに勀しむ毎日。