
OpenAI-o1が日本の理学療法士国家試験に挑戦
📖 文献情報 と 抄録和訳
理学療法士国家試験におけるOpenAI-o1とGPT-4oの性能評価
📕Sawamura S, Kohiyama K, Takenaka T, et al. (January 06, 2025) An Evaluation of the Performance of OpenAI-o1 and GPT-4o in the Japanese National Examination for Physical Therapists. Cureus 17(1): e76989. https://doi.org/10.7759/cureus.76989
🔗 DOI, Google Scholar 🌲MORE⤴ >>> Connected Papers
※ Connected Papersとは? >>> note.
[背景・目的] 近年、大規模言語モデル(LLM)の進歩により、医療およびヘルスケアの現場での応用が広がっている。LLMは、医療従事者向けのさまざまな国家試験において高い性能を発揮している。Open Artificial Intelligence Model Version 1(OpenAI-o1)は医師国家試験で顕著な精度を達成し、Generative Pre-trained Transformer Model Version 4(GPT-4o)は画像ベースのタスクで優れた結果を残しており、両モデルの補完的な関係を示唆している。しかし、理学療法分野、特に日本理学療法士国家試験における両モデルの性能については、まだ十分に理解されていない。本研究では、2024年の第59回理学療法士国家試験(JNEPT)におけるOpenAI-o1とGPT-4oの性能を評価することを目的とした。
[方法] テキストのみの質問168問をOpenAI-o1に、画像ベースの質問23問をGPT-4oに、ゼロショットプロンプト形式で実施した。 正確性は、厚生労働省が公表した公式の正解とモデルの出力とを比較することで評価した。 生成されたすべての説明文について、理学療法士国家試験に詳しい教員2名が正確性をレビューした。
✅ ゼロショットプロンプトとは?
・ゼロショットプロンプトとは、AIモデルに追加の具体例や事前説明を与えず、直接質問やタスクを投げかけて回答を求める手法。
・たとえば「次の文章を要約してください」といった形で、具体的な例なしで指示を与えます。
・この方法は、モデルが事前のトレーニングデータから学んだ知識を元に答えを出すため、柔軟かつ効率的。
・ただし、複雑なタスクの場合、回答精度が下がる場合もある。
[結果] OpenAI-o1は、正解率97.0%(163/168問)、説明精度86.4%(146/168)を達成した。一方、GPT-4oは、正解率56.5%(13/23問)、説明精度52.2%(12/23)だった。OpenAI-o1の主な説明エラーは、時代遅れまたは不正確な知識(13問)、単純化しすぎた議論(6問)、質問の意図の誤った解釈(3問)でした。GPT-4oの最も一般的なエラーの種類は、画像分析の難しさによる質問の意図の誤った解釈(8問)で、知識レベルの不正確さも3件あった。

ChatGPT4.0のテキストのみの問題の正答率は80.5%だった。
[結論] OpenAI-o1は、高い精度と確かな説明品質を示し、理学療法における一般的な内容と専門的内容の両方に対して高い適応性を示した。また、医療教育や遠隔医療サポートにおける潜在的な有用性も示した。GPT-4oは、以前のモデルと比較してマルチモーダル機能が強化されているものの、画像に基づく推論と分野特化型のトレーニングについては、さらなる最適化が必要である。これらの結果は、ヘルスケアおよび医療教育におけるLLMの有望な役割を強調する一方で、臨床および教育環境における厳格な要求を満たすために、継続的な改良の重要性を浮き彫りにしている。
🌱 So What?:何が面白いと感じたか?
以前、『ChatGPT4.0が日本の理学療法士国家試験に挑戦』というテーマで文献抄読をした。
その論文において、ChatGPT4.0のテキストのみの問題の正答率は『80.5%』だった。
今回、その新たなモデル、OpenAI-o1におけるテキストのみの問題の正答率は驚異の『97%』だったのだ。
正直なところ、80.5%と聞いたときは、「まぁまぁまぁ・・・。」と思っていた。
だが、今回97%と聞いたときには、「・・・。」言葉を失ってしまった。
このくらい精度が高まってくると、やはり使わない、という選択肢はないように思える。
歴史を紐解けば、いつだって、人間は道具によって自己拡張をしてきたのだ。
かつて徒歩で数日〜1週間ほどかけて東京→大阪を行き来していたのが、今は『新幹線』という道具で数時間で着く。
かつて行くことができなかった深海に、『潜水艦』という道具を使って潜る。
かつて目の前にある本でしか調べられなかった知識を、『インターネット』という道具を使って世界中から知識を集める。
そして、生成系AIは人間における『思考』を拡張しうるものだ。
新幹線で移動時間が短くなったからこそ生まれた新たな価値があるように、生成系AIを活用することによって生まれる新たな価値があるのではないだろうか。
時代に引っ張られるように生きるのではなく、時代の先頭まで突っ走って、むしろ突き抜けるようにして新たな価値を作りたいものだ。
諸君はこの時代に
強ひられ率ひられて
奴隷のやうに忍従することを欲するか
むしろ諸君よ
更にあらたな正しい時代をつくれ
宮沢賢治『生徒諸君に寄せる』
⬇︎ 関連 note & 𝕏での投稿✨
📕OpenAI-o1が日本の理学療法士国家試験に挑戦
— 理学療法士_海津陽一 Ph.D. (@copellist) January 12, 2025
・2019年~2023年までのPT国家試験🇯🇵
・OpenAI-o1により回答を生成
OpenAI-o1は,
🔹文字のみの問題正答率『97.0%』
🔹解説の説明精度は86.4%
※以前の研究より, ChatGPT4.0の正答率は80.5%
正答率97%は驚愕です❗️精度は日進月歩していますね😲 https://t.co/NlDgFcyCUt pic.twitter.com/NtEj66hjt2
○●━━━━━━━━━━━・・・‥ ‥ ‥ ‥
良質なリハ医学関連・英論文抄読『アリ:ARI』
こちらから♪
↓↓↓

‥ ‥ ‥ ‥・・・━━━━━━━━━━━●
#️⃣ #理学療法 #臨床研究 #研究 #リハビリテーション #英論文 #文献抄読 #英文抄読 #エビデンス #サイエンス #毎日更新 #最近の学び