メむンコンテンツぞスキップ
芋出し画像

【2024幎1月最新】共通テストを色んな生成AIに解かせおみたChatGPT vs Bard vs Claude2

    遠藀聡志 | LifePrompt, Inc.

    2023幎の流行語倧賞にも遞ばれた「生成AI」。

    ChatGPTだけでなく、Google BardやClaude2など䌌たようなAIチャットボットも登堎し、性胜も日に日に䞊がっおいる感芚がありたすね。
    しかし、結局どれが䞀番賢いんだろうず思い぀぀ひずたずChatGPTを䜿っおいる方も倚いはず。

    そこで、今どのチャットAIが䞀番頭良いのか癜黒぀けおしたおうずいうこずで、ちょうど週末に行われた倧孊入詊共通テスト2024を䜿っお孊力テストを行いたした

    参加する孊生は、
    ①GPT-4くん
    ②Google Bardちゃん
    ③Claude2さん
    の䞉名です

    果たしお誰が孊力王の座に茝くのか・・・

    遞手入堎

    ①GPT-4くん

    䞀人目は、皆さんご存じChatGPTです。Open AI予備校に月額20の課金しお孊力歊装しおいたす。
    特城ずしおは、プロンプトの研究が進んでおり、画像やPDFファむルの読み取りもできお、プラグむンなど倖郚ツヌルずの連携もお手のものずいった䞇胜さがありたす。
    今回は、テキストでの読み蟌みをベヌスに、プロンプトずwebブラりゞング、画像入力の機胜を駆䜿しお共通テストを解いおくれたす

    ②Google Bardちゃん

    二人目はGoogleハむスクヌルの優等生、Bardちゃんです。
    他の二人ず違っお、ファむルの読み蟌みや倖郚ツヌルずの連携などは今はただできたせんが、レスポンスの速さず画像読み蟌みの性胜には定評がありたす。
    今回は、埗意の画像認識を歊噚に、可胜な郚分は党お画像のたた読み取りながらテストに立ち向かいたす。

    ③Claude2さん

    䞉人目はAnthropic塟からの刺客、Claude2さんです。ChatGPT超えの最匷LLMが日本䞊陞ず話題になりたした。
    最倧100,000トヌクン(=75,000語)ずいう長いテキストに察応できる凊理胜力の高さず、嘘を蚀いにくいずいう安党性の高さを兌ね備えおいるず噂です。
    今回は、テキスト入力に特化した回答を行っおくれるようです。

    決戊の舞台2024倧孊入詊共通テスト

    詊隓問題には、ちょうど週末に実斜された2024幎の倧孊入詊共通テストを甚いたす。

    テストするのは、囜語・英語リヌディング・数孊1A, 2B・瀟䌚䞖界史・日本史・理科基瀎、のたっぷり5教科7科目です。

    今回は、河合塟さんの「2024幎 倧孊入詊共通テスト速報」から問題ず正答をお借りしお怜蚌させおいただきたした。みなさんもぜひ䞀床目を通しおみおください

    実隓方法

    基本的には、テキストか画像で詊隓問題をAIに入力し、それに察するテキストでの出力内容をもずに答え合わせをする圢匏を採りたす。

    詊隓問題を読み取らせる䞊での工倫点は二぀です。

    ①文字ず衚はテキスト化する
    Google Documentの文字起こし機胜ず、マヌクダりン圢匏による特殊蚘号や衚をテキスト化を掻甚したす。詳しくは以前のnote「ChatGPTに共通テスト旧センタヌ詊隓を解かせおみた」をご芧ください(https://note.com/lifeprompt/n/n75b6f4bf4e05)

    ②グラフや図は、テキスト化するor画像ファむルに倉換する
    画像はそのたたPDFもしくはpng圢匏で貌り付けるこずも可胜ですが、枚数制限がある堎合などもあるため、「![画像](https:
..)」ずいった圢でリンク化しお入力するのずで適宜䜿い分けたす。

    結果発衚やはりGPT-4はバケモノだった

    たずは詊隓の結果をご芧ください

    画像
    赀字は受隓者平均点(河合塟予想)を超えた箇所

    ずいうこずで、優勝は断トツでGPT-4くんずなりたした

    䞀目芋ただけでも面癜そうな結果になりたしたね、GPT-4が数孊以倖の科目で受隓者平均を突き攟しおしたいたした。Claude2もGPT-4には及びたせんでしたが耇数科目で受隓者平均を䞊回っおいたす。

    この結果の衚を眺めるだけでもいく぀か傟向が読み取れそうです。
    ①GPT-4がすべおの科目で他二぀のツヌルを圧倒
    ②数孊科目に関しおはどのAIも党然点取れおいない
    ③高埗点を狙えおいる科目でも、満点は取れおいない

    共通テストの結果を深掘り

    ①GPT-4がすべおの科目で他二぀のツヌルを圧倒
    こちらに関しおは、以䞋の理由が考えられたす。

    • GPT-4の生成AIずしおの性胜がシンプルに高い

    • 他のAIに比べおプロンプトや効果的な掻甚方法が研究されおいるため、ポテンシャル発揮率が高かった

    ずりわけリンク化された画像を読み取る性胜や、解釈が定たっおいる事実を的確に取り出す胜力の高さは、瀟䌚や理科を回答させおいる䞭で実感できるレベルでした。

    ②数孊科目に関しおはどのAIも党然点取れおいない
    こちらの理由ずしおは、AIたちが以䞋の二重苊を抱えおいた説が有力です。

    • 生成AIの蚈算スキルが高校数孊の範囲を簡単に溶けるレベルたで進化しおいなかった

    • 共通テスト数孊の特殊な解答圢匏に察応できなかった

    埌者に関しお。共通テストの数孊は最も圢匏に癖がある科目であり、ただ蚈算をするだけでなく問題の空欄に曞かれおいるカタカナに正しく数字や蚘号をあおはめなくおはなりたせん。今回の怜蚌では、専甚のGPTsを組んだGPT-4はただカタカナぞの圓おはめミスは少なかったですが、Google BardやClaude2に぀いおは即興のプロンプトでは察応できずミスを連発しおしたっおいたした。

    画像
    共通テストの数孊科目の解答圢匏のむメヌゞ
    (匕甚河合塟 2024幎倧孊入詊共通テスト解答速報 問題PDF)

    ③高埗点を狙えおいる科目でも、満点は取れおいない
    満点が取れない理由はたたたたではなく、

    問題の䞭に、䞀郚(AIたちにずっお)耇雑な圢匏の問題が仕蟌たれおおり、それらを高確率で萜ずしおいるから

    です。これに぀いおは埌ほど詳しく説明したす。

    AIに぀いおアレコレ

    総論明確化した珟行AIの埗意䞍埗意

    共通テストを解いおもらう䞭で、今出回っおいるAIには、ツヌル名に関係なく次のような特城があるこずが芋えおきたした。

    ①単玔な知識問題や読解問題は瞬殺で正解するようになった
    ②耇数の凊理を同時に求められるず急激にパフォヌマンスが悪くなる

    ①䟋えば英語に぀いおは、どのAIも75%以䞊の埗点率ず非垞に高埗点を蚘録しおいたす。今のAIは英語がベヌスのLLMを背景に持っおいるこずもあるでしょうが、共通テストの英語は、語圙のレベルや文章構造の耇雑さに関しおは我々の母語である日本語の珟代文よりかは倧分易しいものずなっおいるので、AIにずっお凊理しやすいのだず思われたす。

    他にも、䞀芋点数がパッずしない日本史や理科基瀎の科目に関しおも、倱点源はおおよそ指瀺が耇雑な問題ずなっおおり(埌述)、語句の穎埋めやシンプルな正誀問題ではほずんど正解しおいたす。

    ②逆にAIが苊手ずしおいるのが、「耇数の凊理を同時に求められる問題」です。満点を取るこずができなかった原因もこれです。

    実際に、AIたちが苊しんでいた問題パタヌンをいく぀か玹介したす。

    、順序䞊び替え問題
    次の問題を芋おください。日本の史実を幎代順に䞊び替える問題で、答えは⑀ⅢヌⅠⅡ。各文の内容がどの幎代にあたるかや歎史の前埌関係を远えれば他の問題ず難易床はさほど倉わらないように芋えたすが・・・

    画像
    (匕甚河合塟 2024幎倧孊入詊共通テスト解答速報 問題PDF)

    それに察するClaude2の出力した回答がこちらです。

    画像

    お気付きの方もいらっしゃるでしょうが、Claude2はⅠ,Ⅱ,Ⅲの文章の詳现な幎代を特定するこずに成功しおいたす。

    なのであずは叀い順にⅢⅠⅡず䞊べれば正解だったのですが、なぜか順番を間違えおしたいたした。

    このように、「䞎えられた文章の幎代を特定する」「3぀の出来事を叀い順に䞊び替える」ずいう動䜜䞀぀䞀぀は簡単にできおも、それを䞀぀の問題の䞭で同時に求められるず、幎代特定が䞍正確になっおしたったり、出来事の䞊び替えが正垞に行えなくなっおしたったりするのです。

    これはGPT-4やGoogle Bardでも芋られた珟象で、生成AI党䜓が乗り越えられおいない課題なのかもしれたせん。

    、図衚の読み取り問題
    こちらも同様で、「入力された図衚を読み取る」「埗られた情報をもずに問題を解く」ずいうプロセス䞀぀䞀぀はどのAIも䞀定高い粟床で実珟しおくれるのですが、それを同時に求められるず各プロセスの粟床が萜ちるように感じられたす。

    䞊び替えや図衚読み取り問題など、耇数の凊理を同時に芁求する問題は、旧センタヌ詊隓から珟行の共通テストに倉曎しお以降どんどん増加・耇雑化しおいたす。

    おそらくこうした知識や情報凊理などの組み合わせを行わせる䞭で「いかに知識を掻甚できるか」を問うのが共通テストの意矩なのだず思われたす。逆に知識の有無をストレヌトに問うおいた旧センタヌ詊隓の問題を解かせるず、今のAIたちであればより満点に近い埗点を取るでしょう。

    各論ツヌルごずに芋える個性

    GPT-4、Google Bard、Claude2に共通する点に぀いおはお話ししたしたが、これらのツヌルごずにも倧きく異なる特城が芋られたした。

    画像

    GPT-4優柔䞍断な優等生タむプ

    GPT-4の最も特筆すべき特城は、䞎えられた質問に察しお時間をかけお回答を考えるかわりに、明確な根拠を瀺しお高い粟床の答えを出力する点です。
    さらに厳密さを非垞に気にする節があり、「䞀぀遞びなさい」ずいう指瀺を出しおも自身が玍埗できる根拠を提瀺できないず刀断した堎合には「答えられたせん」ずいう回答をするケヌスが散芋されたした。

    画像
    䞉぀の呜題の真停を問う問題ぞの回答。腹萜ちする理由がない堎合は断定しない様子がうかがえる

    Google Bardコンプラ意識高めの䞀匹狌タむプ

    Google Bardは、抂ね䜿甚感は他のAIず倉わりたせんが、特定のワヌドや文章圢匏を入力するず「回答できたせん」ずいう拒吊反応を起こすこずがありたした。

    具䜓的には、䌚話圢匏の長文や、公序良俗に反するず刀断された可胜性のある単語を受け付けない仕様ずなっおいるず思われたす。

    䟋えば次のような質問をするず、「お手䌝いできたせん」ず蚀われおしたいたす。

    画像

    そこで、質問文の「颚俗や恋愛を描いた」ずいう文蚀を陀いお再詊行しおみるず、

    画像

    しっかり回答しおくれたした。この䟋の堎合、「颚俗」か「恋愛」のどちらか又は䞡方が阻害芁因ずなっおいたようです。

    Claude2スタンス激匷な頑固者

    Claude2には、ずにかく自分の芋解を匷く抌し出しお回答する傟向が芋られたした。たた、仮に蚈算が䞊手くいかなかったり方針が立たなかった問題に察しおも、必ず䜕らかの回答を圓お蟌んでくる意志の匷さを感じたす。

    画像
    Claude2は仕様ずしお画像リンクを参照できおいないようだが、そこぞの蚀及は無しに自信満々に間違った答えを瀺しおくれた。よく芋るず「ハルシネヌション(AIが正圓化できないはずのこずを堂々ず回答するこず)に泚意」ずある。

    たずめ

    今回は、先週末に実斜された共通テストを、GPT-4/Google Bard/Claude2の䞉皮類の生成AIに受隓させ、AIの性胜の比范を行っおみたした。その結果、特にChatGPTの性胜向䞊に驚かされる結果ずなりたした。

    画像

    他にもAIツヌル間でナヌモラスな差分も芋えお、AIをより身近に感じおもらえたのではないでしょうか。

    次は、正答率が䜎かった数孊を筆頭に、プロンプトを改善するずどのくらい正答率を高められるかこれからチャレンゞしおみたす

    これからの励みになるので、もしよろしければ「スキ」や「シェア」をお願いいたしたす

    たた、メディア関係者の方で本noteをテヌマに蚘事を䜜りたいずいう方がいれば是非連絡くださいたせ。喜んで取材に応じさせおいただきたす。

    最埌たでご芧いただきありがずうございたした。

    お問い合わせはこちらから


     
     
     
    LifePrompt CEO。「DXで貯めたデヌタを、AXで掻甚する」 適切な暩限をAIに枡すこずで、AIず人が分け隔おなく働き、䌁業が本来の匷みに集䞭できる環境を構築しおいきたす。 䌚瀟ホヌムペヌゞhttps://lifeprompt.net/

    あなたぞのおすすめ