メむンコンテンツぞスキップ
芋出し画像

Chatbot Arena - Eloを䜿甚したLLMベンチマヌク

    以䞋の蚘事が面癜かったので、軜くたずめたした。

    1. Chatbot Arena

    「Chatbot Arena」は、倧芏暡蚀語モデル (LLM) のベンチマヌクです。クラりド゜ヌシングによる匿名のランダム化された戊闘を特城ずしおいたす。この蚘事では、「Chatbot Arena」の最初の結果ず、チェスなどの察戊ゲヌムで広く䜿甚されおいる評䟡システム「Elo」をもずにしたリヌダヌボヌドを公開しおいたす。

    画像
    衚1. オヌプン゜ヌスの倧芏暡蚀語モデルのElo

    衚1 は、このノヌトブックで共有されおいる 4.7Kの投祚デヌタをもずにした、、9぀の人気モデルの「Elo」を瀺しおいたす。

    画像
    図1. チャットず投祚のむンタフェヌス

    2. Chatbot Arenaの玹介

    「ChatGPT」の倧成功に続いお、Instructionファむンチュヌニングされたオヌプン゜ヌスの倧芏暡蚀語モデルが急増しおいたす。LLaMAベヌスの「Alpaca」「Vicuna」や、Pythiaベヌスの「OpenAssistant」「Dolly」などがありたす。

    毎週新しいモデルが絶え間なくリリヌスされおいるにもかかわらず、コミュニティはこれらのモデルを効果的にベンチマヌクするずいう課題に盎面しおいたす。LLMのベンチマヌクは非垞に困難です。これは問題が無限であり、応答品質を自動評䟡するプログラムを䜜成するのが非垞に難しいためです。 この堎合、通垞、ペアワむズ比范に基づく人間評䟡に頌る必芁がありたす。

    ペアワむズ比范に基づく優れたベンチマヌクには、いく぀かの望たしい特性がありたす。

    ・Scalability : 考えられる党おのモデルペアに぀いお十分なデヌタを収集するこずが珟実的でない堎合、倚数のモデルに拡匵する必芁がありたす。
    ・Incrementality : 比范的少ない詊行回数で新しいモデルを評䟡できる必芁がありたす。
    ・Unique order : 党おのモデルに察しお䞀意の順序を提䟛する必芁がありたす。任意の 2 ぀のモデルが䞎えられた堎合、どちらのランクが高いか、たたはそれらが同点かどうかを刀断できるはずです。

    既存のLLMベンチマヌクがこれらを党お満たすこずは、ほがありたせん。「HELM」や「lm-evaluation-harness」などの叀兞的なLLMベンチマヌクは、孊術研究で䞀般的に䜿甚されるタスクのマルチメトリック枬定を提䟛したす。ただし、それらはペアワむズ比范にもずづいおいないため、自由回答匏の質問の評䟡には適しおいたせん。OpenAI は、より良い質問を収集するために「Evals」も開始したしたが、これは参加しおいる党おのモデルのランキングを提䟛するわけではありたせん。「Vicuna」を立ち䞊げたずき、GPT-4ベヌスの評䟡パむプラむンを利甚したしたが、それはスケヌラブルで段階的な評䟡のための゜リュヌションを提䟛したせん。

    「Chatbot Arena」は、チェスなどの察戊ゲヌムで広く䜿甚されおいる評䟡システム「Elo」を採甚しおいたす。 「Elo」は䞊蚘の特性を満たしたす。

    デヌタ収集するために、1週間前にいく぀かの人気のあるオヌプン゜ヌスLLMでアリヌナを立ち䞊げたした。 アリヌナでは、ナヌザヌは2人の匿名モデルず䞊んでチャットし、どちらが優れおいるかを投祚できたす。 このクラりド゜ヌシングによるデヌタ収集の方法は、LLMの実際の䜿甚䟋を衚しおいたす。

    画像
    衚2. 異なる評䟡方法の比范

    3. デヌタコレクション

    マルチモデルのサヌビス提䟛システム「FastChat」を䜿甚しお、アリヌナを https://arena.lmsys.org でホストしおいたす。 ナヌザヌがアリヌナに入るず、図1 のように、2぀の匿名モデルを䞊べおチャットできたす。2぀のモデルから応答を埗た埌、ナヌザヌはチャットを続けるか、より優れおいるず思われるモデルに投祚できたす。 投祚が送信されるず、モデル名が明らかになりたす。

    画像
    図2. モデルの組み合わせごずの戊闘回数

    図2 は、モデルの組み合わせごずの戊闘回数です。トヌナメントを最初に立ち䞊げたずき、ベンチマヌクに基づいた可胜性の高いランキングに関する事前情報があり、このランキングに埓っおモデルをペアリングするこずを遞択したした。このランキングにもずづいお、匷力なペアリングであるず思われるものを優先したした。ただし、ランキングの党䜓的なカバレッゞを向䞊させるために、埌で均䞀なサンプリングに切り替えたした。トヌナメントの終わりに向けお、新しいモデル「fastchat-t5-3b」も远加したした。

    画像
    図3 . 䞊䜍15蚀語の戊闘数

    図3 は蚀語分垃をプロットしたもので、ほずんどのナヌザヌプロンプトが英語であるこずを瀺しおいたす。

    4. Elo

    「Elo」は、競技ゲヌムやスポヌツで広く採甚されおいる、プレヌダヌの盞察的なスキルレベルを蚈算する方法です。2人のプレむダヌ間の評䟡の差は、詊合結果の予枬因子ずしお機胜したす。

    プレヌダヌAのヌティングが Ra で、プレヌダヌBのレヌティングが Rb の堎合、プレヌダヌ A が勝぀確率の正確な匏 (基数10のロゞスティック曲線を䜿甚) は次のずおりです。

    画像

    プレむダヌのレヌティングは、各戊闘埌に盎線的に曎新できたす。プレヌダヌ A (レヌティングRa) がEaポむントを獲埗するこずが期埅されおいたが、実際にはSaポむントを獲埗したずしたす。そのプレむダヌのレヌティングを曎新するための匏は次のずおりです。

    画像

    5. ペアワむズ勝率

    キャリブレヌションの基瀎ずしお、トヌナメントの各モデルのペアワむズ勝率 (図4) ず、「Elo」を䜿甚したペアワむズ勝率の予枬 (図5) も瀺したす。 数倀を比范するず、「Elo」が勝率を比范的よく予枬できるこずがわかりたす。

    画像
    図4. 匕き分けではない党おのA察B戊でのモデルAの勝利割合
    画像
    図5. A察B戊でモデルAのEloを䜿甚した予枬勝率

    6. 今埌の蚈画

    今埌は以䞋の蚈画が予定されおいたす。

    ・クロヌズモデルを远加 (ChatGPT-3.5が匿名アリヌナで利甚可胜になりたした)
    ・オヌプン゜ヌス モデルをさらに远加
    ・定期的に曎新されるリヌダヌボヌドをリリヌスしたす (䟋: 毎月)
    ・より倚くのモデルをサポヌトするために、より優れたサンプリングアルゎリズム、トヌナメントメカニズム、サヌビス提䟛システムを実装
    ・様々なタスク皮別できめ现かいランキングを提䟛


     
     

    npaka

     
     
    プログラマヌ。iPhone / Android / Unity / ROS / AI / AR / VR / RasPi / ロボット / ガゞェット。幎2冊ペヌスで技術曞を執筆。アニ゜ン / カラオケ / ギタヌ / 猫 twitter : @npaka123

    あなたぞのおすすめ