見出し画像

【2025年最新】AIツール・ランキングサイト4選|②LLMチャットボットをプロンプト別にベンチマーク!『Chatbot Arena』徹底解説

こんにちは。STUDIO55技術統括の入江です。
前回は、AI モデル を客観的に比較・分析できる注目のウェブサイト『Artificial Analysis(アーティフィシャル・アナリシス)』をご紹介しました。
“とにかくスゴイ” とされがちな AI の世界で、何がどうスゴイのか、本当に注目すべき AI はどれなのか──そうした本質をつかむヒントを、具体的に得られたのではないかと思います。

複雑で全体像がつかみにくい AI プラットフォーム を、このように整理・可視化する評価サイトは、まさに「AI の民主化」を支える重要な存在といえます。

今後、AI 技術 について確かな知見を持つことは、一般ユーザーにとっても不可欠なリテラシーとなり、企業が AI を選定・導入する際にも、明確な評価基準に基づく判断が求められます。

「Artificial Analysis」は AI 評価 の “総合サイト” 的存在ですが、それだけ見ていれば安心…というわけではありません。実は、評価の切り口を変えるだけで、見えてくる AI の姿は変わります。

それぞれ違ったアプローチで AI を評価するサイトを知っておくことは、AI との付き合い方を深めるうえでのヒントになります。こうした “評価フレームワーク” を横断的に見ていくことで、AI を「なんとなくスゴい」から「だから使える」へと、理解が一段階レベルアップしていくはずです。

そこで 今回ご紹介するのは、ChatGPT や Claude など、AIチャットボットに特化して評価を行っている専門サイト『Chatbot Arena(チャットボット・アリーナ)』です。

このサイトの注目すべきポイントは、単なる性能比較だけにとどまらず、使用されたプロンプトをカテゴリ別(P2L)に分類し、分野ごとの “強み” がひと目でわかるリーダーボードが用意されている点です。
どの AI が、どんなタイプの問いに強いのか──そんな実践的な比較が、視覚的に把握できます。

この「見方」を知っておくだけで、AI を使うときの判断軸が大きく変わるはずです。
今回は、その活用ポイントを詳しく解説していきますので、ぜひ参考にしてみてください。


🤖Chatbot Arena(チャットボット アリーナ)


近年、ChatGPT、Claude、Gemini、Llama、Qwen3、そしてイーロン・マスク氏の Grok など、高性能な AI チャットボット が続々と登場し、
「結局、どの AI が一番スゴいのか?」という議論が、世界中でヒートアップしています。

そんな中、ユーザー自身の手で “どの AI が一番賢いのか?” を公平に見極めようとする動き にも注目が集まっています。
その代表的な試みが、AI 同士を対戦形式で比較できる評価サイト『Chatbot Arena(チャットボット・アリーナ)』です。

画像参考 : lmarena.ai

前回ご紹介した「Artificial Analysis(アーティフィシャル・アナリシス)」では、対戦型のバトルアリーナ形式が「画像生成」や「動画生成」の分野では採用されていましたが、「LLMランキング」に関しては異なるアプローチが取られており、ベンチマークスコアや出力速度といった定量データに基づく評価が中心でした。

それに対して『Chatbot Arena(チャットボット・アリーナ)』は、単なるベンチマークツール ではなく、ユーザーが 2つの LLM と実際に会話し、「どちらが優れているか」をその場で投票できる対話型バトル形式 を採用しています。この形式によって、ユーザーが チャット AI の違いや強みをダイレクトに体感できる のが大きな特徴です。

じつは、この “アリーナ形式” 自体、Chatbot Arena が先駆的に大規模展開した手法 であり、Artificial Analysis はその成功事例を踏まえて登場した派生的な取り組み、あるいは類似のコンセプトを独自に発展させたプロジェクト と位置づけることができます。

こうした背景から、『Chatbot Arena』の ユーザーの体験に基づく “生の評価” が集まる参加型評価システムのアリーナから得られるリーダーボードは、まさに “AI を読み解く宝庫” です。
このリーダーボードは、各 AI モデル の実力を実践的な視点で理解するうえで非常に有効であり、目的に応じて AI を適切に活用するための確かな手がかりとなるでしょう。

📌Chatbot Arena(旧LMSYS)とは?


『Chatbot Arena』は、もともと LMSYS コミュニティ および プロジェクト の一環として立ち上げられ、当初は LMSYS ブランド の一部として展開されていました。
しかし、その後よりユーザーに分かりやすく、かつ用途を明確に伝えるために、"Chatbot Arena" という名称に改名され、独立したブランドとして展開されています。

LMSYS(Large Model Systems Organization) は、カリフォルニア大学バークレー校などの研究者たちによって設立された、大規模言語モデル(LLM)の研究・評価を目的としたオープンなプロジェクトチームです。

この組織は「LLMを誰でも使える形にする」「LLM同士を公平に比較する」ことを目的に、Chatbot Arena 以外にも 以下の主要プロジェクトを開発しています

🦙 Vicuna(ビクーニャ)


Vicuna(ビクーニャ)は LMSYS が自ら開発したモデルで、ローカル環境にインストールすれば、自分専用の Vicuna チャットボット を構築することが可能です。

● LMSYS が開発した オープンソースの高性能チャットボット。

● Meta の LLaMA モデル をベースに、ユーザー公開データ(ShareGPT など)でファインチューニング。

● ChatGPT に近い対話能力を持ち、「オープン界隈のChatGPT」として人気。

👉 Vicuna(ビクーニャ)は、南米アンデス地方に生息するラクダ科の動物(アルパカの近縁種)の名前です。その毛は非常に柔らかく高価で、「世界一高級なウール」とも言われます。

画像参考 ; stock.adobe.com
ビクーニャの参考画像

LMSYS のモデル「Vicuna」は、おそらく「洗練された軽量なモデルでありながら高性能」であるというイメージをこの動物から借りて命名されたと考えられます(他にも LLaMA=リャマ、Alpaca=アルパカなど、動物シリーズが続いています)。

🚀 FastChat(ファストチャット)


FastChat は、Chatbot Arena の裏側を支える「インフラ」であり、Vicuna を動かすための「エンジン」=フレームワーク でもあります。

● LMSYSが開発した LLMを実行・ホスティング・比較するためのフレームワーク。

● Chatbot Arenaの基盤にも使われており、Vicunaなどのモデルをローカルやクラウドで動かすのに適したシステム。

● Web UIつきで、GPT風のチャットが可能。誰でも自分のVicunaチャットボットを立ち上げられる。

このように、LMSYS は LLM の開発者、評価者、ホスティング基盤 の提供者という 3つの役割 を果たしており、オープンな LLM エコシステム の発展に大きく貢献している存在です。

❓ なぜ評価が AIチャットボット に不可欠なのか?

AIモデルの性能評価は、これまで専門家によるベンチマーク(例えば MMLU や MT-Bench など)に依存してきました。しかし、Chatbot Arena の登場によって、一般ユーザーの「生の声」による評価が大規模に収集されるようになりました。これは、AI の使いやすさや実用性を評価するうえで極めて重要な視点です。

また、オープンソースの AI モデル が商用モデルと互角以上に戦う姿が可視化されることで、LLM開発のオープン化・民主化の流れを後押ししています。

🎯評価3本勝負!


Chatbot Arena の優れた点は、3つの視点からの評価方法 を通じて、対話型AI の実力を可視化していることです。
これらの視点は非常に興味深く、多角的な比較を可能にしています。

具体的には、以下の3つのモードが用意されています。

  1. アリーナ(バトル):匿名で2つのモデルが対戦し、ユーザーが優れた応答を選ぶ形式

  2. アリーナ(サイドバイサイド):モデル名を表示しながら、複数モデルの応答を横並びで比較

  3. ダイレクトチャット:特定のモデルを指定して、単独で会話を体験

⚔️アリーナ(バトル)-Arena(battle)


「ブラインド評価」での対戦「アリーナ(バトル)」です。
ユーザーは、どちらの回答がどの AI によるものかを知らされないまま、純粋に回答の内容だけで優劣を判断します。

例えば、質問「AIの倫理的課題について教えてください」に対して、左と右にそれぞれ異なるAIの回答が表示され、「どちらがより優れているか」をクリックで選びます。回答元が ChatGPT か Claude か、Mistral か Gemini かは明かされません。

この方式により、ブランドバイアスを排除した「民主的」な評価が可能になっています。

⚔️アリーナ(サイド バイ サイド)-Arena(side-by-side)


「アリーナ(サイド バイ サイド)」では、今度は ブラインドではなく、任意に選択したモデル同士で対戦させます。

「モデルA」「モデルB」の項目に、101もの数あるモデルから選択したモデルで対戦させ、勝負が決まるまで何ターンもチャットを続けます。

画像参考 : 「比較する2つのモデルを選択してください」より

🏔️ダイレクトチャット- Direct Chat


「ダイレクトチャット」では、101種類もの大規模言語モデル(LLM)を自由に選んで、1対1で対話を試すことができます。モデルごとの出力のクセや回答の質をじっくり見比べられるので、新しいモデルのチェックやプロンプト調整にもぴったりです。
Grok や Meta の LLaMA など、気になる話題のモデルもここで試せるので、性能を比較したいときにとても便利です。

📊「P2L」で分かる、単なるスコア以上の“実力”


Chatbot Arena では、モデル同士の比較や評価結果の可視化においても、ユニークで実用的な 3つの仕組み が用意されています。
これらは単なるランキング表示にとどまらず、対話AIを深く理解する手がかりにもなっています。

  1. リーダーボード(Leaderboard)
    人気モデルがランキング形式で一覧表示され、全体の傾向が一目で分かります。

  2. リーダーボードへのプロンプト(Prompt-to-Leaderboard)
    実際のユーザーが使用したプロンプトを選んで再試行でき、モデルの応答を体感的に比較可能です。

  3. アリーナエクスプローラー(Arena Explorer)
    プロンプトごとの評価結果を詳細に掘り下げられ、どのモデルがどのように評価されたかを可視化できます。

これらの機能により、Chatbot Arena は「どのAIが優れているのか?」という問いに、単なる数字以上の深い洞察を提供しています。

🏆 リーダーボード(Leaderboard)


Chatbot Arena の「リーダーボード」では、世界中のユーザーが参加したアリーナバトルの結果 が可視化されます。

モデルの性能を多角的に評価するために、更に "9つの分析タブ" が用意されており、「概要」「価格分析」などの基本的な視点に加え、開発タスクに特化した以下のような コンテスト結果 も確認できます。

リーダーボード の9つのタブ
  • WebDev Arena:Web開発の実践的課題でAIモデルがリアルタイムに競い合う、AIコーディングバトル。

  • Copilot Arena:Visual Studio Code 拡張として提供されるAIツール(コード補完・生成・説明・修正など)の開発支援能力を比較するランキング。

これらの可視化により、ソフトウェア開発者や機械学習エンジニア、技術評価者にとって、モデルの性能を具体的かつ実践的な文脈で把握できる、非常に有益なリソースとなっています。

画像参考 : Copilot Arena

🎯 リーダーボードへのプロンプト(P2L)


「プロンプト別リーダーボード」には、例としてプロンプト が並んでおり、それを再利用してテストすることができます。

ここで注目すべきは、「P2L エクスプローラー」です。

「P2L(Prompt-to-Loss)」は、LMSYS と同じ カリフォルニア大学バークレー校の研究者チームによって開発されたもので、プロンプトに対するモデルの応答を評価し、ユーザーが特定のタスクに最適なモデルを選択する際の参考となる、プロンプト依存のリーダーボードを生成します。

より簡単に言うと、LLM(大規模言語モデル)に与えたプロンプトに対して、モデルがどれだけ「迷わず答えられたか」を数値で評価する手法です。
具体的には、プロンプトに対する損失(Loss)──つまりモデルが正解にどれだけ近い出力を出せたか、どれだけ自信を持って予測できたか──を計測します。

これにより、ユーザーからの入力に対するモデルの「理解度」や「安定性」を客観的に比較できるため、従来の主観的な評価やスコアとは異なる、新しい評価指標として注目されているものです。

したがって、ChatbotArena に搭載された「P2L エクスプローラー(Prompt-to-Leaderboard Explorer)」は、大規模言語モデル(LLM)の性能を "プロンプト単位" で詳細に可視化・分析したツール となります。

この可視化ツールから、ユーザーは 特定のプロンプトに対して最適なモデルを見極めることができ、自身のニーズに合ったモデル選びの参考として活用することができます。

「P2L エクスプローラー」は、モデル パフォーマンス を トピッククラスタリング を用いて視覚的に整理 され、関連するプロンプトの傾向や得意領域が一目で分かる構成です。

また、「Example Prompts(プロンプトの例)」で、実際に使われたプロンプトも確認ができるため、どのような問いかけが評価対象になっているのか も把握しやすくなっています。

ちなみに、プロンプト の使用例としてもっとも多く見られるのが、「Web Development and Programming(Web開発とプログラミング)」に関するカテゴリです。

全体の 2.67% を占めており、数値としては突出してはいないものの、AI が今後、プログラミング分野で活躍することへの期待や関心の高さがうかがえる結果となっています。

その「Web開発とプログラミング」に関する 各モデルの性能の優位性を可視化したのが、下のリーダーボードです。

画像参考 : 「P2L Explorer」
Web Development and Programming の内容

現時点で最も高いスコアを記録しているのは、話題の『early-grok-3』であり、特にプログラマーにとって注目すべきLLMであることがうかがえます。

このような比較は、目的に合ったLLMを選ぶ際の貴重な判断材料となるため、用途に応じて AI を活用したいと考えている方は、ぜひ一度チェックしてみてください。

🔍 アリーナエクスプローラー(Arena Explorer)


「P2L エクスプローラー」同様に注目すべきが、次に紹介する「Arena Explorer(アリーナ・エクスプローラー)」です。

「P2L エクスプローラー」は LLM(言語理解)に注力した形でしたが、ここでは更に多角的な AI の "見方" ができるようになっています。

・Language : 一般的な言語生成/会話/推論など

・WebDev Arena : プログラミング・Web開発関連

・Text-to-Image : 画像生成AIとの連携・プロンプト理解

・Search : 情報検索・ファクトチェック的な質問

・Vision : 画像理解・視覚的推論(マルチモーダル)

Chatbot Arena の利用状況をインタラクティブに分析できるこのツールは、まさに “参考情報の宝庫” といえる存在です。個人的にもかなり重宝しています。

この機能を使えば、世界中のユーザーがどのようなプロンプトを多く使っているかをカテゴリ別に把握することができます。さらに、ジャンルや用途ごとの傾向を分析することで、今後の AI 活用ニーズや注目分野を読み解く手がかりにもなります。

たとえば、こちら(下図)は「Text-to-Image(画像生成AI)」の アリーナ・エクスプローラー における クラスタリング の一例です。
ここでも「P2L」技術によって、試されるプロンプトがカテゴリごとに分類されています。

最も多かったのは「Art Imagery」で、アート系のプロンプトが全体の 20.48% を占めていました。これは、おおよそ予想通りの結果かもしれません。

では、次に多く見られたのはどんなカテゴリのプロンプトだったと思いますか?
ちょっと意外な傾向が見えてきます。

2番目に多かったのは「Fashion Photography」、つまり ファッション関連の写真生成 に関するプロンプトです。
全体の 20.46% を占めており、1位の「Art Imagery」(20.48%)とほとんど差のない僅差であることがわかります。

さらに、ファッション系のフォトグラフィ生成プロンプトを細かく見てみると、最も多かったのは「Fashion and Portrait Photography」、つまりファッションとポートレート写真の組み合わせで、全体の 2.95% を占めていました。

そして意外なことに、2番目に多かったのは「Male Portrait Photography Styles」──男性のポートレート写真スタイルで、1.38%。
ちょっと意外ですよね。「女性じゃないんですね(苦笑)」とツッコミたくなる結果です。

これらのカテゴリ分けされたプロンプトの内容が具体的に示されていますので、その内容を再利用して生成することもできます。

Example Prompt

1位 : 「ファッションとポートレート写真」プロンプトからの生成画像 例

Ex 1: An unretouched portrait photo of a pretty, cute, classy 25-year-old woman with long, straight hair and wispy, side-swept bangs, wearing a white buttoned-up collared blouse, a black skirt, and a black belt, standing in a neutral, natural pose, facing the camera with a neutral, calm, indifferent facial expression. Classy, elegant, timeless fashion and hairstyle. White background. Natural light. Low-key lighting. Side-lighting.

2位 : 「男性のポートレート写真のスタイル」プロンプトからの生成画像 例

Ex 1: handsome young man with shaggy hair and pale skin in the movie Texas Chainsaw Massacre

女性の生成画像は その後に続いています(笑)。

3位「Blonde Women Descriptions(1.31 %)」
4位「Women at the Beach(1.14 %)」
5位「Female Image Generation(0.97 %)」……

3位 : 「金髪女性の説明」プロンプトからの生成画像 例

Ex 1: A relaxed man in his late 30s, wearing a casual button-up shirt, standing outdoors in soft natural light, thoughtful expression, realistic and warm atmosphere.

4位「ビーチにいる女性たち」プロンプトからの生成画像 例

Ex 1: woman in bodysuit smiles on the beach in yoga pose

5位「女性イメージ生成」プロンプトからの生成画像 例

Ex 4: please create an image of beautiful girl going towards forest with smile in her face

ランキングから使用頻度の高いプロンプトを確認し、それを再利用して画像を生成して確認もできるため、用途に応じた参考画像の取得にも活用できます。

信頼性の高い参考情報
として、非常に有用なリソースです。

残念ながら、これらのプロンプトカテゴリの中には、"建築関連のビジュアル" に特化したものは見当たりませんでした。建築分野は、AI全体の中ではまだ少しニッチな領域なのかもしれませんね(苦笑)。

🎮 “戦わせ方” 入門ガイド


評価に参加する方法はいたって簡単で、"楽しい" ものです。
「アリーナ(バトル)」の一端を 案内しておきます。

以下の ページ にアクセスします。

画像参考 : Chatbot Arena (formerly LMSYS)

📜 仕組み
ブラインドテスト: 2 つの匿名 AI チャットボット (ChatGPT、Gemini、Claude、Llama など) に任意の質問をします。
ベストに投票: 最適な応答を選択します。勝者が見つかるまでチャットを続けることができます。
公平にプレイ: AI の正体が明らかになると、投票はカウントされません。
新機能: 画像をアップロードしてチャットします。🌐 を使用してオンライン LLM を検索します。🎨 を使用して DALL-E 3、Flux、Ideogram などのテキストから画像へのモデルで画像を生成します。🐙 RepoChat タブを使用して Github リポジトリとチャットします。

🏆 Chatbot Arena LLM リーダーボード
1,000,000 件を超えるコミュニティ投票に支えられた当社のプラットフォームは、最高の LLM および AI チャットボットをランク付けします。LLM リーダーボードでトップの AI モデルをご覧ください。

出典 : Chatbot Arena 

2つの空白スペースが並ぶ下に、テキスト入力欄があるので、そこで "チャット" します。

すると、このようにブラインドされた 2つの チャットボット が一斉に返答対応します。

「日本の高層建築について教えてください。」
Chat 比較

この場合、左側「Model A」の内容の方が、より端的にまとめられ、見せ方にも優れた印象がありました。

そこで、この場合は、一番左ボタンの「A is better」をクリックして投票します。

投票が完了すると、このようなメッセージが出ます。

Thanks for voting! Yout vote shapes the leaderbord, please vote RESPONSIBLY.

(直訳)
投票いただきありがとうございます。あなたの投票がリーダーボードを決定しますので、責任を持って投票してください。

また、投票が完了すると、「Model A」と「Model B」に使用されていた具体的なモデル名が表示される仕組みになっています。そのため、自分がどのモデルに投票したのかを確認でき、自分に合った AI モデル を見つける手がかりにもなります。

投票後に表示される AI モデル

Chatbot Arena では、さまざまなプラットフォームの AI モデル を 手軽に試すことができるため、非常に便利なサイト です。ただし、これはあくまで モデル同士を比較・評価するための場 として提供されているものであり、その点を理解したうえで、責任を持って活用することが大切です。

🖼️テキスト2画像(Text2Image)


2024年からは、Chatbot Arena の取り組みは 画像生成AIの比較 にも拡大しています。テキストプロンプトを入力すると、2つの画像生成AI(例:DALL·E 3、Midjourney、Stable Diffusion、Ideogramなど)が画像を生成し、どちらの画像が優れているかをユーザーが選ぶ仕組みです。

このプロジェクトは Image Arena(イメージ・アリーナ)として独立して運用されており、チャットAI 同様にブラインド評価を採用しています。

画像の美しさ、構図、テーマの再現度など、定量化しにくい「感覚的な評価」を多くのユーザーの投票で可視化するユニークな試みとなっています。

🎨 想像を画像に──Text2Imageの基本と活用法


「テキストから画像生成」の比較例をお伝えします。

"赤いパンツを履いたトイプードル" で 画像生成してみました。

Text2Image 比較

皆さんはどちらが お好みでしょうか?

どの ジェネレーター を使用しているのかは投票するまで分かりませんが、どちらも個性的で、とてもかわいいですね(笑)。

生成画像は ダウンロードもできますので、楽しみながら、ちゃんと "責任を持って" 投票することを忘れずに使用してみてください。

Model A
Model B

こちらも、投票を終えた時点で、生成バトルした2つのモデルが表示されますので、AI モデル の特徴を把握することにもつながります。

投票結果で表示された AIモデル

上の画像の「Model A」は flux_1.1-pro、「Model B」は、recraft-v3 が使われていました。

画像生成AI に詳しい方向けの、AI モデルを言い当てるクイズ にもなりそうですね(笑)。

🗺️ 画像生成のプロンプト傾向


先ほどの「アリーナエクスプローラー」で「テキストを画像に変換」の 最も使用率の高いカテゴリである コンセプト アート(Digital Concept Art Portraits)の詳しい内容を確認しておきましょう。

「アリーナエクスプローラー」

Ex 1: highly detailed digital painting of afrofuturistic wakandan voodoo mask biocircuitry, sinister, artstation, concept art, matte, sharp focus, illustration, dramatic, cinematic sunset, hearthstone, art by artgerm and greg rutkowski and alphonse mucha
(直訳)
例1:アフロフューチャリスティックなワカンダのブードゥーマスク、バイオサーキットリーの精緻なデジタルペインティング、不吉な雰囲気、Artstation、コンセプトアート、マット仕上げ、シャープフォーカス、イラスト、ドラマチックなシネマティックな夕焼け、ハースストーン、Artgerm、Greg Rutkowski、Alphonse Muchaによる作品

Ex 2: fabio rovazzi, elegant, realistic, digital painting, concept art, smooth, sharp focus, illustration, by ruan jia and mandy jurgens and artgerm and william - adolphe bouguerea
(直訳)
例2:ファビオ・ロヴァッツィによる、エレガントで写実的なデジタルペインティング、コンセプトアート、滑らかでシャープフォーカス、イラスト、Ruan Jia、Mandy Jurgens、Artgerm、William Adolphe Bouguereaによる作品

Ex 3: The Eighth Doctor standing next to the TARDIS, portrait by Stanley Artgerm Lau, greg rutkowski, thomas kindkade, alphonse mucha, loish, norman Rockwell
(直訳)
例3:ターディスの隣に立つ8代目ドクター、Stanley Artgerm Lauによる肖像画、Greg Rutkowski、Thomas Kindkade、Alphonse Mucha、Loish、Norman Rockwellによる作品

出典 : Example Prompt

《Ex 1: highly detailed digital painting of afrofuturistic wakandan voodoo mask biocircuitry, sinister, artstation, concept art, matte, sharp focus, illustration, dramatic, cinematic sunset, hearthstone, art by artgerm and greg rutkowski and alphonse mucha》

例1 のプロンプトで生成した アリーナ画面 です。

Model A
Model B

2番目に多く使用されている プロンプト カテゴリ は、車のビジュアル(High-Performance Car Imagery)に関する内容のものです。

プロンプトとしては、以下のようなものが見られます。

Ex 1: A Ferrari drives down the road with a blood-red sunset in the distance
(通訳)
例1:遠くに血のように赤い夕日が沈む中、フェラーリが道路を走っている

Ex 2: Salad lettuce leaves being blown away by a fast Maserati
(通訳)
例2:猛スピードで走るマセラティに吹き飛ばされるサラダレタスの葉

Ex 3: lamborghini veneno, landscape shoot, 8k ultra realistic, Angkor Wat
(通訳)
例3:ランボルギーニ・ヴェネーノ、風景撮影、8Kウルトラリアル、アンコールワット

出典 : Example Prompt

《Ex 1: A Ferrari drives down the road with a blood-red sunset in the distance》

例1 のプロンプトで生成した アリーナ画面 です。

Model A
Model B

同じプロンプトでも モデルによって表現のクオリティに個性があり、その違いを確認するのはとても興味深い体験です。「好み」の要素ではありますが、そうした評価が積み重なって、やがてリーダーボードにも反映されていきます。

『Chatbot Arena』は コミュニティ主導のサイト です。そのため、できるだけ 多くの方に関与してもらうことが重要 になります。

AI の使用経験がある方を始め、初めて使う方なども、評価に参加することをおすすめします。

🔁 新しい“対話競技場”、BETA版が公開


Chatbot Arena を運営する LMSYS.org は、現在『BETA.lmarena.ai』にて新しい アリーナ UI(ユーザーインターフェース)を 試験公開しています。

画像参考 : beta.lmarena.ai

使い方として、3つの視点切り替えは、ドロップダウン選択になっており、使用方法は同じですが、よりシンプルな UI へと進化しています。

チャットか画像生成 のカテゴリの切り替えも、ドロップダウン選択です。

BETA版では、より多くのモデルが選択できるようになっているほか、P2L エクスプローラー や Copilot Arena といった派生機能へのアクセスもスムーズになっています。

🔄 Hugging Face『ミラー版』


簡単に リーダーボード だけを確認したい という場合、Hugging Face 掲載の ミラー版 があります。
そちらを閲覧用にすると良いでしょう。

画像参考 : huggingface.co

🌐 AI評価の公共圏としての役割


『Chatbot Arena』は、単なる AI の比較ツールではありません。また、単なる ベンチ マーク ツール でもなく、実際のユーザーが参加する “アリーナ=競技場” のような環境で、モデルの実力を直接比べられる のが特徴です。

そこには、ユーザーが AI の評価主体になる という、新しい価値観が息づいています。

今後さらに多くのモデルが登場する中で、Chatbot Arena のような「公開の場」は、AI の質を見極めるうえでますます重要な存在になるでしょう。

もし AIチャットボット に ご興味があるなら、ぜひ一度自分でも「審査員」として参加してみてください。きっと、新しい発見があるはずです。

*

次回は、より多角的な視点で AI の影響を評価できる、次世代に欠かせない 新しい評価基準を提示する AI ツール をご紹介します。

お楽しみに!