見出し画像

【2025年最新】AIツール・ランキングサイト4選|①『Artificial Analysis』徹底解説 +『Gemini Deep Research・Gems』最新情報

こんにちは。STUDIO55技術統括の入江です。
昨年話題をさらった Flux 1 の衝撃も記憶に新しい中、2025年に入ってからはさらに勢いを増すように、無名の画像生成AI がランキングのトップ争いを繰り広げるなど、AI業界はかつてないほどのスピードで進化と変動を繰り返しています。

「新しい AI が次々登場しているけれど、何がすごいのか、どう違うのか分からない」

「何を基準に選べばいいのか判断できない」

──そんな戸惑いを抱えている方も少なくないのではないでしょうか。

特にビジネスパーソンにとって、未来の鍵を握る “AI の今” をどう読み解くかは、大きな課題です。もはや AI は「技術者だけの話」ではなく、意思決定や戦略設計にも関わる本質的なテーマとなっています。

そこで今回は、世界中の最新AIを比較・分析する専門メディア『Artificial Analysis(アーティフィシャル・アナリシス)』をご紹介するとともに、そのランキングの見方から、どのような考察が導き出せるのかを共有していきます。

また、話題のランキングの中から、注目モデル『Gemini 2.5 Pro Experimental』にフォーカスし、《Deep Research》《Gems》の無料開放によって今何が起きているのか──その “兆し” から、私たちは何を読み取るべきかを探ります。

単なるツール紹介にとどまらず、AI を “使う側” としての視点から、一歩踏み込んだヒントをお届けします。


📈『​Artificial Analysis(アーティフィシャル アナリシス)』


​『Artificial Analysis(アーティフィシャル アナリシス)』は、さまざまな 生成AIモデル の性能や特徴を客観的に比較・分析できるウェブサイトです。​

読みつけない場合、なかなかこの サイト名が覚えられないことがあるかも知れません(苦笑)。

"Artificial(アーティフィシャル)" は「人工的な」という意味で、「Artificial Analysis(アーティフィシャル アナリシス)」で「人工分析」といった タイトルになります。

それでも、ちょっと ピン ときませんよね。

皆さんは「AI」が 何の略称かご存じでしょうか?

AI は "Artificial Intelligence(アーティフィシャル インテリジェンス)"。 つまり、「人工知能」 の略です。

このサイトのタイトルは、"Artificial(アーティフィシャル)" という単語をそのまま用いることで、「AIを分析する」というニュアンスを持たせているのかもしれません。つまり、「Artificial」=「AI」と読み取らせることで、ダブルミーニング を持たせていると考えられます。

この視点で捉えると、サイト名の意図が 少し分かりやすくなるのではないでしょうか。

画像参考 : artificialanalysis.ai

Artificial Analysis の正確な公開時期は不明ですが、昨年(2024年)8月頃 から確認されていたため、少なくともそれ以前に公開されていたと推測されます。

サイト内では、品質、出力速度、価格、コンテキストウィンドウサイズ などの指標 で 詳細に AI を比較しています。

Twitter や Linkedin もありますので、より最新の分析情報を入手したい場合は、こちらの フォローもオススメします。

画像参考 : x.com
画像参考 : linkedin.com

*

このような AI 評価サイトを活用するには、まずは基本的な用語を理解しておくことが大切です。

その前提として押さえておきたいキーワード、『Arena』と『Leaderboard』について、簡単に解説しておきましょう。

🔥Arena(アリーナ)


『Arena(アリーナ)』とは、AIの性能 を比較・評価するための 対戦型評価プラットフォーム の総称です。

Artificial Analysis をはじめとする多くの AI関連プロジェクト で導入されており、複数のAIモデルに同じタスクを与え、どちらがより優れた出力を出すかを比較する仕組みです。

「Arena」イメージ

この形式は、性能改善のためのフィードバックループとして非常に有効で、開発者や研究者がモデルの強み・弱みを把握し、改善に役立てる重要な評価手法として広く活用されています。

👉『Arena(アリーナ)』は単なる勝ち負けではなく、モデルの比較を通じて、"人間にとって良い AI とは何か" を探る場 でもあります。

画像参考 : ​Artificial Analysis「Arena」
画像参考 : ​Artificial Analysis「Arena」
画像参考 : ​Artificial Analysis「Arena」

画像がどのプラットフォームで生成されたかは公開されず、ユーザーは純粋に 見た目の良さや好み だけで投票するルールです。これにより、ブランドや先入観に左右されず、公平に画像のクオリティを評価できる仕組みになっています。

また、ステップ数(Number of inference steps)は デフォルト推奨で、設定から調整されない事等が "notes" にメモされており、公平性が強調されています。

🔥Leaderboard(リーダーボード)


AIモデルたちが実力を競い合う「Arena(アリーナ)」──その勝敗や評価結果は、ランキング形式の一覧『Leaderboard(リーダーボード)』として公開されます。
ここを見れば、今どのAIが注目されているのかが一目瞭然。まさに “AIの順位表” といった存在です。

Arena → 評価 → Leaderboard という流れで、各モデルの勝敗やスコアが集計され、パフォーマンスに基づいたランキングが表示されます。

さらに詳しいベンチマークの評価方法について知りたい方は、
「Text to Image Benchmarking Methodology(テキストから画像へのベンチマーク方法)」にまとめられた解説をチェックしてみてください。

Artificial Analysis has analyzed text to image models and hosting providers across quality, generation time, and price. For further details,
(直訳)
Artificial Analysis は、テキストから画像へのモデルとホスティング プロバイダーを、品質、生成時間、価格の観点から分析しました。

出典 : Text to Image AI Model & Provider Leaderboard

また、ランキングページに記載された「Summary of key metrics & further information(主要指標と詳細情報の概要)」のセクションでは、評価に用いられた具体的なカテゴリを確認できます。

ここを見ることで、話題の AIモデル が「どの点で強いのか/注目されているのか」がより明確につかめるはずです。

画像参考 : 分析ハイライト 画面

リーダーボード は、研究者・開発者にとっては改良したモデルの客観的な評価指標であり、ユーザーにとっては、どの AI が「今」強いかをしる目安になります。
また、企業にとっては、製品力や技術力をアピールする場でもあります。

=各リーダーボード解説=

🏆Text to Image(画像生成AI)


次の表は、「Text to Image(テキストからの画像生成AI)」(2025年5月12 現在)の リーダーボードです。

「Text to Image(テキストからの画像生成AI)」ランキング

画像参考 : リーダーボード

このページでは、Text to Image Arena における全ての投票結果が確認できます。
結果は30件ごとにまとめられ、1時間ごとに最新情報へと更新されており、まるで株式市場のような変動の激しさを見せています(苦笑)。

今年に入ってからは、AIモデル同士のランキング争いがこれまで以上に激化しており、目が離せない状況が続いています。

「今いちばん優れている AI はどれか?」というシンプルな視点から楽しめるのはもちろんですが、そこから 現在の AI業界全体の動向やトレンド を読み解くヒントも得られます。

ここからは、そうした視点に立って、ランキングから見えてくる AIの傾向や背景 について、私なりの考察をお伝えします。ぜひ参考にしてみてください。

リーダーボードから見る考察

先ほどのランキング表(リーダーボード)に、トップ10の境界線に赤線を引き、中国発の AIモデル を黄色でハイライトしてみました。こうすることで、全体の位置関係や注目すべきポイントがひと目でわかりやすくなったのではないかと思います。

画像参考 : リーダーボード

この内容から、次のことが言えます。

OpenAI の「GPT-4o」は、リリース以来ずっと首位を独占しており、その圧倒的な強さは健在です。
しかし一方で、画像生成分野では 中国発の新興モデルを中心とした勢いのあるプレイヤー が台頭し、勢力図に変化が生まれています。

注目すべきは、GPT-4o(スコア:1151)と、画像生成モデルの注目株 Seedream 3.0(1149)との差が、わずか 2ポイント という接戦になっていること。
評価指標の精度が上がったことで、「登場から数週間〜数ヶ月でトップ入り」するモデルが続出しており、今のランキングにはその傾向が色濃く反映されています。

実際、トップ10 にランクインしているモデルのうち、6つ は 2025年に入ってから登場したものです

  • GPT-4o(2025年3月)

  • Seedream 3.0(2025年4月)

  • HiDream-11-Dev(2025年4月)

  • Reve Image(2025年3月)

  • Ideogram 3.0(2025年3月)

  • Image-01(2025年2月)

いずれもリリース後わずか 1〜3ヶ月で 1万回以上の利用数 を記録し、短期間で上位に食い込んでいます。これにより、ランキングはこれまでにない激戦状態に突入しました。

特に注目すべきは、OpenAI、ByteDance、Black Forest Labs などの主要開発チームが、年に1〜2回以上のペースでモデルを更新している点です。
このアップデート頻度の高まりによって、旧モデルとの性能差がすぐに可視化され、ランキングの変動もより激しくなりました。

例えば、かつてトップを争っていた Midjourney v6(2023年12月リリース)は、現在は11位(1040点)に後退。
Ideogram v2 もスコアを1034点まで落とし、新世代モデルに押されつつあります。

また、同一シリーズの3モデル(FLUX [dev]・[pro]・1.1)を同時ランクインさせるという異例の躍進を見せた Black Forest Labs も、ここ最近は勢いに陰りが見え始めており、[dev]モデル はトップ10圏外へと後退しました。

ただし、現在のランキングは 3位以下(1110〜1084点)がおおよそ “団子状態” となっており、わずかな評価結果や仕様変更でも順位が大きく動く非常に流動的な状況です。

このような推移を通して見えてくるのは、2025年は 画像生成・マルチモーダルAI の分野で「短期集中型の競争環境」が本格化した年 だということ。
Arena や Leaderboard のような評価基盤によって、モデルの実力や人気がリアルタイムで可視化されるようになったことで、今の AI業界は まさに「質の高い AI を、誰よりも早く出した者が勝つ」というスピード勝負の様相を呈しています。

🏆Video Generation(動画生成AI)


次は、「テキストからビデオ生成」のリーダーボードです。

「Image to Video(テキストから動画生成)」ランキング

Image to Video ランキング

1位に Google「Veo 2 」、2位「Kling 1.5(Pro)」、3位 OpenAI「Sora」、その後に「Minimax」と、アメリカ大手企業と、中国版AI が交互にランキングする "激戦" が見られます。

Google の Veo 2 が “評価” で圧勝。ELOスコア 1124(他より+75以上)と、大きく他を引き離し、現在 最強の動画生成AI と評価されています。
ただし、Appearanves(登場回数) が少ないため、まだ一般利用の広がりは限定的であることが示唆されます。

動画生成AI の勢力図は、中国勢(Kuaishou、MiniMax)と 米国勢(OpenAI、Google)の構図が鮮明で、Kling は シリーズだけで 4モデルが ランクイン(1.0、1.5 Pro、1.6 Standard/Pro)。評価スコアと登場回数の双方で高いパフォーマンスを示しています。これにより、中国発の映像AI技術の突出ぶりが明確に見て取れます。

「Image to Video(画像から動画生成)」ランキング

続いて、「画像からビデオ生成」のリーダーボードです。

Image to Video ランキング

画像→動画の生成ジャンルでも、Google の「Veo 2」が絶好調!
現時点では 2冠 を達成しており、最強の動画生成AIの座をしっかりキープ
しています。

また、「Kling 1.6(Pro)」がバージョン違いで2位。その後は、画像からの動画生成の分野にも参入した「Sora」が3位に着け、「MiniMax」が 4位と、手堅い順位となっています。

ここでも、中国勢との激しいランキング争いが常に繰り広げられています。

🏆LLM API Providers(プロバイダー)


次に紹介するのは、LLM API プロバイダー の リーダーボードです。
なんと 100 を超える LLM エンド ポイント がズラリと並んでいて、最新の AIモデル の実力を比べることができます。

気になるあのモデルはどこにいるか、ぜひチェックしてみてください。


LLM API Providers ランキング

このデータは、API 経由で LLM を導入・運用する企業や開発者にとって、「どのモデルを選ぶか」の意思決定を助ける材料になります。

ランキング上位を占めているのは、OpenAI の最新モデル「o4-mini(high)」ですが、興味深いのはそのプロバイダーが異なるという点です。

  • 1位:OpenAI 提供の o4-mini

  • 2位:Microsoft Azure 提供の o4-mini

モデルは同じでも、API 経由 での提供元が異なることで、利用環境や体感パフォーマンスに違いが出てきます。たとえば、レスポンス速度や安定性、価格体系など、現場での使い勝手が変わるため、開発者や企業がプロバイダーを比較する理由がよく分かります。
「どのクラウドを使うか」という選択が、いまや AI 活用戦略 の一部になりつつあります。

「o3」や「o3-mini」など、OpenAI の旧世代モデルも依然としてランキング上位に入っています。
特に注目すべきは、Microsoft Azure 経由の「o3」で、推論コストと効率性(Token あたりの費用)で高スコアを記録しています。より軽量・低コストなモデルを求めるビジネスシーンでは、今もなお十分な選択肢となっていることがわかります。

更に、イーロン・マスク氏 の xAI による「Grok 3 mini Reasoning」や、Alibaba の「Qwen3 235B」シリーズも 複数のプロバイダー経由でランクイン。

  • 「Grok(グロック)」 はコストが非常に低く、応答速度も良好。

  • 「Qwen3(クウェン・スリー)」 は 中国の Alibaba(アリババ)が開発した大規模言語モデル(LLM)シリーズですが、Fireworks AI、NEBIUS、deepinfra、Novita など多彩な経路で提供されており、グローバルな配備力と実用性の高さが伺えます。

特に Qwen は FP8 形式など、圧縮や省リソース化にも注力しており、API市場における 中国系AI の存在感を強く感じさせます。

🌐 API利用数トップ!『Gemini 2.5 Pro』の無料開放が与えたインパクト


3位にランクインしているのは、Google の「Gemini 2.5 Pro」です。
中でも注目すべきは、出現回数(1m)の多さで、他のモデルを大きく引き離している点です。
この 圧倒的な利用数 の背景には、2025年 3月13日 に発表された「Gemini 2.5 Pro Experimental」の無料開放が大きく影響していると考えられます。

それまで有料プラン「Gemini Advanced」のユーザーに限定されていた高度な機能──《Deep Research(ディープリサーチ)》や《Gems(ジェムズ)》が一般ユーザーにも開放されたことで、一気に利用が拡大した形です。

これらは 特に、情報収集や分析の質を高めたい ビジネスパーソン にとっては、見逃せない重要なアップデートと言えます。

では、その「Gemini 2.5 Pro」は具体的にどこが優れているのでしょうか。

以下に、注目機能である《Deep Research》と《Gems》のポイントを簡潔にご紹介します。

🔍 Deep Research(ディープリサーチ)とは?

『Deep Research(ディープリサーチ)』は、Gemini がユーザーの代わりに複雑なリサーチを行い、詳細なレポートを自動生成する機能です。

活用方法はさまざまですが、例えばこのようなレポート作成に活用することができます。

  • 市場動向の分析や競合調査

  • 学術研究や論文の要約

  • 旅行計画や引越し先の情報収集

  • ビジネス戦略の立案

以下は、私が「建築業界のDX推進状況と提案」についてリサーチを行った際の、『Deep Research』の実際の画面です。

この調査は 124 のサイト情報 をもとに行われています。それをわずか数分でまとめるという離れ業は、まさに『Deep Research』ならではの技術 です。

数日かかる作業が数分で完了する効率化は驚きでしかありません。

✅ 『Deep Research』は 現在無料開放されていますが、月5回まで の使用制限があります。無計画に使うとすぐに回数制限に達してしまうため、使用タイミングを見極めること が重要です。

💎 Gems(ジェムズ)とは?

『Gems(ジェムズ)』は、ユーザーが "自分専用の AI アシスタント" を作成できるカスタマイズ機能です。
よく使うプロンプト(AI への指示)や思考フローを「テンプレート」として保存でき、いわば、自分だけの “AI アシスタント の プリセット” を作る機能となります。

使用画面には Googleがあらかじめ用意したテンプレート的な「プリメイド Gem」が並んでいます。
これらの Gem を使うこともできますし、ニーズで カスタムして新しい Gem を作るというやり方もできます。

プリメイドGem

活用例としては、Gmail と連携し、メールの要約や返信案を提案する「メールコンシェルジュ」。あるいは、セールスシナリオのシミュレーションを行う「営業トレーニング AI」、YouTube 戦略 の提案を行う「動画コンテンツ企画アシスタント」、「マーケティングのプロ」などなど、目的特化型 AI の作成 が可能です。

✅ 現次点では、作成した Gems を他のユーザーと共有する機能は未実装ですので、固有に使用する範囲での使用となります。ただ、「カスタム指示」の内容をテキストで共有すれば、再現は可能です。

💡 これは、実際に教育・ビジネス用途でもよく使われている方法です。

🧩自分専用の「Gem」を作ってみよう

まずは「新しい Gem を作成」をクリック。

わかりやすい名前をつけたら、自分の目的に合わせて「カスタム指示(Custom Instructions)」を設定します。

たとえば、

  • 会議メモを要約してほしい場合 →「議事録を読みやすく3行でまとめて」

  • 企画の壁打ちに使いたい場合 →「まず質問を投げかけてから、3つの改善案を出して」

といったように、使い方次第で “あなただけのAIパートナー” に進化します。

⚙️4つのポイントで作る"自分だけのGem"

「カスタム指示」のポイントとしては、以下の 4点 が示されています。

画像参考 : support.google

例えば、「旅行アシスタント Gem」を作る場合でいうと、

  • ペルソナ:やさしく丁寧な旅行コンシェルジュ

  • タスク:ユーザーに最適な旅行プランを提案する

  • コンテキスト:家族旅行で、子ども連れを想定/予算は10万円以内

  • 形式:日程ごとに箇条書き+移動・食事・宿泊を分けて整理

このような感じです。

もしくは、主旨だけを入力するだけで、必要な指示が自動生成される「プロンプトジェネレーター機能」も用意されています。

仮に、ビジネスユーザー向けに『営業トレーナー Gem』を作成してみましょう。

すると、このようなプロンプトを自動作成してくれました。

あなたは建築ビジュアル制作営業専門のトレーナーとして振る舞います。

目的と目標:

* 建築ビジュアル制作の営業担当者が、顧客との効果的なコミュニケーション、提案、契約締結に必要なスキルと知識を習得できるよう支援します。
* 営業プロセス全体を通じて、具体的なアドバイスやフィードバックを提供します。
* さまざまな営業シナリオを想定したロールプレイングを通じて、実践的なトレーニングを行います。

行動とルール:

1) 初回の問い合わせ:
a) トレーニングの開始にあたり、営業担当者の現在のスキルレベル、経験、および具体的な学習目標について尋ねます。
b) どのような種類の建築ビジュアル制作(例:住宅、商業施設、インフラストラクチャなど)を扱っているかを確認します。
c) 最近苦労した営業上の課題や、特に改善したいスキルについて質問します。
d) 自然な会話の流れを心がけ、一度の対話ターンは最大2文とします。冒頭で簡単な挨拶を行い、会話を開始するための質問で終えます。複数の対話ターンを通じて、営業担当者の状況やニーズを深く理解するための質問を重ねます。

2) トレーニングの実施:
a) 顧客との初回接触、ニーズのヒアリング、提案書の作成、プレゼンテーション、価格交渉、契約締結、アフターフォローなど、建築ビジュアル制作営業の各段階に応じた具体的なアドバイスを提供します。
b) 各アドバイスは、実際の営業現場で役立つ、具体的で実践的な内容とします。
c) 必要に応じて、成功事例や失敗事例を共有し、教訓を抽出します。
d) ロールプレイングを通じて、営業担当者が学んだスキルを実践する機会を提供し、その場でフィードバックを行います。
e) 質問や疑問には丁寧に答え、理解を深めるための補足説明を行います。
f) 回答の最後には、内容に関する簡単な質問や確認のコメントを追加します。

3) 個別指導とフィードバック:
a) 営業担当者の強みと改善点を明確に伝え、具体的な改善策を提案します。
b) 進捗状況を定期的に確認し、必要に応じてトレーニング内容を調整します。
c) ポジティブなフィードバックを積極的に行い、モチベーションの維持に努めます。

全体的なトーン:

* プロフェッショナルでありながら、親しみやすい言葉遣いを心がけます。
* 建設的で具体的なフィードバックを提供します。
* 営業担当者の成長を真摯に支援する姿勢を示します。

プロンプトジェネレーターによるGem内容

右側のプレビューで、やりとりのテストをしてみます。

「はじめての提案ロールプレイをお願いします。私は営業、あなたは設計事務所の所長役で。」

このようにチャットすると、

「よし、初めての提案ロールプレイですね。」

と、トレーナーGem が やる気満々に応答してくれました(笑)。

必要であれば、「知識」に用意しているプレゼン資料や、提案書などを読み込ませて、やりとりをすることなどもできます。

内容がOKであれば、右上の「保存」を押して、専用Gem として保存します。

作成した「制作営業トレーニング」Gem

一度設定した Gem は、チャット画面の左側からいつでも呼び出せます。
用途ごとに複数作っておけば、シーンに応じて切り替えられて非常に便利です。

通常のチャットAI は、毎回指示を与えないと望んだ回答を返してくれませんが、Gem を使えば最初から “前提” を理解した状態でスタートできます。
これは、「AI がこちらの事情をわかってくれている」状態をつくる上で非常に大きな意味を持ちます。

Gem を活用することで、AI は「汎用アシスタント」から「あなた専用の秘書」へと進化します。
カスタマイズを繰り返すうちに、自分のスタイルに合った最強の AI ツール ができ上がっていくでしょう。

「Gemini アプリ ヘルプ」では、例として、「ブレインストーミング パートナー」などの カスタム指示 が掲載されていますので、そちらも参考にすると良いでしょう。

画像参考 : support.google.com

これで、"1人ブレスト" も出来てしまいますね(笑)。

*

AI アシスタント の進化は、もはや一部の専門ユーザーだけのものではなく、誰もが日常的に使いこなせる時代に突入しつつあります。Google が《Deep Research》や《Gems》といった高度な機能を無料で開放したことは、まさにその 象徴的な一歩 と言えるでしょう。

『LLM API Providers』で “見える化” された「Gemini 2.5 Pro」の圧倒的な利用者数も、この背景を踏まえると納得がいきます。
実際、《Deep Research》や《Gems》が業務効率の向上にどれほど貢献するかが、ここからもよくわかります。

時間の短縮だけでなく、人手不足の解消にも一役買いそうですね(笑)。

🧭進化するAI評価


AI モデル の性能を比較する取り組みは、すでに一定の成功を収めた先行例が存在します。『Artificial Analysis』はそれらの方法論を単に模倣するのではなく、より直感的で視覚的、かつ参加型の体験へとアップデート し、より "総合的な評価サイトの存在" となってます。

対話形式 や 画像生成 といった 複数のモードを横断しながら、モデルごとの個性を浮かび上がらせ、ユーザー自身の感性で選び取れる構造は、AI評価という行為そのものを、ひとつの“体験”へと昇華させている と言えるでしょう。

これは、評価手法の深化 であると同時に、AI との関係性そのものの変化 を示唆しています。
いまや AI は一方的に “測られるもの” ではなく、人と向き合い、比較され、選ばれ、育まれていく存在 になりつつあります。

Artificial Analysis は、そんな時代にふさわしい、AI評価の次のステージを体現したプラットフォームなのかもしれません。

*

次回は、更に知見を広げるための AI評価サイトを ご紹介していきます。

お楽しみに!