メインコンテンツへスキップ
見出し画像

GeminiとChatGPT——《敦煌》というワードで認識を比較

    それぞれのAIは何を読むのか——iPhoneからGalaxyへの移行で見えた、生成AIの「視点」の違い



    1. はじめに:デバイスの移行とAI検証

     唐突ですが、最近iPhoneからGalaxyに機種変更しました。これを機に、以前から気になっていた「ChatGPT」と「Gemini」の描き出す世界の違いを調べてみることにしました。
     検証方法に選んだのは、AIの認識の癖が最も顕著に現れる「画像生成機能」です。
    同じプロンプト(指示語)を与えたとき、両者はどのような反応を示し、そこにどんな認識の差が生まれるのか。

     お題は、何となくの直感で、こちらに設定しました。
    『砂漠を旅するキャラバンでファンタジー風のもの。《敦煌》をイメージして』

     さて、どのような結果になったでしょうか。そこから見えてきた「AIの個性」を順に追っていきたいと思います。

    *厳密な比較ではありませんが、今回は実際に私が行ったやり取りをそのまま掲載しています



    2. Geminiの回答:優秀な観光ガイドが描く「正解」の絵

     まずはGeminiです。

    画像
    (Geminiで生成)※入力:「砂漠を旅するキャラバン。ファンタジー風。《敦煌》をイメージして」

     生成されたのは、砂漠の中のオアシス都市・敦煌。
    有名な「莫高窟(ばっこうくつ)」が描かれ、キャラバンにはしっかりと“護衛”が随行しています。これらはどれも、敦煌を紹介する際によく見かける象徴的な要素です。特に背景の莫高窟は、観光案内や紹介記事の写真を彷彿とさせる雰囲気があり、全体として非常に整合性が取れています。

     違和感なくまとめられたその画風は、ネット上の「敦煌のイメージ」を最大公約数的に統合したかのよう。
    ある意味、非常に「優秀な優等生」による生成だと感じました。

    3. ChatGPTの回答:敦煌を「物語化」する想像力の絵

     一方のChatGPT。
    実は最初、うっかり《敦煌》という条件を入れ忘れて生成してしまいました。

    画像
    (ChatGPTで生成)※入力:「砂漠を旅するキャラバン。ファンタジー風。」

     その後、「しまった」と思い、改めて条件を追加したのがこちらの絵です。

    画像
    (ChatGPTで生成)※入力:「《敦煌》をイメージして」

     出てきた画像は、Geminiとは全く異なる空気を纏っていました。

     なぜか空には天女が舞い、先頭を行く忍者風の男の肩越しには、一行の旗が浮遊しています。ラクダに乗った女性も、単なる商人には見えません。しかし、この画像からは、より乾いた砂の風土が伝わってきます。背景の巨大な仏像や、莫高窟を連想させるターコイズブルーの色彩。そして砂煙や旗のなびきからは、この旅の過酷さまでもが伝わってきます。

     ChatGPTは敦煌を「説明」するのではなく、「敦煌という言葉から連想される物語」を描こうとしているように見えました。


    4. 「RPG風」へのアレンジ:システム的なGeminiと、世界観のChatGPT

     さらに、『これをRPG風に』という追加指示を出してみました。

     Geminiは元の構図を維持しつつ、ゲームのUI(操作画面)や近未来的な装飾を「付加」しました。その代わり先ほどまであった莫高窟の象徴である仏像が消えてしまいました。

    画像
    (Geminiで生成)※入力:「先程の画像を『RPG』風に」


     対するChatGPTは、そのまま冒険が始まりそうな「世界観そのもの」が変化しました。

    画像
    (ChatGPTで生成)※入力:「『RPG』風に」

     商隊らしさが増し、画面に強いエフェクトがかかったことで、遺跡は攻略すべき「ダンジョン」へと変貌しました。先ほどまでどこか頼りなげだった女性も、ここでは凛とした女主人として描かれ、今まさに迷宮へ足を踏み入れんとする気配を漂わせています。

     やはりこちらも、物語のワンシーンを切り取ったような印象です。


    5. まとめ:AIが「何を見ているのか」を探る面白さ

     今回の検証で面白かったのは、「どちらが正しい敦煌を描いたか」ではありません。「AIが《敦煌》という言葉から、何を重要な情報として選び取ったのか」という点です。

     Geminiは、対象を説明するための代表的な要素を均等に集め、いわば「正解な資料」を作ろうとしているように見えました。これに対してChatGPTは、言葉から連想される象徴や空気感を拾い上げ、 一つの「物語」として再構築しようとしているように見えました。
     もちろん実際の内部処理はもっと複雑でしょう。しかし、今回の出力を観察してみると、そこには明確な「個性の差」を感じずにはいられません。


    AIが何を生成したかだけでなく、AIが世界をどう見ているのか。

    それを探って行くと、AIは単なる「便利な道具」を超えて、対峙するのが非常に面白い「興味深い存在」になります。

    同じ言葉を与えても、AIごとに「重要だと考える情報」は少しずつ異なる。だから生成AIは単なる検索エンジンの代替というより、それぞれ異なる解釈者として向き合うと面白いのかもしれないと思いました。

    実際、Geminiに「あなたはGoogle検索とどう違うのですか?」と尋ねたところ、「私は一緒に考える頼れるパートナーです」と答えが返ってきました。

    今回の検証で見えたような「解釈のクセ」は、使い込むほどにユーザーとの相性として現れてくるはずです。過去の会話履歴や設定を参照する今のAIにおいて、その「個性」は対話の時間とともに、より自分専用の「独自の返し方」へと馴染んでいくのかもしれません。

    皆さんもぜひ、いつものツールを少し違う角度から観察してみてください。きっと、意外な発見があるはずです。



    追記:

    私は普段、こうしたAIとの対話や画像生成の過程そのものにも興味を持ち、観察を続けています。

    今回の記事で触れた「AIは何を見ているのか」というテーマとは少し異なりますが、画像生成の試行錯誤をまとめた『天使の翼』という記録も公開しています。

    興味のある方は、あわせてご覧いただければ幸いです。


     
     
    兼業主婦 自称・創造楽しみ人 (好きなことを見つけて、創って、楽しんでいる人のこと) アメブロも執筆中です👇🏻 https://ameblo.jp/pdkpdk05/

    あなたへのおすすめ