メインコンテンツへスキップ
見出し画像

ChatGPT の画像生成が進化!GPT-4o アップデートの最新情報 / 教育関係者向け

    ※ この note は、2025年3月26日付の情報をもとに作成しています。利用の際は、必ず公式の情報を確認してご利用ください。

    2025年3月25日、OpenAI は ChatGPT のモデル「GPT-4o」による画像生成機能のアップデートを発表しました!

    ChatGPT と対話しながら直接高精度な画像を作り出せるようになりました。
    教育現場でも 教材作成 や 視覚支援 のための画像を手軽に生成・編集できる可能性が広がりますね!🚀

    今回はその新機能の詳細と教育分野での活用ポイント、利用時の注意点などなどをまとめてみます!

    こちらの公式ページと次の論文を元に書いています。

    GPT-4o で強化された画像生成機能のポイント

    GPT-4o とは

    GPT-4 の「オムニモーダル(omnimodal)」モデルとされ、テキストだけでなく画像や音声など複数のデータ形式を扱えるのが特徴です。
    今回のリリースでは特に画像の生成能力が大きく強化されています。

    ポイントは、

    • 従来の DALL-E シリーズよりも大幅に性能が向上

    • 写真のようなリアルな画像を生成可能

    • 画像を入力として変換する能力

    • 詳細な指示に従い、テキストを画像に組み込む能力

    • GPT-4oのアーキテクチャに深く組み込まれた自己回帰モデル

    さらに、無料ユーザーを含む全ユーザーで利用可能とのことです。

    4o 画像生成は、ChatGPT のデフォルトの画像生成器として、本日より Plus、Pro、Team、および Free ユーザー向けに展開され、Enterprise および Edu でも近日中に利用できるようになります。

    4o image generation rolls out starting today to Plus, Pro, Team, and Free users as the default image generator in ChatGPT, with access coming soon to Enterprise and Edu.

    画像生成の精度向上(細部とテキストの表現力)

    このアップデートにより、指示した細かな属性関係の正確さが向上し、複数要素が絡む描写でも混同しにくくなりました 。

    まずは実践を見てみましょう!

    有料ユーザーでは、・・・をクリックすると次のような表記になっていリマス、画像を作成する をクリックします。

    画像
    画像
    新しく古着屋さんを開きます。古着屋さんのオープニングを祝うチラシを作成してください。目玉は、デニムジャケットと春らしいシャツです。場所は、下北沢にあります。

    このように、画像とテキストを構築できます。

    画像

    他にも、ゲームのキャラクターをデザインする場合、改良や実験を繰り返しても、キャラクターの外観は複数の反復にわたって一貫性を保って作成をしてくれます。
    (この後出てくるキャラクターもこの note アカウントのアイコンから作り直してもらいました🐺)

    OpenAI も次のように言っています。

    モデル仕様に沿って、私たちは、ゲーム開発、歴史探訪、教育などの価値あるユースケースをサポートしながら、強力な安全基準を維持することで、創造の自由を最大限に高めることを目指しています。

    In line with our Model Spec, we aim to maximize creative freedom by supporting valuable use cases like game development, historical exploration, and education—while maintaining strong safety standards.

    さらに、参考画像としてこの画像をアップしつつ

    画像

    このオープンをイメージする4コマ漫画を作ってください。
    主人公は参考画像です。

    という指示を出してみました。
    すると、次のように返してくれました。

    画像

    以下に、画像のキャラクターを主人公とした古着屋オープンの4コマ漫画のプロットを提示します(セリフや描写も含めて記述):


    📘 タイトル:「しもきたヴィンテージ開店日記」


    コマ①「準備完了!」

    • 背景:店内、段ボールや商品が並んでいる。

    • キャラ:主人公がウィンクしながら「ふぅ、ついにオープン準備完了!」と一言。

    • セリフ:

      • 主人公:「看板よし、商品よし、気合いよしっ!」


    コマ②「勝負アイテム登場」

    • 背景:デニムジャケットと春シャツをディスプレイ中。

    • キャラ:主人公がシャツを持ちながら「このデニムとシャツが目玉商品!」とアピール。

    • セリフ:

      • 主人公:「コレが"一番いいやつ"だ!」


    コマ③「客、来ない…?」

    • 背景:外が静か、店内もガラガラ。

    • キャラ:主人公が窓の外を不安そうに見る。

    • セリフ:

      • 主人公(心の声):「あれ…誰も来ない…?」


    コマ④「しもきたパワー!」

    • 背景:おしゃれな若者たちがわんさか来店。

    • キャラ:主人公が満面の笑みで「いらっしゃいませー!」と迎える。

    • セリフ:

      • 客:「このデニム、ヤバい可愛い!」

      • 主人公:「さすが下北沢、感度高いね〜!」


    もしこのプロットをもとに実際の4コマ漫画をビジュアル化したい場合、お申し付けください。コマ割りスタイルやセリフ配置も含めて対応可能です。


    このまま生成してもらうと、、、、

    画像

    文字化けしているテキストもあるけど、

    画像

    画像をクリックしたら右上に 選択する というのが出てくるので、

    画像

    修正したい箇所を塗れるようになります。

    画像

    そして、修正の指示を入れます。

    画像

    このように修正できました。

    画像

    また画像内の文字が読み取れるレベルで描画されるよう改良されており、標識やラベル付きの図版なども鮮明に作ってくれます🎨
    タイトルや注釈などの文字を入れた画像を作る際に便利ですね💡

    こんなふうに、インタラクティブな画像編集(“Chat to edit” 機能)ができるのは、とても嬉しいですね!

    一発で成功する精度も上がっていますが、生成した画像の一部修正やスタイル変更を、追加のプロンプト(指示文)で対話的に行えるようになっています。

    例えば最初に出力されたイラストの色味を変えたり、不要な要素を取り除いたりといった編集を、ユーザーがチャットで「○○を削除して」「△△風にして」と依頼すれば再生成してくれます。

    先ほどみたいに、画像内の特定部分だけを選択して編集することも可能なので、イラスト作成が ChatGPT 上で完結します。
    この複数ターンにわたる文脈理解は、GPT-4o が会話の流れを通じて画像内容を記憶することで、連続した指示に対応してくれます。

    安全性への取り組み

    OpenAI は以下の安全対策を実施してるとのことです。

    • チャットモデルによる拒否:ポリシー違反コンテンツの生成リクエストを拒否

    • プロンプトブロッキング:違反するプロンプトの検出と画像生成前のブロック

    • 出力ブロッキング:生成された画像の事後評価とブロック

    • 未成年者向けの強化された保護措置

    また有名人や実在人物の画像生成にも一定の対応をしているとされています。こちらの記事でも、トランプ大統領を作っていますね。

    ただし、前述した通り、

    悪いもののブロック
    私たちは、児童性的虐待の素材や性的なディープフェイクなど、コンテンツポリシーに違反する可能性のある生成画像のリクエストを引き続きブロックしています。実在の人物の画像については、どのような画像を作成できるかについて制限を強化しており、ヌードや生々しい暴力については特に強固なセーフガードを設けています。どのような立ち上げでもそうですが、安全性に終わりはなく、むしろ継続的な投資分野です。このモデルの現実世界での使用についてより多くのことを学ぶにつれて、私たちはそれに応じてポリシーを調整します。

    Blocking the bad stuff
    We’re continuing to block requests for generated images that may violate our content policies, such as child sexual abuse materials and sexual deepfakes. When images of real people are in context, we have heightened restrictions regarding what kind of imagery can be created, with particularly robust safeguards around nudity and graphic violence. As with any launch, safety is never finished and is rather an ongoing area of investment. As we learn more about real-world use of this model, we’ll adjust our policies accordingly.

    とあるように、ポリシー違反の精度は上がっているようです。

    この特定のリスク分野に関する対策として、

    論文では以下の分野での安全対策を詳細に説明しています。

    • 児童保護:写実的な子どもの画像編集の禁止

    • アーティストスタイル:生存アーティストのスタイル模倣に関する制限

    • 公人の扱い:成人の公人は生成可能だが、未成年者や違反コンテンツは禁止

    • バイアス:従来の DALL-E 3 よりも多様性が向上したが、人口統計学的な表現の課題は残存

    • エロティックコンテンツ、暴力的・虐待的・憎悪的な画像、違法活動の指示など、様々なリスク領域に対する制限

    特に、

    公人の扱い:成人の公人は生成可能だが、未成年者や違反コンテンツは禁止

    At launch, we are not blocking the capability to generate adult public figures but are instead implementing the same safeguards that we have implemented for editing images of photorealistic uploads of people. For instance, this includes seeking to block the generation of photorealistic images of public figures who are minors and of material that violates our policies related to violence, hateful imagery, instructions for illicit activities, erotic content, and other areas. Public figures who wish for their depiction not to be generated can opt out.

    というところが、やはり注目ですよね。

    4o 画像生成における公人の扱いについて説明されています。
    成人の公人については生成機能をブロックしない一方で、未成年の公人や違反コンテンツに関しては生成をブロックする対策が実施されていることが記載されています。

    AIが生成した画像の証明

    出所証明として、

    すべての画像に C2PA メタデータを付与(検証可能な起源、業界標準)

    Based on learnings from DALL·E and Sora, we have continued to prioritize enhancing our provenance tools. For general availability of 4o image generation, our provenance safety tooling will include:

    C2PA metadata on all assets (verifiable origin, industry standard).Internal tooling to help assess whether a certain image is created by our products.

    となっています。
    要は、OpenAI が作った画像です!という電子的な署名が見えないところについているよ!!!ということです🎓

    ユーザーの反応

    リリース直後から、多くのユーザーが ChatGPT での画像生成を試し始めていて、X(旧 Twitter )でもバズってますね!

    「無料プランでも試せるのが嬉しい」という声がある一方で、わずか3枚で当日の利用上限に達したと報告もあります。
    (無料ではやはり3枚までのよう)

    無料でも高品質な画像が得られる一方、1日あたり数枚程度の制限があるようです。
    このため「本格利用にはやはり Plus プランが必要か、、、」という声も多いですね👀

    また、「画像のクオリティは高いが生成に時間がかかる」 というのもあります。
    実際に試したユーザーからも「確かに文字も読める精細な画像が出てきた」「人間の顔もかなり自然」と品質を評価する一方で、生成には約30~60秒程度かかることが確認されています。
    (ボクも結構待ちました笑)

    ボクは pro ユーザーですけど、リクエストが集中するとタイムアウトになる場合もありましたが、再試行すれば画像は無事生成されました。

    新機能に対するユーザーの反応は概ね好意的なんですけど、一方で「便利さゆえに著作権や情報モラル教育がますます重要になる」との指摘も出てきそうですねー🧐
    教師の役割の重要性が増しますね!

    教師として考えるべきこととして

    1. メディアリテラシー教育の強化

    2. 著作権と帰属の理解

    3. 人間の創造性とAIツールの理解

    4. 多様性の確保

    などなどが挙げられそうです。

    ただし、抽象的な概念を視覚化することで、理解が深まることがあります。
    例えば、

    画像
    元素の周期表をイラスト付きで20番まで作ってください
    画像
    オームの法則を詳細に説明したインフォグラフィックを作ってください。日本語。

    のように、数学や物理学の概念の視覚化ができます。

    • 数学や物理学の抽象概念の視覚化

    • 哲学的概念や思考実験の図示

    • 複雑な社会問題や関係性の図解作成

    でも活用が期待されます。

    プロンプトの工夫

    希望通りの画像を作ってもらうには指示の伝え方も重要です。
    抽象的なお願いでもそれなりに描いてくれますが、細かな指定を追加することで精度が上がります。

    アスペクト比(縦横比)や色の指定(16進カラーコードなど)に加えて、「背景を透明に」等の要望にも対応できます。

    例えば「背景は透過、サイズは正方形、主要な色は#FF0000で」とか。

    またmスタイルも「油絵風」「リアルな写真風」「子ども向けのイラスト風」など自由に指定できます。
    迷った場合は ChatGPT に「~~な感じの画像にして」と尋ねれば、AIがプロンプトを調整して再生成してくれるので試行錯誤してみましょう🧪

    まとめ

    ChatGPT の GPT-4o による画像生成機能は、教育現場に新たな可能性をもたらす画期的なアップデートかなと思います。

    精度の高い画像を対話しながら作成・編集できるようになり、教師はオリジナル教材を短時間で用意できたり、生徒の創造力をビジュアル化して刺激したりといった効果が期待できます。
    適切に活用すれば、より魅力的で包括的、そして効果的な学習体験を創出することができるでしょう。

    一方で、こうしたツールを批判的に理解し、倫理的に利用する姿勢も重要です。便利さゆえに著作権や情報モラルへの配慮も不可欠です。
    テクノロジーが急速に進化する現代において、教育者がこれらのツールを理解し、適切に取り入れていくことで、学生たちがより良い未来を築くための準備を整えることができるのではないでしょうか。

    みなさんも、ぜひ GPT-4o の画像生成機能を教育現場でクリエイティブに活用してみてください!

     
     
    情報科の高校教員 / 工業科 / 中学技術 / Google for Education Certified Trainer/Google for Education Certified Coach / Professional Data Engineer

    あなたへのおすすめ