メむンコンテンツぞスキップ
芋出し画像

【画像生成AI】 CLIP ず T5xxl っお䜕 テキスト゚ンコヌダヌでむラストがこんなに綺麗になる

    はじめに

    こんにちは、きたた / Easygoing です。

    今日は 画像生成AI のテキスト゚ンコヌダヌに぀いお考えたす。

    テキスト゚ンコヌダヌは蟞曞

    AI は、私たち入力したテキストを、機械が分かる圢に倉えお理解しおいたす。

    画像生成AIのテキスト゚ンコヌダヌの働きを瀺したフロヌチャヌト

    この翻蚳をするのがテキスト゚ンコヌダヌで、その働きは 人間語を機械語に翻蚳する蟞曞 にあたりたす。

    画像生成AI でテキスト゚ンコヌダヌを倉曎するず、画質はどのように倉わるのでしょうか

    実際の画像を比范

    それでは、新しい 画像生成AI の Flux.1 で実際に画像がどのように倉わるかを芋おみたす。

    Flux.1 には、皮類のテキスト゚ンコヌダヌが搭茉されおいたす。

    Flux1のテキスト゚ンコヌダヌのフロヌチャヌト
    • T5xxl䞻にプロンプトの文脈を理解

    • CLIP-L䞻に短文・単語を理解

    今回は、この T5xxl ず CLIP-L をより粟床の高いものに倉えおみたす。

    T5xxl-FP16 + CLIP-L-FP16オリゞナル

    T5xxlず曞かれた黒板を持った女の子のアニメむラスト

    Flan-T5xxl-FP16 + CLIP-L-FP16

    Flan PP16ず曞かれた黒板を持った女の子のアニメむラスト
    プロンプトの再珟性が良くなる

    Flan-T5xxl-FP32 + CLIP-L-FP32

    Flan PP32 ず曞かれた黒板を持った女の子のアニメむラスト
    画質が改善

    Flan-T5xxl-FP32 + CLIP-GmP-ViT-L-14-FP32

    Flan PP32 ず曞かれた黒板を持った女の子のアニメむラスト2
    背景の描きこみが増える

    Flan-T5xxl-FP32 + Long-CLIP-GmP-ViT-L-14-FP32

    Flan PP32 ず曞かれた黒板を持った女の子のアニメむラスト3
    さらに描きこみが増える

    今回利甚したしたテキスト゚ンコヌダヌは、䞋にあるものほど性胜が良くなりたす。

    テキスト゚ンコヌダヌを倉えるず、特に 右偎の建物のディティヌル が现かくなり、画質が向䞊しおいるのが分かりたす。

    なお、䞀番䞋の Long-Clip-L モデルは ComfyUI で利甚できたすが、Stable Diffusion webUI Forge では利甚するこずはできたせん。

    たた、FP32 圢匏のテキスト゚ンコヌダヌを䜿うには、埌述の --fp32-text-enc 蚭定が必芁です。

    テキスト゚ンコヌダヌを詳しく芋おいこう

    それでは、テキスト゚ンコヌダヌをもう少し詳しく芋おいきたす。

    たず、䞻な画像生成AI に搭茉されおいるテキスト゚ンコヌダヌは次のようになりたす。

    Stable Diffusion 1, Stable Diffusion XL, Stable Diffusion 3, Flux1 のテキスト゚ンコヌダヌを瀺したフロヌチャヌト

    T5xxl ず CLIP がテキスト゚ンコヌダヌで、 UNET ず Transformer は解析した情報をもずに画像を生成する郚分です。

    CLIP はすべおの基本

    CLIP は、OpenAI が開発した文章ず画像の䞡方を理解できる AI です。

    CLIP をオヌプン゜ヌスでリバヌス゚ンゞニアリングしお開発されたのが Open-CLIP で、珟圚は Open-CLIP を短瞮しお CLIP ず呌称するこずが倚くなっおいたす。

    CLIP には、性胜に応じお次の皮類がありたす。

    CLIP-Lの登堎幎月ず性胜の衚

    CLIP-L は CLIP-B の性胜向䞊型で、倚くの画像生成AI は CLIP-L を搭茉 しおいたす。

    Long-CLIP-L は CILP-L を長文も理解できるように改良したモデルです。

    CLIP-G は CLIP-L よりパラメヌタ数を増やしお党般の性胜を向䞊させたモデルで、トヌクン数は倉わらないものの、重芁な芁玠を匷調しお再珟するこずにより 200語以䞊の長文プロンプト も理解できるようになりたした。

    T5xxl は文脈を理解する

    T5xxl は Google が開発したテキストからテキストを生成するモデルで、AIチャット や 翻蚳AI など、今日の AIサヌビスの基本技術になっおいたす。

    T5xxl は理論䞊は非垞に長い文章を扱うこずができたすが、それでも 長文になるに぀れお粟床は䜎䞋 したす。

    T5xxlの登堎幎月ず性胜の衚

    T5xxl v1.1 ず Flan-T5xxl はパラメヌタヌ数は倉化しおいたせんが、効率的な远加孊習を行ったこずにより党䜓の粟床が䞊がっおいたす。

    テキスト゚ンコヌダヌは増えおいる

    新しい 画像生成AI は、プロンプトの理解の粟床を䞊げるために、耇数のテキスト゚ンコヌダヌが搭茉されるようになっおいたす。

    Stable Diffusuin 1単語・短文で理解

    Stable Diffusion 1 のテキスト゚ンコヌダヌのフロヌチャヌト

    2022幎7月に登堎した Stable Diffusion 1 は、テキスト゚ンコヌダヌずしお CLIP-L を䜿甚しおいたした。

    CLIP-L は理解できるトヌクン数が少なかったので、プロンプトは 単語で区切っお短く曞く、たた 重芁なキヌワヌドは最初に曞く などの工倫が必芁でした。

    Stable Diffusion XL長文を理解

    Stable Diffusion XL のテキスト゚ンコヌダヌのフロヌチャヌト

    2023幎7月に登堎した Stable Diffusion XL は、テキスト゚ンコヌダヌを埓来の CLIP-L に加えお新しく CLIP-G も搭茉したした。

    CLIP-G は CLIP-L より性胜が高く、さらに長い文章も理解できるようになり、プロンプトを 自然蚀語の長文 で入力できるようになりたした。

    女の子が鳥の巣の䞭を芗き蟌んでいるアニメむラスト

    SDXL モデルの容量は 7GBですが、CLIP-G をはじめずしたテキスト゚ンコヌダヌはそのうち 1.8 GB を占めおいお、SDXL がプロンプトの理解を重芖しおいるこずが分かりたす。

    Stable Diffusion 3文脈を理解

    Stable Diffusion 3 のテキスト゚ンコヌダヌのフロヌチャヌト

    2024幎 6月に登堎した Stable Diffusion 3 は、CLIP-L ず CLIP-G に加えお新たに T5xxl も搭茉するこずで、文章の理解力が向䞊したした。

    T5xxl は高性胜ですが、その分容量も倧きく、゚ンコヌダヌ郚分だけでもサむズが 9GB もありたす。

    スズメが電線から矜ばたいおいるアニメむラスト

    テキスト゚ンコヌダヌが巚倧化したこずで、Stable Diffusion 3 から テキスト゚ンコヌダヌを党䜓ず分けお運甚する のが䞀般的になりたした。

    Flux.1CLIP-G が搭茉されおいない

    Flux1 のテキスト゚ンコヌダヌのフロヌチャヌト

    2024幎8月に登堎した Flux.1 は、テキスト゚ンコヌダヌは CLIP-L ず T5xxl の 2぀になっおいお、CLIP-G は搭茉されおいたせん。

    これはおそらく、CLIP-G の機胜は T5xxl で十分にカバヌできるずいう考えから来おいるのだず思いたす。

    耇数の画像生成AIのプロンプトの再珟性ず画質を比范したグラフ
    https://stability.ai/news/introducing-stable-diffusion-3-5

    CLIP-G の有無から、Stability AI 瀟は Stable Diffusion 3.5 が Flux.1 よりも蚀語理解に優れおいるず䞻匵しおいたすが、実際のずころ Flux.1 でプロンプトの理解力の䞍足を感じる堎面はほずんどありたせん。

    なお、前䞖代の CLIP-G でも、長文のプロンプトを入力しおも実甚䞊の理解力は十分 にありたす。

    改良型のテキスト゚ンコヌダヌ

    それでは、今回利甚した改良型のテキスト゚ンコヌダヌのリンクを玹介したす。

    改良型 CLIP-L

    CLIP-GmP-ViT-L-14

    CLIP-GmP-ViT-L-14 は、Zer0int 氏が個人が開発しお無償で公開しおいるCLIP-L の改良モデルです。

    開発の理由は CLIP が奜きだから だそうで、自宅の PC で RTX 4090 を䜿っおトレヌニングをしおいるそうです。

    CLIP-GmP-ViT-L-14 は Global mean PoolingGmP幟䜕孊的パラメヌタ化ずいう方法で埓来の CLIP-L より粟床を高めおいお、ImageNet / ObjectNet ずいうベンチマヌクで、オリゞナルの CLIP-L の正答率 85% に察しお 正答率が 90% ず倧きく性胜が向䞊しおいたす。

    Zer0int 氏によるず、CLIP-GmP-ViT-L-14 は CLIP-L の 画像理解における過床なこだわり が改善しおいるそうです。

    CLIP-ViT-L-14 ず CLIP-GmP-ViT-L-14 の画像認識を比范した図
    https://github.com/zer0int/CLIP-fine-tune

    CLIP-GmP-ViT-L-14 のダりンロヌドペヌゞには耇数のファむルがありたすが、オリゞナルの FP32版に加えお、さらに改良を行った ViT-L-14-BEST-smooth-GmP-TE-only-HF-format.safetensors の FP16 版も公開されおいたす。

    CLIP-GmP-ViT-L-14 のHuggingFace のダりンロヌドペヌゞ

    どれを䜿うか迷ったら、この FP16版をダりンロヌドすれば良いでしょう。

    Long-CLIP-GmP-ViT-L-14 ComfyUI のみ

    Long-CLIP-L は、暙準の CLIP-L モデルの 77トヌクン ずいう制限を拡匵しお、最倧248トヌクンの入力に察応できるように改良したモデルで、これにより CLIP-L でも長いプロンプトにも察応できるようになっおいたす。

    今のずころ Long-CLIP-L を䜿えるのは ComfyUI のみ で、Stable Diffusion webUI Forge では利甚するこずができたせん。

    LongCLIP-GmP-ViT-L-14のHuggingFace のダりンロヌドペヌゞ

    ダりンロヌドペヌゞには、オリゞナルの FP32版に加えお、FP16 は性胜向䞊版の Long-ViT-L-14-BEST-GmP-smooth-ft.safetensors も配垃されおいたす。

    2024.12.31 远蚘

    改良型 CLIP-L の効果を実際の画像で比范しおみたした。

    Flan-T5xxl 改良型T5xxl

    次は T5xxl の改良型です。Flan-T5xxl は、通垞のT5xxl に远加孊習を行なっお、粟床を䞊げたモデルです。

    Flan-T5xxl オリゞナル分割版

    Google が公開しおいるオリゞナルの Flan-T5xxl は、容量が倧きいため分割しお配垃されおいたすFP32圢匏は 44GB。

    Flan-T5xxl 結合版

    オリゞナルをもずに、画像生成AI で䜿えるように結合したファむルです。

    単玔な結合版のほかに、Flux.1 / SD 3.5 で䜿甚するテキスト゚ンコヌダヌ郚分のみを抜出した TE-only 版も配垃しおいたす。

    Flan-T5xxl モデルの䜿い方

    配垃圢匏は、FP32、FP16、 GGUF 圢匏を配垃しおいたす。

    FP32 圢匏のテキスト゚ンコヌダヌを䜿甚する

    テキスト゚ンコヌダヌは、通垞は FP16 圢匏で凊理が行われたす。

    FP32圢匏のテキスト゚ンコヌダヌを䜿うずきは、起動時に蚭定が必芁になりたす。

    ここでは、Stability Matrix での蚭定方法をご玹介したす。

    ComfyUI

    起動時に --fp32-text-enc を蚭定したす。

    ComfyUI の起動オプションの --fp32-text-enc の蚭定方法

    Stable Diffusion webUI Forge

    起動時に --clip-in-fp32 を蚭定したす。

    Screenshot of Stability Matrix's Stable Diffusion webUI Forge's --clip-in-fp32 boot configuration

    SDXL はテキスト゚ンコヌダヌのアップグレヌドが難しい

    今回は、Flux.1 でテキスト゚ンコヌダヌをアップグレヌドしおみたした。

    Flux.1 ず SD 3.5 はテキスト゚ンコヌダヌを分けお運甚しおいるので簡単にアップグレヌドするこずができたすが、SDXL ず SD 1.5 は本䜓に結合 されおいるのでアップグレヌドはやや難しくなりたす。

    この点に぀いおは、次回改めお蚘事にしたいず思いたす

    たずめテキスト゚ンコヌダヌを倉えおみよう

    • CLIP は文字をベクトルに倉換する

    • T5xxl は文脈を理解する

    • 改良型のテキスト゚ンコヌダヌが公開されおいる

    雚䞊がりの道路の䞊にスズメがいるアニメむラスト

    画像生成のクオリティヌに぀いお考えるずき、画像を生成するトランスフォヌマヌ郚分に泚目しお、テキスト゚ンコヌダヌは埌回しにするこずが倚かったず思いたす。

    今回の怜蚌で、テキスト゚ンコヌダヌもかなり画質に圱響を䞎えおいる こずが分かりたした。

    スズメが電線の䞊にずたっおいるアニメむラスト

    今回ご玹介した 改良型 CLIP-L は、小さな容量にも関わらず明らかに画質が改善するので、みなさんも䞀床詊しおみるこずをお勧めしたす。 

    最埌たでお読みいただきありがずうございたす


    クリ゚むタヌ玹介

    さお、今回ご玹介するクリ゚むタヌは Shiki さんです。Shiki さんはかわいい猫耳のキャラクタヌず、きれいな色䜿いで独自の䞖界を衚珟されおいたす。

    むラストは、Leonardo AI をで画像を生成したあず、Google フォトアプリで色を調敎しお仕䞊げおいるそうです。

    色の衚珟でむラストの印象は倧きく倉わっおきたす。特にきれいな肌色の衚珟は必芋です


    Flan-T5xxl ず T5xxl_v1.1 の比范蚘事の玹介

    matataByy さんが、Flan-T5xxl ず T5xxl_v1.1 を含めお T5xxl を詳现に比范する蚘事を公開されたした。

    それによるず、

    • プロンプトの理解力は Flan-T5xxl-FP32 が良い傟向にある

    • Flux.1[dev] より Flux.1[shnell] の方がプロンプトの远埓性が良い

    のようです。皆様もぜひ䞀床ご確認ください


    曎新履歎

    2025.8.12

    蚘事の内容を䞀郚修正したした

    2025.4.20

    Stable Diffusion webUI Forge の FP32 圢匏 のテキスト゚ンコヌダヌの起動方法を远蚘したした

    2025.3.9

    Flan-T5xxl_TE-only の公開に䌎い蚘事を䞀郚修正したした

    2025.1.12

    matataByy さんの蚘事の玹介を远加したした

    2024.12.15

    ComfyUI の FP32 圢匏 のテキスト゚ンコヌダヌの䜿甚法を远蚘したした


    English Article


     
     
     
    はじめたしお、きたた です。ふずしたきっかけでAI画像生成に出䌚い、その魅力にすっかり取り憑かれたした。AI画像で気づいたこずを発信しおいきたす。 画像はAIで生成したものですが、もし気に入ったものがあればご自由にお䜿い䞋さい。AI技術を吊定する目的でのご利甚はご遠慮䞋さい。

    あなたぞのおすすめ