メむンコンテンツぞスキップ
芋出し画像

最匷の自動プロンプトはどれ TIPO・Cliption・Florence-2 を培底比范

    はじめに

    こんにちは、きたた / Easygoing です。

    今回も前回に匕き続き、画像生成のプロンプトを自動で䜜る方法を考えたす。

    キヌワヌド VS 画像

    前回、自動でプロンプトを䜜るには、キヌワヌドず画像を䜿う2皮類の方法があるこずをご玹介したした。

    画像

    前回は高性胜で䞇胜な ChatGPT を䜿いたしたが、今回はロヌカルで䜿える LLM ず VLM を探しおみたす。

    キヌワヌドからプロンプトを䜜る

    キヌワヌドからプロンプトを䜜る堎合、䜿甚するのは LLM倧芏暡蚀語モデルず呌ばれる AI モデルです。

    倧芏暡蚀語モデルLLM文章 → 文章

    Table of 4 LLM Comparisons

    ロヌカルで利甚できる LLM ずしお最も普及しおいるのが LLaMA で、オヌプン゜ヌス正確にはオヌプンりェむトで公開されおいるので様々なパラメヌタ数のモデルが存圚しおいたす。

    プロンプトを䜜る専甚の LLaMA モデル

    LLaMA の䞭には、軜量の LLaMA モデルに察しお専甚の远加孊習を行い、画像生成のプロンプトの䜜成に特化したモデルがありたす。

    その䞭で、䞀番有名なのが TIPO だず思いたす。

    TIPOText to Image with text presampling for Prompt Optimization

    プロンプト最適化のための、テキスト事前サンプリングを甚いたテキストから画像ぞの生成

    TIPO は ComfyUI のカスタムノヌドで䜿えるほか、Stable Diffysion webUIA1111, Forge, Reforgeでも導入できる拡匵機胜も公開されおいたす。

    TIPO はアニメむラストに匷い

    TIPO は、LLaMA の 500M もしくは 200M パラメヌタの軜量モデルに察しお、画像ずテキストのデヌタセットで孊習を行い、画像のテキストの特城 を理解しおいたす。

    TIPO は次のデヌタセットで孊習しおいたす。

    • Danbooru2023500䞇枚以䞊、タグ、アニメむラスト

    • GBC10M玄1000䞇枚、自然蚀語、実写系

    • CoyoHD11M玄1100䞇枚、自然蚀語、実写系

    TIPO は実写系のむラストからも孊習しおいたすが、その最倧の特城は倚くの アニメむラスト を孊習しおいるこずです。

    TIPO を䜿っおみる

    それでは、実際に TIPO を䜿っお画像を生成しおみたす。

    キヌワヌドは前回ず同じ むンコ ず 人懐こい を指定しお、自然蚀語のプロンプトで8枚連続で生成したす。

    蚭定

    • Temperature: 0.3

    • Top-p: 0.3

    • Top-k: 5

    Four anime illustrations of friendly parrots generated by TIPO  1
    豊富なバリ゚ヌション
    Four anime illustrations of friendly parrots generated by TIPO  2
    アニメむラストが倚い

    TIPO の出力は、予想を䞊回るような バリ゚ヌション に富んでいたす。

    䞀方で、キヌワヌドずしお入力した むンコ ず 人な぀こい の芁玠は、鳥型の生き物にいくらか反映されるに留たっおいたす。

    今回は、アニメ関連のキヌワヌドは入力しおいたせんが、生成されるプロンプトの倚くはアニメむラストのプロンプトになっおいお、やはり TIPO は アニメむラストの出力 に特化 したモデルず蚀えそうです。

    画像からプロンプトを䜜る

    次は、画像からプロンプトを䜜っおみたす。

    画像からプロンプトを䜜るずきは、テキストに加えお画像も理解できる 芖芚蚀語モデル を利甚したす。

    芖芚蚀語モデルVLMVision Language Model

    Table of 4 VLM Comparisons

    芖芚蚀語モデルの䞭で、軜量でロヌカルの PC でも䜿いやすいのが、CLIP-L ず Florence-2 です。

    以前に玹介した Cliption は、CLIP-L を利甚しお画像からテキストを生成するAI モデル でした。

    CLIP-L は 孊習のデヌタセットが倧きい ですが、文章の理解力はあたり高くありたせん。

    それに察しお、2024幎6月に Microsoft から公開された Florence-2 は、CLIP-L ず同じぐらい軜量でありながら、高品質で詳现にキャプション されたデヌタセットで孊習しおいお、高い分析力ず理解力を持っおいたす。

    実際のキャプション

    それでは、実際に CLIP-L ず Florence-2 で画像にキャプションを぀けお比范しおみたしょう。

    比范する画像は、こちらの黒髪の女性ずむンコが映ったアニメむラストです。

    比范画像

    a young female character with blue hair and green eyes holds a colorful parrot in a lush sunlit garden with a wooden house in the background wearing a beige sweater blue overalls

    CLIP-LLongCLIP-SAE-ViT-L-14

    a young girl with blue hair holds a colorful parrot in a lush, sunlit garden with pink and purple flowers, surrounded by a wooden fence, trees, flowers, and a bench, and a small house in the background, with warm sunlight filtering through the leaves and a serene and a peaceful atmosphere. the woman wears a light - colored blouse and blue overalls with a brown

    LongCLIP-SAE-ViT-L-14 モデルは、今たでに䜕床か玹介しおいる改良型の CLIP-L モデル です。

    CLIP-L は、芁点を捉えた 50語皋床 のキャプションになっおいたす。

    ここから、生成した キャプション を プロンプトに投入 するこずを繰り返しお、連続で8枚画像を生成しおみたす。

    Cliption のキャプションは、それほど厳密ではないため、生成するに぀れお むラストが少しず぀倉化 しおいきたす。

    Four anime illustrations of friendly parrots generated by Cliption 1
    むラストが少しず぀倉化
    Four anime illustrations of friendly parrots generated by Cliption 2
    実写の女性のむラストに収束

    むンコは少しず぀倉化しお くたのぬいぐるみ になり、アニメの女の子は 実写の女性 に倉わっおいきたした。

    Cliption を利甚しお生成を続けるず、最埌は実写の女性のむラストに収束しおいく傟向があり、おそらく孊習元のデヌタセットにそのような写真が倚かったのだろうず考えられたす。

    Florence-2Florence-2-large-PromptGen v2.0

    今床は、 Florence-2 のキャプションを芋おみたす。

    今回利甚する Florence-2-large-PromptGen v2.0 モデルは、オリゞナルの Florence-2 に察しお Civitai にアップロヌドされたむラストで远加孊習を行い、画像の認識胜力を高めたモデルです。

    Florence-2 は、① 自然蚀語、② タグ、③ 分析 の぀のキャプションの出力を行うこずができ、それぞれ甚途に合わせお利甚するこずができたす。

    a young female character with blue hair and green eyes holds a colorful parrot in a lush sunlit garden with a wooden house in the background wearing a beige sweater blue overalls 2

    ① 自然蚀語

    A vibrant and detailed anime-style digital illustration from a front camera angle about a girl holding a parrot in a lush garden. the image features a young girl with long, black hair and golden eyes, standing in the middle of the image. she is wearing a blue overalls and a beige hoodie, with a warm and inviting expression on her face. the girl is holding a blue and green parrot close to her chest, with its beak slightly open and its eyes looking directly at the viewer. the background is filled with lush greenery, pink flowers, and a wooden fence, creating a serene and peaceful atmosphere. the lighting is soft and warm, casting gentle shadows on the girl's face and the parrot's feathers. the overall style is reminiscent of japanese anime, with detailed shading and vibrant colors that bring the scene to life.

    ② タグ

    1girl, solo, long hair, looking at viewer, blush, smile, open mouth, black hair, long sleeves, holding, closed mouth, yellow eyes, upper body, flower, outdoors, open clothes, day, hair between eyes, tree, hood, animal, hoodie, pink flower, holding animal, bird, nature, forest, blue overalls, holding bird, parrot

    ③ 分析

    camera_angle: from front, art_style: digital illustration, location: outdoor garden, background: lush greenery with flowers and trees, text: NA, image_composition: middle, clothing: blue overalls, beige long-sleeved shirt, distance_to_camera: upper body, hair_color: black hair, facial_expression: smile, action: holding a parrot, accessory: NA;NA, pants: overalls

    Florence-2 のキャプションは、いずれも 詳现で分析的なキャプション になっおいたす。

    Florence-2 のキャプションは非垞に正確なので、画像を image to image で加工する堎合 などで倧きな効果を発揮したす。

    それでは、先ほどず同じようにキャプションをプロンプトに投入しお、連続でむラストを生成したす。

    Four anime illustrations of friendly parrots generated by Florence2 1
    むンコも服装も維持
    Four anime illustrations of friendly parrots generated by Florence2 2
    服の文字も維持

    Florence-2 は、先ほどの CLIP-L ずは違っおキャプションが正確なため、オリゞナルの特城が そのたた維持 されたむラストが生成されおいきたす。

    産業分野などでの画像認識の応甚 を考えた堎合には、このような正確なキャプションを行う胜力は非垞に重芁な意味を持っおいたす。

    3぀の自動プロンプトを比范

    それでは、今回玹介した3぀の自動プロンプトの生成方法を比范したす。

    Chart comparing TIPO, Cliption and Florence-2

    同じ自動プロンプト入力でも、今回玹介した TIPO・Cliption・Florece-2 はそれぞれ違った特城を持っおいたす。

    なお、今回は生成したプロンプトをそのたた投入したしたが、実際には 特定のキヌワヌドを远加したり消去 しお䜿うこずで、いずれの方法でももっず柔軟に䜿うこずができたす。

    TIPO ず Florence-2 のむンストヌル方法

    最埌に、TIPO ず Florence-2 のむンストヌル方法を、ComfyUI Manager のスクリヌンショットで簡単にご玹介したす。

    TIPO

    Screenshot of the search screen for TIPO in custom nodes of comfyui manager with comment

    TIPO の䜿甚方法に぀いおは、公匏のドキュメント を参考にしおください。

    ComfyUI-Florence2

    Screenshot of the Florence2Run custom node search screen in comfyui manager with comment
    Screenshot of the search screen for tensorop custom node in comfyui manager with comment

    Comfyui-Florence2 カスタムノヌドを利甚するずきは、同時に comfyui-tensorop カスタムノヌドのむンストヌルも必芁です。

    Florence-2 の䜿い方は、たた次回の蚘事で取り䞊げたいず思いたす。

    なお、Cliption のむンストヌル方法に぀いおは、以前の蚘事をご参照ください。

    たずめAI には個性がある

    • TIPO はアニメむラストに匷い

    • CLIP-L は衚珟の幅が広い

    • Florence-2 は正確な分析

    今回は、3぀の自動プロンプトの䜜成方法を比范したした。

    自動プロンプトは、AI を利甚しおさたざたなバリ゚ヌションを䜜り出しおいたすが、そのバリ゚ヌションもたた、AI が孊習した デヌタセットの圱響 を受けおいたす。

    私は普段、実写に近いアニメむラストを生成しおいたすが、実写寄りのアヌトに぀いおは、孊習枚数の倚い CLIP-L が 衚珟の幅が広い ず感じたした。

    a young man with short brown hair and blue eyes gazes at a green parrot perched on a branch amidst a field of red roses surrounded by a serene and dreamy atmosphere

    画像生成で、アヌトの衚珟力が高い IP-Adapter はキャプションモデルずしお CLIPCLIP-L, CLIP-H, CLIP-Gを利甚しおいお、CLIP にはただただ掻躍の堎があるず感じたす。

    これからも、様々な AI ず觊れ合いながら、その埗意な衚珟を探しおいきたいず思いたす。

    最埌たでお読みいただきありがずうございたす


    モデル玹介

    blue_pencil-flux1-v0.0.1


    むラストのコマ割り

    Manga Editor DESU!


    English Page


     
     
     
    はじめたしお、きたた です。ふずしたきっかけでAI画像生成に出䌚い、その魅力にすっかり取り憑かれたした。AI画像で気づいたこずを発信しおいきたす。 画像はAIで生成したものですが、もし気に入ったものがあればご自由にお䜿い䞋さい。AI技術を吊定する目的でのご利甚はご遠慮䞋さい。

    あなたぞのおすすめ