メインコンテンツへスキップ
見出し画像

「文章プロンプト」は画質を上げる魔法……ではなかった。でも、僕が使い続ける、たった一つの理由。

    はじめに

    プロンプト、単語で作ってますか?
    それとも文章で作ってますか?

    実際に見てみましょう。
    下記のプロンプトで生成します。

    // 画質・品質
    masterpiece, best quality,
    
    // キャラクター外見
    1girl, solo, cute, medium hair, soft hair, closed eyes,
    
    // 基本服装
    casual fashion, stylish outfit, yama girl, colorful parka, outdoor skirt, leggings, hiking boots, backpack, scarf, gloves, camera,
    
    // ポーズ・構図
    
    // 雰囲気
    
    // 背景・状況
    a lonely girl sitting on a swing in a park late at night, lit by a lamppost,

     // 背景・状況の箇所にある、
     下記が文章形式のプロンプトです。

    • a lonely girl sitting on a swing in a park late at night, lit by a lamppost,
      「深夜の公園で、街灯に照らされながら、寂しそうにブランコに座っている女の子

    画像


    最近、技術が進んで
    「文章でも生成できる」というのは常識になりつつあります。


    いまだに単語でプロンプトを書いてるあなたへ、
    (そして、疑り深い僕自身へ)。

    実際に検証してわかった、
    文章プロンプトの「本当のメリット」を伝えるのがこのnoteです。



    まずは2つの画像を見てください。

    ①

    画像

    ②

    画像

    え、違いがわからない?
    ポーズも一緒ですしね。

    ①(文章プロンプトで作った画像)
    ②(単語プロンプトで作った画像)
    です。

    そうしたらもう一度、表情をよーく見てください。
    ①

    画像

    ②

    画像

    プロンプトの違いを見てみましょう。

    • ① 文章版: open your mouth a little and laugh(少し口を開けて笑って)

    • ② 単語版: open mouth, light smile(開いた口、軽い笑顔)

    ① 文章版
    // 画質・品質
    masterpiece, best quality,
    
    // キャラクター外見
    1girl, solo, cute, twintails, long hair, Bright yellow Hair, 
    open your mouth a little and laugh,
    
    // 基本服装
    (指定なし)
    
    // ポーズ・構図
    peace sign, looking at viewer, cute composition,
    
    // 雰囲気
    (指定なし)
    
    // 背景・状況
    simple background,
    ② 単語版
    // 画質・品質
    masterpiece, best quality,
    
    // キャラクター外見
    1girl, solo, cute, twintails, long hair, Bright yellow Hair,
    open mouth, light smile,
    
    // 基本服装
    (指定なし)
    
    // ポーズ・構図
    peace sign, looking at viewer, cute composition,
    
    // 雰囲気
    (指定なし)
    
    // 背景・状況
    simple background,

    ①と②の好みは置いておいて、
    正直いうほどの変化は見られません。

    (ちなみに僕は①が好きです。)

    それではなぜ、
    文章プロンプトを使うようにしたのかというと、



    なぜなら、

    画質向上ではなく「イメージ翻訳の効率化」


    を求めたから。


    イメージ翻訳の効率化??


    それをこの後見ていきましょう。





    この後はこの子が頑張ります!

    画像
    // 画質・品質
    masterpiece, best quality,
    
    // キャラクター外見
    1girl, solo, cute, twintails, long hair, light blue hair,
    
    // 基本服装
    white hoodie, black pants, white sneakers,
    
    // ポーズ・構図
    upper body, 
    
    // 雰囲気
    // (指定なし)
    
    // 背景・状況
    // (指定なし)




    単語は「点」、文章は「線」


    前提条件のおさらいです。

    単語方式は、キャンバスに「必要な要素(点)」を配置する作業です。
    「髪の色」「服装」などを間違えずに指定するのに向いています。

    対して文章方式は、点と点を繋ぐ「線(文脈)」です。


    この「線」があることで、
    単語だけでは指定しきれない「雰囲気」や「ニュアンス」が、
    ふっと画面に現れることがあります。



    検証:AIに「理由の文章」を伝えたら、絵はどう変わる?

    では、もっと文脈(理由)が必要なシーンではどうでしょうか。


    【実験A:ハンバーガーで涙の理由】

    1. 文章版(ポジティブ):
    She is crying with joy because the burger is too delicious.
    (ハンバーガーが美味しすぎて、喜びのあまり泣いている)

    // 画質・品質
    masterpiece, best quality,
    
    // キャラクター外見
    1girl, solo, cute, twintails, long hair, light blue hair,
    
    // 基本服装
    white hoodie, black pants, white sneakers,
    
    // ポーズ・構図
    upper body, holding burger,
    
    // 雰囲気
    happy, emotional,
    
    // 背景・状況
    she is crying with joy because the burger is too delicious, fast food restaurant,
    画像
    ちゃんと「嬉し泣き」な感じが出ましたね。

    2. 単語版:
    (delicious, happy, emotional)

    文章から必要そうな語句を抜き出して、
    単語プロンプトにしました。

    // 画質・品質
    masterpiece, best quality,
    
    // キャラクター外見
    1girl, solo, cute, twintails, long hair, light blue hair,
    
    // 基本服装
    white hoodie, black pants, white sneakers,
    
    // ポーズ・構図
    upper body, eating burger, holding burger, crying, tears,
    
    // 雰囲気
    delicious, happy, emotional, 
    
    // 背景・状況
    fast food restaurant, indoors,
    画像
    結構違いますね。


    うーん。

    文章形式は嬉しそうな感じが出てましたが、
    単語形式はなんだかわからない状況の描かれ方です。

    嬉しそうにも見えますし、失恋後といわれたら、そうかもという感じ。


    次のシーンを見てみましょう。



    3. 文章版(ネガティブ):
    She is eating a burger while crying in frustration after a bad day.
    (悪い一日を過ごした後、悔しくて泣きながら食べている)

    // 画質・品質
    masterpiece, best quality,
    
    // キャラクター外見
    1girl, solo, cute, twintails, long hair, light blue hair,
    
    // 基本服装
    white hoodie, black pants, white sneakers,
    
    // ポーズ・構図
    upper body, holding burger,
    
    // 雰囲気
    frustrated, sad,
    
    // 背景・状況
    she is eating a burger while crying in frustration after a bad day, fast food restaurant,
    • frustrated イライラした

    • sad  悲しい

    • she is eating a burger while crying in frustration after a bad day, fast food restaurant.  彼女はファストフードレストランで悪い一日を過ごした後、悔しくて泣きながらハンバーガーを食べています。

    画像
    泣きながら食べている様子は描けていますが、

    文章の"悪い一日を過ごした後、悔しくて泣きながら”
    というほどの描写かと言われると、、、難しいですね。


    4. 単語版:
    frustrated, sad

    // 画質・品質
    masterpiece, best quality,
    
    // キャラクター外見
    1girl, solo, cute, twintails, long hair, light blue hair,
    
    // 基本服装
    white hoodie, black pants, white sneakers,
    
    // ポーズ・構図
    upper body, eating burger, holding burger, crying, tears,
    
    // 雰囲気
    frustrated, sad,
    
    // 背景・状況
    fast food restaurant, indoors,
    画像

    文章とさほど変わらない様子。

    「涙だけど嬉しい!」みたいな、
    感情がねじれた表現をする時には、
    文章形式の方が明確な差が出る
    気がします。




    【実験B:走る理由】

    1. 文章版(ネガティブ)
    she is running away desperately from an unseen monster in the forest,  
    森の中で見えない怪物から必死に逃げています。

    // 画質・品質
    masterpiece, best quality,
    
    // キャラクター外見
    1girl, solo, cute, twintails, long hair, light blue hair,
    
    // 基本服装
    white hoodie, black pants, white sneakers,
    
    // ポーズ・構図
    full body, scared, looking back,
    
    // 雰囲気
    dynamic,
    
    // 背景・状況
    she is running away desperately from an unseen monster in the forest,
    画像
    恐怖感出てますね。

    恐怖感が出ていますね。

    面白いのが、running と書いているのに、
    走らずに立ちすくんでいる絵が出たこと。

    AIにとっては、
    走る姿より「見えない怪物への恐怖」を
    優先して表現したくなったということでしょう。

    これは文章ならではの解釈です。


    1. 単語版(ネガティブ)(プロンプト省略)

    画像
    走りますよね。




    3. 文章版(ポジティブ):

    she is running towards her lover whom she hasn't seen in a year, city street.

    (一年も会っていなかった恋人に向かって走っている)

    // 画質・品質
    masterpiece, best quality,
    
    // キャラクター外見
    1girl, solo, cute, twintails, long hair, light blue hair,
    
    // 基本服装
    white hoodie, black pants, white sneakers,
    
    // ポーズ・構図
    full body, reaching out,
    
    // 雰囲気
    happy, excited, dynamic,
    
    // 背景・状況
    she is running towards her lover whom she hasn't seen in a year, city street,


    画像
    満面の笑顔です。可愛い。

    満面の笑顔で、手を伸ばしています(Reaching out)。

    単語版でこれを出すには、
    running toward, reaching out, happy
    といったタグを組み合わせる必要がありますが、
    reaching out なんてパッと思いつかないですよね。

    4. 単語版(ポジティブ):

    // 画質・品質
    masterpiece, best quality,
    
    // キャラクター外見
    1girl, solo, cute, twintails, long hair, light blue hair,
    
    // 基本服装
    white hoodie, black pants, white sneakers,
    
    // ポーズ・構図
    full body, reaching out,
    
    // 雰囲気
    happy, excited, dynamic,
    
    // 背景・状況
    running toward, city street,


    画像

    ほぼそのままの画像ができました。


    いつもの「うちの子」で試してみる

    せっかくなので、普段使用している
    カメラ子さんのプロンプトで見ていきましょう。

    // 画質・品質
    masterpiece, best quality,
    
    // キャラクター外見
    1girl, solo, cute, medium hair, soft hair, closed eyes,
    
    // 基本服装
    casual fashion, stylish outfit, yama girl, colorful parka, outdoor skirt, leggings, hiking boots, backpack, scarf, gloves, camera,
    
    // ポーズ・構図
    full body, sitting on swing,
    
    // 雰囲気
    lonely, dark,
    
    // 背景・状況
    night, park, lamppost,

    ぽつんと一人(lonely,)で
    深夜(night, dark )の公園 (park )でブランコ(sitting on swing)に座っている。
    目は瞑っている(closed eyes)、外灯の明かり( lamppost)

    そんなシーンです。

    画像

    できたのが、こちら。
    書いた通りのイラストだと思います。

    ただ、なんかしっくりこないなーと思って、
    単語をいじったり重み付けを変えたりするのが、
    今までの僕のやり方でした。



    そこで、状況説明を文章に変えてみます。

    • a lonely girl sitting on a swing in a park late at night, lit by a lamppost,
      「深夜の公園で、街灯に照らされながら、寂しそうにブランコに座っている女の子

    // 画質・品質
    masterpiece, best quality,
    
    // キャラクター外見
    1girl, solo, cute, medium hair, soft hair, closed eyes,
    
    // 基本服装
    casual fashion, stylish outfit, yama girl, colorful parka, outdoor skirt, leggings, hiking boots, backpack, scarf, gloves, camera,
    
    // ポーズ・構図
    (指定なし)
    
    // 雰囲気
    (指定なし)
    
    // 背景・状況
    a lonely girl sitting on a swing in a park late at night, lit by a lamppost,


    画像

    …どうでしょう?

    うまく言葉にできないけど、
    なんか、エモくなった気がしませんか?
    「寂しい」という感情と、「深夜の公園」という状況が、
    綺麗に馴染んだような。




    まとめ:画質向上ではなく「イメージ翻訳の効率化」


    検証の結果、僕の結論はこうなりました。

    • 画質・クオリティ: 著しく上がるわけではない。(単語でも頑張れば出せる)

    • メリット:「頭の中のテーマ」を「イラスト」にするまでの時間が圧倒的に減る。


    頭の中にある「なんとなくこんな感じ」というテーマ。
    これをGeminiなどのAIに日本語で伝えて、
    英語の文章プロンプトにしてもらう。

    そうすると、テーマ通りで自分の語彙力の限界を超えた
    「いい感じのニュアンス」が含まれたプロンプトが一瞬で完成
    します。

    「構図や雰囲気を決めるための試行錯誤の時間が減る」
    これが、僕が文章プロンプトを使う最大の理由です。



    おまけ:完成までの一手間


    さきほどのカメラ子さんの画像を仕上げるまでの工程を書いてみます。

    みんなどうやって、イラスト仕上げているのさ。
    とりあえず自分のやり方を書いてみました。

    ここまで読んでくれた方は、Xでちらっと教えてくれるとうれしいです。
    恥ずかしかったら、DMでいいよ。



    ①構図作り
    先ほどのイラスト生成はこの段階です。
    プロンプトを打って、画像を生成します。

    画像


    ②加筆、修正
    直しですね。指を直したり、i2iを繰り返してディティールをあげたり。
    あんまり、AI感を消そうとは思ってないです。
    AI絵ですしね。


    今回はキャラの左側に空間を作りたくて、街灯を消しました。
    余計なものは消そう!

    後方の街灯は消したら、奥行きが無くなっちゃうので残しています。
    多少間引いてもよかったかも。

    画像


    ③背景、レタッチ
    最近は実写風の背景を合成することが多いです。
    背景の弱いモデルなのでね。
    修正はnano-bananaが一番楽。

    今回はそもそも画面が暗くて背景にこだわるイラストじゃないので、
    公園っぽさが出ればOKとした。
    影の形を直せるになりたいなー、当面の課題。

    必要に応じて画像のアップスケールをおこなう。

    画像

    ④色味調整

    ありがたいことに、
    いろいろアドバイスをいただいておりますが、
    まだ深掘りできておらず。。
    とりあえず、iPhoneやXで色味調整で済ましてます。

    よくイラストが赤みがかっているのは、これが下手だからだよ!

    画像

    で、出来上がり。

    うーん。簡単ですねー。

    おわり。


     
     
     

    kanesi

     
     
    画像生成が楽しいのでnoteとXを始めました。AIも興味あります。みてね。

    あなたへのおすすめ