
できるだけプロンプトを書かないことで成功率を高める画像生成・動画生成 - Blog 2025/04/29
生成AIを駆使した自主映画「COLORS」オープニング公開(2月13日のAdobe MAX)の時に説明しましたが、短期間で映像を制作できたのは「可能な限りプロンプトを書かない」手法が成功したからです。
AIが次の動きを予測しやすいリファレンスイメージの検証を兼ねた制作でしたが、これが想像以上に良い結果となり、プロンプトの試行錯誤が激減したことで公開日になんとか間に合いました(ムービーは未完成でしたが)。
プロンプトに依存した画像生成・動画生成だったら、絶対に無理でした。
来月から連続ドラマの制作がスタートしますが、「可能な限りプロンプトを書かない」手法をさらに高度化したワークフローになります。
今回は、この手法を試す目的で簡単なムービーを作成してみました。
まずは、作成したムービーをご覧ください。
制作時間はトータル6時間くらい。簡易な作り方で(動画生成の最新モデルを使用すれば)難易度はそれほど高くないレベルです。
再生時間:68秒
音楽生成はSuno AI
画像生成は、Mystic v2.5を使用しましたが、リファレンスはMidjourneyやOpenAI ImageGenなど複数のモデルを活用してます。

この重厚な質感は、Mystic v2.5のFluidモデルを使わないと生成できません。Midjourney の最新バージョン7でも難しい。

Mystic v2.5には、Adobe Fireflyと同等のリファレンス機能があります。

「Structure reference」と「Style reference」です。Fireflyで言えば、構成参照とスタイル参照ですね。
プロンプトの構成要素「Subject + Scene + Style」のSceneとStyleはリファレンスイメージで指示しますので、Subjectについて書くだけです。
プロンプトの記述を「最小限」に抑えられますので、ガチャを回す偶然性に頼った生成から、人間が制御しやすい生成に移行できます。
言葉で伝えるより、スケッチや写真を見せてイメージを伝えた方が具体的で認識齟齬が確実に減ります。

上図の場合は、Structure referenceにMidjourneyの生成画像、Style referenceにOpenAI ImageGenの生成画像を設定しています。
Midjourney v7、OpenAI ImageGen、Mystic v2.5の融合生成みたいなもの。
まさに適材適所で、各々の得意な領域を組み合わせています。
以下は、Midjourneyの生成画像の構図だけもらって、Mystic v2.5で生成した例です。Structure referenceにMidjourneyの生成画像を設定しています。
Mystic v2.5で画像の構図を試行錯誤するより、Midjourney v7の方が速いため、Structure referenceが大変役立ちました。

注意点:
一般ユーザー(コンシューマー)向けとプロフェッショナル向けでは、重視されるアプローチが大きく異なるので再掲載しておきます。
■コンシューマー向け:
テキストプロンプト入力が適している
意図したイメージを生成することより、「誰でも」「簡単に」生成できる「手軽さ」が重視される
大量に「それっぽい」画像/動画を生成し、見栄えの良いものを選び、繋ぐだけのインスタントな作品が許容されるジャンル
■プロフェッショナル向け:
マルチモーダル入力が適している
ラフスケッチやイメージ図、写真などをリファレンスにした高度な画像生成・動画生成(再混合)やカスタムモデルによって、クリエーターが意図したイメージを忠実に生成することが重視される(その代償として作業が複雑化する)
テキストプロンプトに依存した生成は、偶然性に頼る不安定さが以前から指摘されており、生成回数の増大、コスト高なども問題になっていた
詳細はこちらの記事で解説しています。
マルチモーダル入力は1年前から検証をしていた
ライブ配信(Creative.Edge Live)をスタートしたのが、2024年4月4日。
第1回目の配信が、Fireflyの構成参照の検証でした。
例えば、人物のポーズは3DCGの画像を構成参照へ、生成画像の画風はMidjourneyのイメージなどをスタイル参照にアップロードします。

プロンプトだけでは表現できないイメージも、構成参照とスタイル参照を使えば、簡単に生成することができました。

この機能が登場するまでは、「プロンプトだけ」で意図したイメージを生成しようと何度も試行錯誤して「偶然を待つ」ような作業をやっていたわけです。



こんなポーズをプロンプトだけで表現できますか?


この3DCG画像をMidjourneyのDescribeでプロンプト生成しても表現できませんでした。当時のChatGPTもダメでした。
このような複雑なポーズはプロンプトで表現できません。


ちなみに、現在のChatGPT 4o / o3なら、そこそこ忠実に表現できます。今のモデルは超高性能化していますので…
ただ、ChatGPT 4o / o3で生成されたプロンプトをMidjourney v7で実行しても、上記のような複雑なポーズに関しては期待した結果は得られません。

これは上図の3DCG画像を構成参照に設定し、Fireflyの標準機能「スタイル効果」を追加して生成したイラストスタイルの画像です。
写真表現よりイラスト表現の方がリファレンスに忠実です。
※適用したスタイル効果は「コミックブック」「フラットデザイン」「アニメ」です。

プロンプト入力だけの生成では不可能なポーズ。

当時(1年前)は、Adobe Fireflyしか実践的な構成参照機能を実装していなかったのですが、今は多くの画像生成AIモデルに同等の機能が搭載されています。
今回のムービーは、ほぼマルチモーダル入力で、プロンプトだけで生成した画像・動画は30%程度です。
もし、このムービーを従来のプロンプト入力による画像生成・動画生成でやっていたら、6時間では作れなかったでしょう。
効果的に機能するリファレンスの準備は大変ですが、このくらいのアクションムービーなら容易に制作できるようになりました。
半年前はまだ無理でしたね…

コンシューマー向けならプロンプト入力が良い
繰り返しになりますが、コンシューマー向けのサービスならテキストプロンプト入力の方が適しています。
生成の品質が低下しても、ユーザビリティの方を優先します。
一般ユーザーにとっては、構図のスケッチやスタイルのためのリファレンスを準備する方が面倒で、モチベーションを下げてしまいます。
「誰でも」「簡単に」生成できないと使ってくれません。
一方、プロの現場は時間との戦いで、ガチャを回すような生成方法は非効率であり、限定的な使い方になってしまうため、「テキストに依存しないマルチモーダル入力」と「多要素編集機能」は必須となっています。
作業は複雑・高度化することになりますが、プロの要求に応えられるツールになり得ます。
この違いは大きいので理解しておく必要があります。
生成AIを活用したプロジェクト学習・第2回目の社会人向け「試行講座」の参加者を募集します。
更新日:2025年4月29日(火)/公開日:2025年4月29日(火)