
可能なかぎり「プロンプトを使用しない」ことで「ガチャをまわす」生成から抜け出す/Googleが試験運用中のWhiskとKLING v2.0の多要素編集 - Blog 2025/04/17
この検証は、新講座「デザインフィクション」の関連記事として公開しています。
本講座は、初めて動画生成AIを活用したプロジェクト学習です。Adobe Firefly Videoを使用する前提で計画されていますが(※現在保留中)、動画生成AIでどのように30年後、50年後の未来の映像を表現するのか理解するために、Google Veo 2やKLING AIなどの最先端の動画生成についても解説します。
「テキストに依存しないマルチモーダル入力」と「多要素編集機能」
画像生成・動画生成では、以前から「プロンプト入力」が大きな障害になっています。これは、2年前から指摘されており、特にデザイン業界では、プロンプト入力の偶然性の高い「ガチャをまわす」ような生成方法の問題点が議論されてきました。
一般ユーザー(コンシューマー)向けとプロフェッショナル向けでは、重視されるアプローチが大きく異なります。
■コンシューマー向け:
テキストプロンプト入力が適している
意図したイメージを生成することより、「誰でも」「簡単に」生成できる「手軽さ」が重視される
大量に「それっぽい」画像/動画を生成し、見栄えの良いものを選び、繋ぐだけのインスタントな作品が許容されるジャンル
■プロフェッショナル向け:
マルチモーダル入力が適している
ラフスケッチやイメージ図、写真などをリファレンスにした高度な画像生成・動画生成(再混合)やカスタムモデルによって、クリエーターが意図したイメージを忠実に生成することが重視される(その代償として作業が複雑化する)
テキストプロンプトに依存した生成は、偶然性に頼る不安定さが以前から指摘されており、生成回数の増大、コスト高なども問題になっていた
クリエイティブ活用を重視して開発されているAdobe Fireflyは、プロンプト入力に依存しないスタイル参照や構成参照などの高度なリファレンス機能をいち早く導入していました。
Google Whiskは、Google Labsが提供する実験的な画像生成ツールであり、「複数の参照画像をプロンプトとして使用」する独自のアプローチを特徴としています。
Whiskは、GeminiとImagen 3を活用して、ユーザーが提供する「主題(Subject)」「場面(Scene)」「スタイル(Style)」の画像を組み合わせ、新たなビジュアルコンテンツを生成します 。
※もちろん、プロンプト入力だけでも生成できます。
Whiskの核となる機能は、これら3つの要素の画像をリミックス(再混合)することにあります 。
現在、Whiskは「実験的」なステータスにあり、米国での先行提供を経て、日本を含む100以上の国と地域で利用可能となっています 。


Google Whisk(Google Veo 2)による動画生成:
再生時間:45秒
動画は全てGoogle Whiskの動画生成(Google Veo 2)を使用
2025年4月現在、総合的な評価では「動画生成AIで最も高性能」だと言ってよいでしょう(KLING v2.0の検証が完了すると、評価が変わるかもしれませんが…)。

使い方はとても簡単で、モデル・背景・スタイルそれぞれにリファレンスとなる画像をアップロードします。内部でGeminが画像を解析して高精度なキャプションを生成し、Imagen 3にデータを渡します。
プロンプト入力欄には、最小限の指示文を入れて実行。
Whiskは、入力された3つの画像を組み合わせて新しいイメージを生成する「リミックス」機能を核としています 。
「おまかせ (Inspire Me)」 / 「サイコロを振る (Roll the Dice)」などは、モデル、背景、スタイルに対してランダムな提案を行い、アイデアの発想を助けたり、行き詰まりを打開するための支援機能として提供されています。
プロンプト(テキスト)で考えるのではなく、イメージをカタチにしていくアプローチです。

主題 (Subject):
生成される画像の中心となる要素。人物、物体、キャラクターなどが該当します 。ユーザーは自身の画像をアップロードするだけでなく、ツール内で提供されるオプションやテキストから生成した参照画像を使用することも可能です 。場面 (Scene):
主題が存在する背景、設定、または環境 。スタイル (Style):
画像全体の美的感覚、質感、芸術的技法、雰囲気などを決定づける要素。例えば、「ぬいぐるみ風」「エナメルピン風」「ステッカー風」「90年代アニメ風」「レトロ調」などを表現した画像イメージを指定できます。

この「Geminiによる解釈(キャプション生成)」を経て「Imagen 3が描画する」というパイプラインは、イメージ要素の組み合わせによる創造的な自由度を優先しています。
WhiskはGoogle Veo 2による動画生成も可能
Google One「AIプレミアムプラン(月額2,900円)」のユーザーであれば、動画を生成することも可能。8秒/720pで100回生成できます。
Whiskは試験運用中であり、動画生成もクレジットを消費しませんが、ここで生成した画像や動画を商用利用できるかは不明。
Whiskは明確に「実験(experiment)」と位置づけられており、これは完成された製品ではなく、継続的な開発途上にあり、機能変更の可能性を含み、主目的が「ユーザーからのフィードバック収集」であることを理解してきましょう。
ツールの実験的な性質に伴うリスクを十分に考慮する必要があります。業務利用はできないと捉えた方が安全かもしれません。


結局のところ、このやり方がベストなのか、まだ検証されていません。
今後、プロの現場で実践導入され、数多くのフィードバックを得られることが重要です。
Multi-modal Visual Language (MVL)
KLING AI 2.0における最も革新的な概念の一つが、AIビデオ生成のための新しいインタラクションコンセプト「Multi-modal Visual Language (MVL)」の導入です 。
これは、テキストプロンプトだけでは視覚情報を十分に伝えきれないという課題に対処するもの。
Gai Kun氏(Kuaishouシニアバイスプレジデント)は「テキストだけでは視覚的情報を伝達するには不十分であり、ユーザーが頭の中の考えを正確に表現できる新たな手法が必要だ」と強調しており、MVLこそがその解決策であると述べています。
関連記事:
MVLは、ユーザーがテキストだけでなく、リファレンスとなる画像やビデオクリップといった多様な形式(マルチモーダル)の情報を組み合わせて入力し、AIに対してより複雑で具体的な創造的アイデアを直接的かつ効果的に伝達することを可能にします 。
この技術が発展していくと、アイデンティティ、外見、スタイル、シナリオ、アクション、表情、カメラワークなど、多岐にわたる要素を制御できる可能性が高まります。
MVLコンセプトに基づき、新たに「多要素編集機能(Multi-Elements Editor)」が導入されました 。これは、生成されたビデオコンテンツに対して、より柔軟な編集と再構成を可能にするツールです。
動画生成モデル:
置換 (Swap):
複数のキーフレームで連続した選択範囲を指定し、参照画像を基に選択した被写体を置き換える(例:モデルの服を変更する、キャラクターを入れ替える)。削除 (Delete):
複数のキーフレームで連続した選択範囲を指定し、選択した被写体を削除する(例:フレーム内の不要な人物を消す)。追加 (Add):
1~2枚の参照画像をアップロードし、テキストプロンプトを使ってビデオシーンに被写体を追加する(例:都市の空に宇宙船を追加する)。
置換 (Swap)をやってみます。
まず、ビデオをアップロード。

交換したい被写体を選択します。
動きが激しい場合は、複数のキーフレームが必要になります(キーフレームごとに領域を選択します)。

交換する被写体の画像をアップロード。

人物だけが入れ替わりました。
これが静止画ではなく、映像で実行できるのは革新的です。

画像生成モデル:

Subject、Face、Restyle、Entire Imageの4つのリファレンスを設定できます。
画像生成AIモデルは、KOLORSが使用されますが利用できるバージョンが異なります。Subject、Faceはバージョン1.5、Entire Imageは1.0、Restyleは最新の2.0で実行されます。
※2025年4月現在

このくらいの機能なら、多くの画像生成AIに実装されていますので、目新しさはありません。
ElementsとMulti-Elementsの関連性
Elements機能は、KLING 1.6から導入された機能で、最大4枚の画像を参照して一貫性のある動画を生成することができます。
一方、Multi-Elements機能は、KLING 2.0で導入された「既存の動画に対して編集操作を加える」機能です。
つまり、Elementsは「複数の画像から新しい動画を生成する」ための機能であり、Multi-Elementsは「既存の動画を編集する」ための機能ということです。
この2つの機能を組み合わせることで、より意図したイメージに近づきます。まず、Elementsを使って複数の要素を含む基本的な動画を生成し、その後Multi-Elementsを使って映像の「部分除去」「部分追加」「置き換え」を行うという高度な映像制作フローが可能になります。
今まではテキストプロンプトや1つの画像だけで、完成された1シーンを「一発出し」するために何度も、何度も生成を繰り返し、ガチャを回していたのです。
どう考えても、達成不可能かつ非効率な方法だったと言わざるを得ません。
少なくともプロフェッショナルの現場に関しては、「テキストに依存しないマルチモーダル入力」や「多要素編集機能」が主流になっていくのは間違いなさそうです。
生成AIを活用したプロジェクト学習・第1回目の社会人向け「試行講座」の参加者を募集中です。
更新日:2025年4月17日(木)/公開日:2025年4月17日(木)