【PR】MVはどう作る?|Pollo.aiで「画像なし・画像あり・Agent」の3通りのハロウィン動画を実際に作ってみた🎃
※本記事はPollo AI様よりご依頼をいただき、提供されたクレジットを使用して制作しています。
タクです🎵
今回は、
Pollo.aiでハロウィーンMVを作ってみます🎃
しかも、ひとつの作り方だけではありません。
画像を1枚も使わず30秒。
複数の画像を使って約1分。
そして最後は、
30秒の曲をPollo Agentへ。
同じ「MVを作る」でも、どこまで自分で考えるかで作り方はかなり変わります。
難しそう?
タクも最初はそう思ってました🤣
でも実際にやってみると、思っていたよりずっとシンプル。
今回は完成動画だけではなく、
曲をどう区切ったのか
どこを設定したのか
どんなプロンプトを書いたのか
最後にどう仕上げたのか
まで、そのまま試せる形で見ていきます🎵
今回作るのは、この3本

今回は、3通りのMV制作に挑戦します🎵
今回使用したPollo.ai
通常の動画生成では、今回はWAN 3.0を使用しました。
タクが今回使った設定では、
15秒:90クレジット
30秒:180クレジット
でした。
動画は720pで生成しています。
ではさっそく。
まずは一番気軽なところからいきます🎵
① 画像なし!30秒の縦型ショートMV
まずはこちら。
これ、
画像を1枚も使っていません。
用意したのは、
30秒の曲とプロンプトだけ。
今回は最初から30秒で完結する短いハロウィーン曲を用意して、Wan 3.0で9:16の縦型MVを作りました。
STEP1|まず、曲を時間で区切る
いきなり動画を作る前に、まず曲の歌詞の時間を細かく分けます。

先に曲を区切っておくと、「何秒で何を見せるか」が一気に考えやすくなります。
ここが今回のポイントです。
動画を作ってから曲に無理やり合わせるのではなく、先に曲の時間を見てから動画を作る。
STEP2|WAN 3.0を設定
Pollo.aiの動画生成画面を開きます。
今回は、
Wan 3.0
9:16
30秒
720p
に設定。
画像はアップロードしません。

ここだけ確認🎵 WAN 3.0/9:16/30秒/720p。今回は画像なしです。
今回の消費は、
180クレジット。
STEP3|主人公と「役」を決める
画像がないので、主人公の見た目も文章で指定します。
今回考えたのは、
ハロウィーンの案内人。
銀白色の短いボブヘア。
大きな紫色の瞳。
紫色の猫耳付きフード。
黒・紫をベースにオレンジをアクセントにしたハロウィーン衣装。
そして小さなキャンディバッグ。
ただ「かわいい女の子」とするのではなく、
光るキャンディを配って、夜の街をハロウィーン色に変える人
という役も持たせました。
これで30秒の中にちゃんと物語ができます🎵
STEP4|歌詞の時間に合わせて、やることを書く
実際に使った考え方はこんな感じです。
9:16の縦型、30秒のアニメーションMV。
主人公は小柄な成人女性の「ハロウィーンの案内人」。
銀白色の短いボブヘア、大きな紫色の瞳、
紫色の猫耳付きフード。
黒・紫をベースにオレンジをアクセントにした
かわいいハロウィーン衣装。
小さなキャンディバッグを持っている。
主人公の顔、髪、瞳、衣装、バッグを
30秒間一貫して維持する。
0:00-4:06
静かな夜の街。
主人公がカメラを見つけ、
いたずらっぽく微笑み、
一緒に遊びに行こうと誘うように手招きする。
4:07-8:05
主人公が振り返って走り出す。
バッグからカラフルな光るキャンディが飛び出し、
通った場所から街の色が変わり始める。
8:06-12:16
主人公が光るキャンディを空へ投げる。
大きな月が楽しそうに笑い、
紫、ピンク、オレンジ、青の光が街へ広がる。
12:17-17:03
主人公が周囲のキャラクターへキャンディを配る。
受け取ったキャラクターたちは、
それぞれ自分らしいハロウィーンの姿へ変わっていく。
17:04-20:29
街全体が一気に輝く。
主人公を中心にカメラが回り、
キャンディ、星、光のリボンがくるくる舞う。
みんなが踊り始める。
20:30-25:16
主人公が大量の光るキャンディを空へ放つ。
街全体がカラフルに染まり、
さまざまなキャラクターが自由に楽しむ。
25:17-30:00
主人公がカメラへ近づき、
光るキャンディを視聴者へ差し出す。
背後でキャンディ、紙吹雪、光が一気に弾ける。
みんなで手を振って明るく終了。
明るくカラフルで、
かわいく少し不思議なハロウィーン。
怖いホラー表現なし。
字幕、歌詞、文字、ロゴなし。
口パク不要。歌詞そのものをプロンプトへ並べるのではなく、
その歌詞の時間に、どんな画を見せたいか
へ置き換えています。
これで生成🎵
STEP5|CapCutで曲を重ねる
生成後はCapCutへ。

まず30秒の動画を置いて、その上に完成した30秒曲を0:00から合わせます。
今回ちょっと驚いたのがここ。
細かな部分を除けば調整がいりませんでした。
WAN 3.0がプロンプトの時間指定にかなり沿ってくれたので、細かく切り刻んで作り直すような作業はほぼなし。
元動画に音を入れた場合は必要な部分を使ったり、オフにしたり。
曲を重ねる。
必要なら端を少し整える。
今回はそれくらいです🎵
これなら、
「MVって、まず画像を何枚も作らないと無理なのでは?」
という人でも、かなり始めやすいと思います。
そして30秒ができたところで、
もう少し遊んでみます🎃
② もっとこだわる!複数画像から約1分の横型MV
次はこちら。
今度は逆です。
使いたい画像を先に用意して、画のシーンまで自分で決めます。
やり方の基本は①と同じ。
先に曲の時間を確認して、
その時間に、
どの画像を使う?
何をさせる?
を決めていきます。
STEP1|今度は「歌詞+使う画像」を決める
たとえば、
変でもいい 響けばいい:1:27-5:00
今夜はちょっと 遊びませんか?:5:01-8:27
だったら、
「最初はステージ」
「次はパーティー会場」
という感じで、歌詞を見ながら画像を当てていきます。

歌詞の時間に、使う画像を当てはめていきます。ここまで決まれば、あとは動画にするだけ🎵
STEP2|画像をPollo.aiへ
今回は横型なので、
WAN 3.0/16:9/720p
を使用。
使いたい画像もアップロードします。

ここで便利なのが、
@で画像を指定する方法。
プロンプトの中で、
0:00-1:26 @2(3).jpgと書けば、
その時間帯で使いたい参照画像が分かりやすくなります。
STEP3|「時間+@画像+動き」で書く
最初のパートはこんな感じ。
0:00-1:26 @2(3).jpg
ハロウィーンカーニバルのステージ。
3人が演奏を始める。
カメラはゆっくり前へ近づく。
1:27-5:00 @2(3).jpg
3人が明るく楽しく演奏。
カメラは滑らかに横へ移動する。
5:01-8:27 @7(20260823-101923).png
ハロウィーンパーティー。
3人がカメラへ向かって、
一緒に遊ぼうと誘うような仕草。
8:28-12:10 @4(20260823-101923).png
3人がハロウィーンの迷路へ走って入っていく。
カメラは後ろから追いかける。
12:11-15:15 @6(20260823-101924).png
月明かりのハロウィーンタウンを3人で走る。
15:16-18:23 @6(20260823-101924).png
キャンディ色の灯りが次々と輝き、
紫、ピンク、オレンジの光が周囲に広がる。
18:24-22:08 @5(20260823-101923).png
少し奇妙だけど怖くないモンスターホール。
3人が楽しそうに進んでいく。
22:09-25:11 @4(20260823-101923).png
再び迷路。
横方向から追いかけるようなカメラ。
25:12-28:27 @6(20260823-101924).png
ピンク、紫、オレンジの光のリボンが
3人の周囲を舞う。
次のシーンへ自然につながるように盛り上げる。
同じ3人のキャラクターを一貫して維持する。
顔、衣装、体型、特徴を変更しない。
明るくカラフルで少し不思議なハロウィーンMV。
怖いホラー表現なし。
字幕、歌詞、文字、ロゴなし。覚える形はひとつだけ。
時間
+ @画像
+ その場面でしてほしいこと
です。
これなら長いプロンプトでも、あとから見返しやすい。
STEP4|約1分なので分けて生成
今回は、
30秒
+30秒
+15秒
の3回に分けました。
WAN 3.0の今回の消費は、
30秒=180クレジット。
15秒=90クレジット。
なので、
合計450クレジット。
約1分を3回に分けて生成。
STEP5|最後にCapCutへ
そしてCapCut。
曲をタイムラインへ置いて、3本の動画を順番に重ねます。

ここも今回、
ほぼそのままでいけました。
プロンプトを書く段階で歌詞の時間に合わせていたので、
「ここを何秒も削って、こっちを移動して…」
という大きな組み直しはほとんどなし。
つなぎを確認して、必要な端だけ少し整える程度。
これはかなり楽でした🎵
つまり今回の①②で分かったのは、
先に曲を区切ってから、その時間で映像を作ると、後の編集がかなり減らせる
ということ。
画像なしでも。
画像ありでも。
考え方は同じです。
では最後。
ここまではタクが、
「何秒で何を見せるか」
まで考えてきました。
じゃあ…
そこをPollo Agentに考えてもらったらどうなる?🤔
やってみます🎵
③ 曲+イメージをPollo Agentへ🎃
①で使った30秒曲と同じ曲を、今度はPollo Agentへ渡しました。
ただし、
曲だけ渡して完全丸投げ
ではありません。
作る人なら、
「こんな雰囲気にしたい」
「こんな主人公にしたい」
くらいのイメージはありますよね。
なので、そこまではタクが伝えます。
STEP1|30秒の曲をAgentへ添付
Pollo Agentを開いて、30秒のWAVファイルを添付。

まずは30秒曲を添付。今回はAgent版でも元になる画像は用意していません。
STEP2|「どんなMVにしたいか」を伝える
実際に渡した内容はこちら。
添付した30秒の楽曲を使って、
9:16の縦型ハロウィーンMVを制作してください。
主人公は、小柄な成人女性のハロウィーンの案内人。
銀白色の短いボブヘア、大きな紫色の瞳、
紫色の猫耳付きフード。
黒・紫をベースにオレンジをアクセントにした
かわいいハロウィーン衣装を着ています。
小さなキャンディバッグを持っています。
世界観は、
明るくカラフルで、かわいくて少し不思議なハロウィーン。
ホラーや怖い雰囲気ではなく、
紫、オレンジ、ピンク、青の光が輝く幻想的な世界。
ストーリーは、
主人公が視聴者をハロウィーンの夜へ誘い、
光るキャンディを配りながら街をカラフルに変えていく。
キャンディを受け取ったキャラクターたちは
それぞれ自分らしいハロウィーンの姿になり、
最後はみんなで楽しいパーティーになります。
楽曲の歌詞、リズム、盛り上がりを分析して、
具体的なシーン構成、
場面転換、
カメラワークのタイミングはお任せします。
主人公の顔、髪型、衣装は
できるだけ一貫させてください。
字幕、歌詞、文字は入れないでください。①との違い、分かりますか?
時間を書いていません。
タクが渡したのは、
曲
主人公
世界観
ざっくりした物語
まで。
「何秒で何を見せるか」はAgent側です。
すると、いきなり動画を作る…わけではなかった
ここが今回かなり面白かったところ。
Agentはまず、30秒の曲そのものを確認。
実際の長さを29.880秒と測り、歌詞も文字起こししてタイムスタンプを取得しています。
そして曲とストーリーから、
ACT1「誘い」
ACT2「変容」
ACT3「祝祭」
という3幕構成を作りました。

さらに、
全部で16ショット。
主人公の瞳のアップから始まり、
キャンディを渡す。
街が変わる。
みんなが集まる。
最後はハロウィーンの祝祭へ。
という具体的なカットまで設計しています。
しかも、動画を作る前に画像まで作っていた
ここも驚きでした。
Agentは、主人公や背景を複数の動画で揃えるため、
6枚の参照画像
を自動で準備しています。
内容は、
スタイル用画像:1枚
主人公のキャラクターシート:1枚
背景のシーンシート:4枚
です。

そして、その参照画像を使って、
4つの動画セグメント
を生成。

4本を作って、さらに1本へ
まだ終わりません🤣
生成した4本は、
長さを確認
↓
必要なフレームを調整
↓
4本を連結
↓
元のWAV音源をセット
↓
完成尺をチェック
という流れで1本にまとめられました。
完成した動画は、
29.875秒
768×1344px
24fps
です。
つまりAgent版は、
タクがCapCutで4本を並べる必要もありませんでした。
Agent側で完成まで進んでいます。


最後に歌詞を入れて完成🎵
ここまでで、30秒のMV自体は完成しました。
でも今回は、もうひと仕上げ。
最後に歌詞も入れてみます。
Agentへ正しい歌詞テキストを渡して、字幕スタイルは
Neon Glow
を選びました。

すると、歌詞のタイミングに合わせて字幕が入りました。
今回はこちらを最終完成版にしています🎵
映像を作ったあとに別の編集ソフトへ移動せず、
MV制作 → 音源合わせ → 歌詞入れ
までAgentの中で進められたのも面白かったところ。
ちなみに、歌詞字幕の焼き込み自体は2クレジットでした。
気になるクレジットは?
タク、
Agentって、めちゃくちゃクレジット使うんじゃない?
と思ってました🤣
今回の制作ログで、歌詞入りの最終完成版までに使用したクレジットをまとめると、

合計、
約198クレジット。
ただし、字幕生成の6crにはやり直した分も含まれています。
今回は generate_subtitles を3回使用し、
1回2cr × 3回=6cr になりました。
1回目はタイミングが合わず、
2回目はタイミングは合ったものの表記に誤認識があり、
3回目で正しい歌詞表記に補正して完成しています。
つまり、字幕生成自体は1回2cr。
今回のようなやり直しがなければ、同じ構成なら
194cr相当だったことになります。
今回の記事では、実際に消費したクレジットとして
198crで記載しています🎵
ちなみに、WAN 3.0の30秒生成は180cr。
実際の消費で比べるとAgent版との差は18cr、
やり直し分を除けば14crほどです。
Agentの中で何が起きていたのか、もっと見たい方へ
今回は読みやすくするため、Agentの内部工程をかなりギュッとまとめました。
実際には、
音声解析。
歌詞のタイムスタンプ。
16ショットの詳細。
参照画像。
フレーム単位での調整。
品質確認。
さらに、歌詞の補正や字幕入り完成版まで記録しています。
全部見るとかなり長いので🤣
詳しい制作ログはこちらにまとめました。

3つ作ったら、こんなに違った🎵
最後に、今回の3つを並べてみます。

こうして見ると、
同じ「AIでMVを作る」でも、かなり違います。
まず気軽に試すなら、画像なし30秒。
使いたいキャラクターや場面が決まっているなら、画像あり。
イメージはあるけど、具体的な映像構成から相談したいならAgent。
どれが正解というより、
自分がどこまで作りたいか
で変えればいいんだと思います☺️
そして今回、①と②でタクが一番感じたのは、
先に曲の時間を見てから動画を作ると、MV作りがかなり楽になる
ということ。
WAN 3.0も今回は時間指定をかなり拾ってくれて、
生成後に大きく組み直す必要はほとんどありませんでした。
これなら、
「MV作ってみたいけど、編集が大変そう…」
と思っている方も、ちょっと挑戦しやすいかもしれません🎵
そして、ハロウィーンMV企画も🎃
今回ハロウィーンをテーマにしたのには、もうひとつ理由があります。
現在、
「変でもいい、響けばいい。」番外編🎃
として、
ハロウィーンMV企画を準備しています。
詳細はこちらです👇
基本15〜60秒くらいの短いMVでもOK。
もちろん、フルMVでもOKです🎵
今回のように、
画像なしで作る。
自分の画像から作る。
Agentと一緒に考える。
どんな入り口でも大丈夫。
「やったことないけど、ちょっと作ってみようかな」
そんなきっかけになったら嬉しいです☺️
あなたが、ハロウィンだと思えばそれはハロウィンです😊
どっちがお好き?オマケ動画
WAN3.0とSeedance2.5でハロウィン|ヘンドレ.verをどうぞ🎵
消費クレジット
WAN3.0は、180クレジット
Seedance2.5は、450クレジット(50%OFFキャンペーン中だったため)
※必要クレジットやキャンペーン内容は、利用する時期や設定によって変わる場合があります
Pollo.aiはこちら

30秒からでも。
画像がなくても。
作りたいイメージひとつからでも。
MVって、思っていたより遊べるかもしれません🎃🎵
タクもまだまだ遊んでみます🤣
ではまた🎵
PolloAIのXも是非フォローを😊
PolloAIはXでクレジットがもらえるイベントもしています✨
時には賞金がでることも🎵
いいなと思ったら応援しよう!
よろしければ応援お願いします! いただいたチップはクリエイターとしての活動費に使わせていただきます! 