見出し画像

FlovaはスパルタAIだった

Flovaで楽ができたのか、判断に苦しんでいる。

ミュージックビデオの制作にFlovaを導入してみた。Flovaは映像制作向けのAIエージェントで、言うなればAIディレクターだ。素材を放り込むと、いろいろな生成AIを駆使して自動的にミュージックビデオのような音声付き動画を作ってくれる。編集ソフトというより、制作工程を率先して進めるワークフロー・エージェントに近い。生成自体は複数の生成AIに自動的に割り振り、使い手はディレクションに集中できる設計だ。

Flovaのメイン画面。右のAIアシスタントに作業内容が表示され、チャット欄から指示を出す。左のストーリーボードには画像や動画など、生成物のサムネイルが表示される。制作中のタイムラインも左画面に現れる。

たとえば、音楽、歌詞、簡単なシナリオを読み込ませると、自動的に動画クリップを複数生成し、タイムラインに並べ、ミュージックビデオに仕上げてくれるのだ。ミュージックビデオ制作が格段に楽になるのではないか?

現実は甘くなかった。

甘くはないが、成果は出る。たしかにFlovaのおかげで大幅に制作時間を短縮できた。普段はミュージックビデオ1本に1週間から10日ほどかかるのだが、それがわずか3日で済んだ。でも、本当に楽ができたのか、いまひとつ実感がない。

Flovaで何ができ、どう便利になったのか。そして何が変わらなかったのか。Flova導入前後の作業を比較しながら、楽できた気がしない理由を探ってみたい。


これまでのMV制作の流れ

普段のミュージックビデオ制作は、ChatGPTで歌詞を作り、Sunoで楽曲を生成。その後、動画生成に着手する。具体的には以下のような流れだ。

自力MV制作の流れ
1.ストーリーを考える
2.字コンテを制作(ChatGPT)
3.キーフレームとなる画像を生成(ChatGPT/Nano Banana Pro)
4.動画クリップを生成(Sora/Veo)
5.Premiere Proで動画編集

具体的な制作時間は、ストーリーと字コンテを考えるだけで1~2日ほどかかる。ChatGPTは歌詞こそ理解できても、音楽分析はできない。そのためどんなシーンを盛り込むか、自力で考える必要があるのだ。もちろん、ChatGPTに相談して候補を出させることもできる。それでも自力でひねり出す感じがハンパない作業だ。

画像生成と動画生成、これは4~5日かかる。字コンテの内容を一度すべて画像にして、その画像から動画を生成する。いきなり動画を作るより、Image to Videoで作ったほうが想像したものに近づけやすい。このとき各動画クリップは10秒を選び、長めに作っておく。こうすると1本のクリップからおいしいところを複数箇所切り出せるからだ。

最後の動画編集は1~2日で済む。僕が作るミュージックビデオは長くても4分、たいていは2~3分なので、1日作業すれば一応形になる。

こうしたミュージックビデオ制作を、FlovaというAIエージェントでどう効率化できるのか?

Flova導入のMV制作の流れ
1.ストーリーを考える(自動)
2.字コンテを制作(自動)
3.キーフレームとなる画像を生成(自動)
4.動画クリップを生成(自動)
5.Premiere Proで動画編集(手動)

具体的には、先の手順1.~4.をFlovaが自動的に作業し、ミュージックビデオを完成させてくれる。使い手がそれなりに関わるが、一応自動処理といっていいだろう。前もって字コンテやシナリオを用意すればそれを反映してくれるし、足りないところはFlovaが歌詞や音楽を解析して適切に補ってくれる。論より証拠、Flovaで作ったミュージックビデオを見てほしい。先に結論を伝えておくと、「叩き台としては十分、ただし仕上げは必須」だ。


Flovaで何ができるのか?

Flovaで作ったミュージックビデオを見て、どんな感想を抱いただろう。AIにお任せでこれができるならいいじゃないか。そう思ったかもしれない。しかし、動画制作者からの観点では、冗長なシーンが多く、物理法則を無視したアクションが目立ち、さらにはリップシンクの前後にブラックアウトまである。

叩き台にはなるけど、このままでは公開できない。

いやそれでも、叩き台になるだけいいじゃないか。そういう見方もあるだろう。幸い、Flovaで作った映像は、Premiere Proのプロジェクトファイルとして出力可能だ。Premiere Proに読み込み、クリップを入れ替えたり、新しい動画を足したり、自由に再編集できる。

むしろ、Flovaで叩き台を作って再編集、これこそが王道だ。

ただそれでも、Flovaの実作業を思い返すとその恩恵を素直に受け入れられない自分がいる。とりあえず、Flovaでの実作業を見てほしい。最初に以下のものをFlovaに読み込ませた。

Flovaに読み込ませた情報
楽曲(Suno)
メインキャラクターの画像(ChatGPT)
最低限必要なシーンのメモ
歌詞(セクションごとにシーンを付記)

わかりやすくいうと、曲と歌詞とキャラ画像、あとはどんな映像にしたいかの簡単なメモ、といったところだ。Flovaはこれらの情報を分析し、曲に合わせて必要なシーンを考えてくれる。要は字コンテを勝手に作ってくれるのだ。これはかなり助かる。

このコンテにそって、実際の動画生成がはじまる。はじめにキーフレーム(動画の基点となる画像)を生成し、その後キーフレームをベースに動画を作る。

キーフレームからの動画生成、これを延々と繰り返す。

画像と動画の作り直しはいつでも可能。過去のシーンに遡って修正することもできる。修正後はちゃんと最新ポイントに戻ってくれるので、作業が迷子になることはない。また、シーン内容がいまいちなら、別のシーンを提案させることもできる。このあたりはChatGPTやGeminiと同様、チャットベースで適宜相談しながら作業を進めていく。

生成した動画はタイムラインに並べられるため、動画編集の経験がある人なら直感的に理解しやすいインターフェースだ。修正する際は、直したい画像や動画の「引用」ボタンをクリックし、どのように修正したいかチャット欄に書き込めばいい。あとは自動で差し替えてくれる。AIエージェントなのでいくぶんアプリっぽい操作が必要になるが、実作業はチャットなので思うがままに指示を出せばいい。と、ここで、衝撃の事実をお知らせしよう。

3分のMVを作るのに、Flovaで総計14時間かかった。

自力だと3~5日分の作業を、Flovaならたった14時間で済んだ。そう考えるべきか、率直に「14時間もパソコンに貼りつくとか勘弁」と音を上げるか、人それぞれだろう。僕の場合は圧倒的に後者だ。

考え続ける緊張感がハンパないからだ。

Flovaで画像および動画を生成すると、「これでいいか?」と訊いてくる。OKと返事をすれば次の作業に進み、変更や修正をしたい場合はその旨を伝える。つまり、すべてのステップで判断が求められる。画像を1枚作るたびに、動画を1本生成するたびに、「これでいいですか」「どこを直しますか」「再生成したので確認してください」と、いちいち判断を強いられる。そして判断のために考え続けなければならない。

それが14時間ぶっ通しで続くのだ。

もちろん、自力で字コンテや動画生成する際も、その都度判断が求められる。どんなシーンにするか、できあがった動画のダメ出しをどう言語化するか。作業とはすなわち考えることだ。しかし、これらの作業はマイペースにできるし、そもそも自分で考えた内容について画像や動画を作っていくわけだから、具体的なことをイメージしやすい。

一方、FlovaはAIが自動で作ったシナリオにそって生成する。できあがったものがいいのかダメなのか、そんなの考えたAIが判断してくれよ、と愚痴りたくもなる。ちなみに、丸投げもできるのだが、それが作品クオリティに影響するのは言うまでもない。

判断はどこまでいっても人間の作業だ。

集中的に判断を求められるのは、生身の人間にはなかなか堪える。この疲労感こそが「Flovaなら楽できる」を肯定できない理由のひとつだ。数日かかる作業が14時間で済むのだから、効率的かつ利便性の高いAIエージェントであることは間違いない。ただ、それが使い手である人間にとって、楽かどうかは別の話だ。


リップシンクは地獄の入口

そしてもうひとつ落とし穴があった。それはリップシンクだ。音楽に合わせて口パク動画を作ってくれるアレ。Flovaは適宜リップシンク(口パク)も差し込んでくる。そこまではいい。問題は、別のシーンを直しただけでリップシンクがズレるのだ。やむなくリップシンクを合わせるように指示を出す。当該部分はちゃんと合うのだが、今度はそれとは別のリップシンクがズレる。さらにはプレビューで合っているのにエクスポートするとズレることも。

ひとつ直すとひとつずれ、修正が永遠に終わらない。

5回ほどリップシンクの修正を繰り返し、さすがに頭にきた。「すべてまとめて修正しろ!」と一喝。すると意外なことに、一発ですべてのリップシンクがバッチリ合った。やるなFlova! これが罠だった。

前後がブラックアウトするのだ。

完成したミュージックビデオのプロジェクトファイルを、Premiere Proで開く。すると、リップシンク部分の前後がブラックアウトしていた。リップシンクを合わせるためにクリップの位置を微調整し、その調整した部分がブラックアウトしているのだ。

リップシンクを直したら、当然リップシンク前後のクリップも微調整してくれるものと考えていた。実際にはリップシンクシーンを動かしただけで、前後のクリップは調整されない。

まったく、やっつけ仕事っぷりがひどい。


結局、Flovaはアリなのか?

ここで、Flovaを導入したワークフローを見ていこう。

Flova導入のMV制作
1.Flovaで叩き台となるMVを制作
2.生成AIで追加素材を生成
3.Premiere Proで動画編集

Flovaで作ったミュージックビデオをPremiere Proに読み込み、仕上がりを確認する。この時点で、冗長なシーン、物理法則を無視したアクション、ブラックアウトなど、不具合をチェックし、追加素材を用意する。これはFlovaで追加生成して書き出してもいいし、別の生成AIを使ってもいい。今回はKlingでクリップを生成した。

ひと通り素材が揃ったら、Premiere Proで本格的に編集していく。クリップの差し替え、微調整、トランジションの追加などを行い、公開しても恥ずかしくない品質に仕上げる。こうして完成したのが以下のミュージックビデオだ。

このミュージックビデオが、Flovaを導入したことでわずか3日で完成した。これまでは音源を元に7~10日ほどかかっていたことを思うと、半分以下の時短に成功している。ただ先に述べたように、Flovaの導入は集中的に判断を強いられる。時短はできるけど、楽ができるわけではない。むしろ判断の密度が上がり、疲労感が募る。

つまり、Flovaはスパルタなのだ。

成果は出してやる。だからお前も働け、と。われわれ人類は、AIは人間が楽をするためのツールととらえている。Flovaはその認識から微妙にズレた立ち位置のAIエージェントだ。タクシーに乗ったら自転車のペダルがあり、「さあお客さんもご一緒に」とドライバーが微笑む。

すごく疲れた。それがFlovaを使った感想だ。

制作作業を大幅に短縮できたのだから、今後もFlovaを使うことになるだろう。このアドバンテージを知ってしまった以上、使わない手はない。短時間で叩き台がほしい、動画編集前提の叩き台でいい、そういう人にはきっと役立つはずだ。ただ、使い出すときに相応の覚悟がいる。

また14時間の地獄が待っているのか、と。

なお、クレジットは湯水のごとく消えていく。課金は計画的に。僕はもう心が壊れているのでジャブジャブ使うけど。

いいなと思ったら応援しよう!

澤村 徹 記事がおもしろかったら応援していただけると幸いです。オールドレンズ、デジタル赤外線写真、AIアートなど、記事や作品制作の活動費して使わせていただきます。