見出し画像

動画を作ったことがなくても、AI VTuberのデモ動画は作れる。月白ねむで試した制作パイプライン


今回の月白ねむは、ゼロからLive2Dモデルを作ったわけではありません。

ベースにしたのは、SnowBear Projectで購入したVTuber / Live2Dモデルです。

SnowBear Project「兔兔2.0」
https://snowbearpro.booth.pm/items/7877174

つまり、最初から「絵が描ける」「Live2Dを作れる」必要すらありません。

BOOTHなどで気に入ったモデルを購入して、そこにキャラクター設定・声・会話・演出を足していけば、AI VTuberのデモまで持っていけます。

もちろん、自分で描いたキャラクターやオリジナルLive2Dモデルでも同じ流れを使えます。

難しいのは、キャラクターを用意した後です。

そのキャラを「喋らせて、動かして、魅力が伝わる動画にする」となると、急にハードルが上がります。

台本、音声、モーション、動画編集、BGM、テロップ、演出。

Premiere ProやAfter Effectsを触ったことがない人にとっては、キャラクターを作ることより「動画として見せること」の方が難しいかもしれません。

そこで今回、AIうさぎVTuber「月白ねむ」の約76秒のデモ動画を、できるだけ動画編集ソフトに依存せず、AIとコードで組み立てる制作パイプラインとして作ってみました。

狙っているのは、単に1本のPVを作ることではありません。

絵師やキャラクタークリエイター、あるいは購入したVTuberモデルから始める人でも、キャラ素材と設定を持ち込めばAI VTuberのデモ動画を作れる仕組みにすることです。


先に結論:いきなり動画を生成しない

今回いちばん効いたのは、最初から動画生成AIにプロンプトを投げなかったことです。

まず構成を決めて、GPT Image 2.5で絵コンテの全カットを静止画として生成しました。

今回の絵コンテは約75秒・25カット。

主要カットだけではなく、25カット全部について「この瞬間はこう見える」という画像を先に作っています。

これをやると、

  • キャラクターの見え方

  • カメラ位置

  • 背景

  • 表情

  • テロップの位置

  • 前後カットのつながり

  • どのカットに動画生成コストをかけるべきか

を、動画を1本も生成する前に確認できます。

動画生成は静止画生成より高価で、待ち時間も長い。

だから先に全コマを画像で出して、映像を作る前に映像の設計を終わらせる方が圧倒的に楽でした。

動画生成を始める前に、ほぼ一本の漫画として完成形を見る。

そんな感覚です。


制作フロー全体

購入したLive2Dモデル / 自作キャラ / 3Dキャラ
        ↓
キャラ設定・口調
        ↓
台本と約25カットの構成
        ↓
GPT Image 2.5で全カットの絵コンテ画像を生成
        ↓
Higgsfieldで動画化
        ↓
Aivis CloudでTTS
        ↓
Live2D素材と組み合わせる
        ↓
JIZURAで文字演出
        ↓
Opus 5.5でモーション・映像演出
        ↓
Remotion + Three.jsで統合
        ↓
完成動画

ポイントは「動画を編集する」というより、

先に設計を固めて、各工程に向いているAIへ素材を流していくこと。


今回使ったモデル・ツール

役割使用したもの
VTuberモデル:SnowBear Project「兔兔2.0」

AI VTuberの返答生成:Gemini表情・動作の判断JEV(TypeSafe AI)

絵コンテ全カット生成:GPT Image 2.5

動画生成:Higgsfield
主要カットの高速生成:H3 Max
全体の低コスト仮出し:Seedance
高品質な仕上げ:H3

TTS:Aivis Cloud

モーション・映像演出:Opus 5.5

BGM:Suno v6

文字モーション:JIZURA by 852話(hakoniwa)さん / @8co28

動画生成・編集Remotion 43D演出Three.js / @react-three/fiber


1. まずVTuberモデルを用意する

今回の月白ねむでは、SnowBear Projectの「兔兔2.0」をBOOTHで購入しました。

https://snowbearpro.booth.pm/items/7877174

AI VTuberを試すために、最初から

  • イラスト発注

  • パーツ分け

  • Live2Dモデリング

まで全部やる必要はありません。

まず既製のVTuberモデルを購入して、

  • どんな性格にするか

  • どんな声にするか

  • 視聴者にどう返すか

  • どんな世界観で見せるか

を後から決めてもいい。

自作キャラクターがある人はもちろんそれを使えばいいし、まず試したい人は購入モデルから始める。


もう一つの入口:1枚絵からTripoで3D化する

Live2Dモデルを買うルートとは別に、かなり面白い入口があります。

キャラクターの1枚絵から、Tripoで3Dキャラクターを作るルートです。

Tripo
https://www.tripo3d.ai/

例えば、

キャラクターの1枚絵
        ↓
Tripoで3D化
        ↓
リギング
        ↓
Blender / Unityなどで調整
        ↓
AI VTuberの3Dアバターへ

という流れ。

つまり、AI VTuberを始める入口がかなり増えています。

とにかく早く試したい
→ BOOTHなどでLive2Dモデルを購入

自分の2Dキャラを動かしたい
→ オリジナルLive2D

1枚絵から3Dキャラにしたい
→ Tripo

今回の月白ねむ自体は購入したLive2Dモデルを使っています。

ただ、今後3Dキャラクターまで同じ制作フローに載せるなら、TripoのようなImage-to-3Dはかなり面白い選択肢です。

「VTuberを作るには、まずLive2Dモデリングを発注しないといけない」

という前提自体が、だいぶ崩れてきています。


2. キャラ設定を先に固める

月白ねむの場合は、

  • 「口は強い。顔は正直。」

  • 毒舌・皮肉・たとえ話で先にからかう

  • 言い返されると照れたり、図星で詰まったりする

  • 看板企画は「ねむに一言、言い返して。」

というルールを先に決めています。

動画技術より先に、キャラの解像度を上げる。

ここがかなり重要でした。


3. GPT Image 2.5で「全コマ」を先に作る

今回、絵コンテを文章だけで終わらせず、全25カットをGPT Image 2.5で画像にしました。

台本
↓
25カットに分割
↓
全25カットをGPT Image 2.5で静止画にする
↓
並べて、流れ・構図・表情を確認
↓
動画化するカットを決める

ここが動画制作未経験者には特におすすめしたいところです。

例えば、

  • 月を背負ってキャラが登場する

  • コメントが画面奥から飛んでくる

  • 言い返されて一瞬固まる

  • 「閉店。」で画面が閉じる

  • 最後にプロフィールへ切り替わる

という流れを、全部静止画で並べて確認します。

すると動画生成する前に、

「このカットはいらない」

「この表情は違う」

「この構図の方が強い」

と判断できます。

動画を作ってから直すのではなく、

画像の段階で失敗する。

これだけでかなりコストを抑えられます。


4. 動画生成はHiggsfieldでモデルを使い分ける

動画生成はHiggsfieldを中心に使いました。

ここで面白かったのは、1つのモデルですべてを作る必要がなかったことです。

H3 Max:速いので、主要カットを何案か出す

H3 Maxは生成が速い。

なので、

  • 冒頭の登場

  • キャラクターの見せ場

  • 感情が大きく動く場面

など、方向性を早く決めたい主要カットに使います。

「この登場シーンを3案くらい見たい」

「この照れ方、何パターンか比較したい」

というときに、短時間で候補を並べられます。

重要なカットほど、一発で決めるより比較した方が判断しやすい。

Seedance:安いので、全体を一度動かす

Seedanceはコストを抑えやすいので、絵コンテ全体を一度動画にしてみる用途に向いていました。

今回の流れは、

GPT Image 2.5で全25カットを画像化
↓
Seedanceで安く一度動画化
↓
全部つなげる
↓
テンポを見る
↓
弱いカットを洗い出す

です。

静止画では良く見えても、実際に動かすと、

「このカット長いな」

「ここは別に動かさなくてもいいな」

「ここだけもっと強い映像が欲しい」

ということが出てきます。

Seedanceは、そのラフ動画を作るのに向いていました。

H3:最後に重要カットを仕上げる

全体を一度見てから、本当に重要なところだけH3で仕上げます。

つまり、

H3 Max
↓
主要カットを高速で何案か出す

Seedance
↓
全体を安く一度通す

H3
↓
最後に重要カットを高品質で仕上げる

という三段階です。

全25カットを最初から高品質モデルで何度も回す必要がなくなります。


5. Aivis CloudでTTSを作る

声はAivis Cloudを使いました。

Aivis Project
https://x.com/aivis_project

今回のデモでは、Aivis CloudをTTS(Text-to-Speech)として使っています。

台詞を入力して音声を生成し、各カットに配置します。

今回使用したのは「まお / おちつき」の声です。

ここも大きなポイントで、リアルタイム配信環境が完成していなくても、

「このキャラがこの声で、この台詞を言ったらどう見えるか」

を先に確認できます。

AI VTuber本体と、宣伝用デモ動画は分けて作っていい。

この考え方にするとかなり楽です。

また、次はGemini 3.8 TTSのVoice Designも試してみたいと思っています。

声をプロンプトで設計できれば、キャラ設定から声まで一気通貫で作れるようになるかもしれません。


6. Live2Dは「実際の配信姿」を見せる

AI生成動画だけでPVを作ることもできます。

でもAI VTuberの場合、

「実際に配信するとどう見えるか」

も重要です。

そこで会話部分ではLive2D素材を使いました。

  • 喋る

  • 目線を変える

  • 表情を変える

  • 照れる

といった配信中の姿を見せます。

一方、

  • 登場

  • キャラクター紹介

  • 感情の大きな見せ場

にはHiggsfieldの生成映像を差し込みます。

配信している姿
→ Live2D

PVとして強く見せたい場面
→ Higgsfield

という分担です。

これで、AI VTuberとしてのリアリティと、PVとしての華やかさを両立しやすくなります。


7. Opus 5.5でモーション・映像演出を組む(文字演出はJIZURA)

素材を生成しただけでは、まだPVにはなりません。

実際に一本の映像にするには、

  • どの瞬間に映像を出すか

  • どこでカメラを寄せるか

  • どこで画面を切り替えるか

  • コメントをどう飛ばすか

  • 文字をどこで出すか

  • BGMのどこに合わせるか

といった演出設計が必要になります。

今回はこの部分をOpus 5.5と一緒にかなり詰めました。

その中で、文字演出にはJIZURAを使っています。

JIZURAは852話(hakoniwa)さん(@8co28)が公開している文字モーションの仕組みです。

今回の動画では、

  • 「月白ねむ」という名前の登場

  • 「ひと言多い切り返し。」という決め台詞

など、強調したい場所に絞って使っています。

全部の字幕を派手にするのではなく、

「ここだけ強く見せたい」

ところだけJIZURAを使う。

この組み合わせがかなり良かったです。

生成AIで素材を作れるようになった次に来るのは、

「素材をどう演出するか」もAIに任せる

流れだと思っています。


8. Remotion + Three.jsで最後に統合する

最後の統合はRemotionで行いました。

RemotionはReactで動画を作れるフレームワークなので、

  • 何秒目にどの映像を出す

  • 字幕をどこに置く

  • BGMのどこで切り替える

  • コメントカードを奥から飛ばす

  • パネルを3D空間に浮かべる

  • JIZURAの文字演出を差し込む

といったことをコードとして管理できます。

3D部分はThree.js / @react-three/fiberを使っています。

今回作ったのは、

  • 月と星の3D空間

  • 奥から飛んでくるコメント

  • 立ち上がる床のグリッド

  • 「閉店。」で閉じるシャッター

  • キャラクター映像が浮かぶ3Dパネル

  • 月と軌道リングのエンドカード

など。

一度テンプレートにしてしまえば、次のキャラクターでは素材と文章を差し替えてかなり流用できます。


なぜこの方法が面白いのか

以前は、「VTuberを作りたい」と思ったら、

  • 絵を描く

  • Live2Dを作る

  • 声を用意する

  • 配信環境を作る

  • 動画編集を覚える

  • PVを作る

という、かなり広いスキルが必要でした。

でも今は、

VTuberモデル
→ 買える

3Dキャラクター
→ Tripoで1枚絵から作るルートもある

声
→ Aivis Cloud

絵コンテ
→ GPT Image 2.5

動画
→ Higgsfield

モーション・映像演出
→ Opus 5.5

文字演出
→ JIZURA

編集
→ Remotion

まで分解できます。

つまり必要なのは、

全部の技術を自分で習得することではなく、どんなキャラクターを作りたいかを決めること

に近づいています。


最終的にはもっと簡単にしたい

現状はまだ、Remotionなどを扱える人が横にいた方が楽です。

でも最終的には、

1. VTuberモデルを入れる
2. 性格・口調を書く
3. 声を選ぶ
4. 30秒 / 60秒 / 90秒を選ぶ
5. 「生成」を押す

だけで、

  • 台本

  • 全カットの絵コンテ

  • 動画素材

  • TTS

  • Live2Dデモ

  • モーション

  • 文字演出

  • BGM

  • 3D演出

  • XやYouTubeに載せられる完成動画

まで出る形にしたい。

キャラクターを作れる人が、動画を作れないせいで発表できない。

この壁はかなり消せると思っています。


AI VTuber以外にも使える

この仕組みはAI VTuberだけに限りません。

  • オリジナルキャラクターのPV

  • Live2Dモデルのポートフォリオ

  • イラストレーターのキャラ紹介

  • ゲームキャラクターのティザー

  • 同人キャラの告知映像

  • 音声作品のキャラクターPV

にも近い考え方を使えます。

絵を描く力と、映像を作る力を同じ人が持っている必要はない。

AIと生成系ツールの組み合わせで、

「キャラクターを生み出せる人」が、そのまま「キャラクターを動かして発表できる人」になる。

今回試したかったのは、そこです。


まだ未完成な部分

今回の仕組みを誇張しないため、未完成なところも書いておきます。

  • 今回の約76秒のデモは台本・演出指定による収録です

  • JEVがリアルタイムにすべて判断した配信映像ではありません

  • Higgsfield上では複数の動画生成モデルを使い分けています

  • 全カットを同じモデル・同じ品質で一発生成したわけではありません

  • Tripoは今回の月白ねむ制作では使用していません

  • 現時点では完全なノーコードではありません

  • Remotion側を扱える人はまだ必要です

それでも、Premiere ProやAfter Effectsを一から覚えなくても、

「キャラクターを動画として見せる」

ところまではかなり短くできました。


これから

次にやりたいのは、このパイプライン自体をテンプレート化することです。

キャラクター素材と設定を渡す。

するとAIが、

絵コンテを作る
↓
全カットの画像を作る
↓
Higgsfieldで必要な動画を生成
↓
TTSを生成
↓
Live2D素材を配置
↓
Opus 5.5でモーション・映像演出を設計
↓
JIZURAで必要な文字演出を入れる
↓
Remotionで統合
↓
完成動画を書き出す

ところまでやる。

動画制作経験のない絵師やクリエイターでも、

「このキャラが動いたらこんな感じ」

をすぐ公開できる。

そこまで持っていければ、AI VTuberを作る人だけでなく、キャラクターを作るすべての人に使える制作基盤になると思っています。


月白ねむは、Gemini・JEV・Live2D・音声合成を組み合わせたAI VTuberの試作キャラクターです。

今回のリリース動画は台本付きデモであり、リアルタイム自律配信の記録ではありません。

使用モデル

SnowBear Project「兔兔2.0」
https://snowbearpro.booth.pm/items/7877174

TTS

Aivis Project / Aivis Cloud
https://x.com/aivis_project

文字演出

JIZURA by 852話(hakoniwa)さん
X: @8co28

参考:1枚絵から3D化

Tripo
https://www.tripo3d.ai/

いいなと思ったら応援しよう!

この記事が参加している募集