
再生成7回が、1回になりました。──動画生成AIに足りなかったのは、腕ではなく「台本」でした
「なんかイメージと違う」。動画生成AIを触った人が、必ず一度は口にする言葉です。私も深夜、たった30秒の動画を7回作り直しました。自分の腕が悪いのだと思っていました。違いました。足りなかったのは、紙に書いた6行の台本です。それを先に書いた翌朝、生成は1回で狙いに命中しました。この記事では、その6行の書き方と、明日そのまま使えるプロンプトを5本お渡しします。

「なんかイメージと違う」が止まらない
動画生成AIを触りはじめて一週間ほどで、ほぼ全員が同じ壁にぶつかります。ご相談を受けていて驚くのは、出てくる症状が業種を問わずほとんど同じことです。
一つめ、人物の顔がカットごとに別人になる。同じ人物のつもりで6カット作ったのに、並べてみたら六人の他人が順番に出てくる。
二つめ、頼んでもいないのにカメラが勝手に動き回る。静かに座っている絵がほしいだけなのに、なぜか被写体のまわりをぐるぐる旋回されます。
三つめ、尺が合わない。伝えたい一言が最後まで入りきらず、いちばん大事な結論が画面の外にこぼれ落ちる。
そして四つめが、いちばん心が折れます。直せば直すほど、最初に頭の中で見えていたイメージから遠ざかっていく。語尾を変え、単語を足し、また生成する。ひとつ良くなると、別のどこかが崩れる。
この四つに、心当たりのない方はほとんどいないと思います。ここで多くの人が「うちには映像のセンスがない」「もう少しAIが賢くなるまで待とう」と結論づけて、そっとタブを閉じます。
でも、出てくる映像が悪いのではなく、指示の形がまだ映像になっていないだけです。AIは「察して」くれません。足りないのは腕でも予算でもなく、指示の解像度だけです。
原因は、大きく三つに分けられます。
一つめ、頭の中の絵が、言葉になっていない。「かっこいい感じで」は指示になりません。AIが撮れるのは、目に見えるものだけだからです。「かっこいい」は人の感想であって、カメラには写らない。ここを言い換えられるかどうかで、一本目の出来が決まります。
二つめ、一つのプロンプトに詰め込みすぎ。5秒の中に動作が三つあると、必ず破綻します。「歩いて、座って、笑う」は、これで3カット分です。人間の脳は5秒でそれくらい想像できてしまうので、つい書いてしまう。AIは律儀に三つとも5秒に押し込もうとして、結果、どれも中途半端になります。
三つめ、一貫性を固定する情報がない。毎回ゼロから書けば、毎回ちがう世界が新しく生まれます。顔も服も光も揃わないのは、当たり前のことをAIが正確にやっているだけです。
裏を返すと、この三つは全部「書き方の型」だけでつぶせます。センスも機材も、追加の予算も要りません。実際、私が最初にこれを痛感したのは、自社の30秒の告知動画でした。
深夜1時、私は同じ30秒を7回作り直しました
去年の秋、自社のセミナー告知を動画にしようと思い立ちました。30秒、スマホの縦画面。伝えたいことは一つ、「経営者が自分でAIを触る場をつくりました」。たったこれだけ。
夜9時に始めて、30分で終わるなと思っていました。プロンプトに「経営者が朝のオフィスでノートPCを開く、かっこいい感じで、実写風」と書いて、生成ボタンを押しました。
出てきたのは、見たこともない外国人男性が、真っ白な部屋でタブレットを撫でている映像でした。悪くない。悪くないのですが、私が見せたいのは日本の中小企業の社長の朝です。
「日本人男性」と足しました。今度は20代の若者が出てきました。「40代」と足しました。カメラが意味もなくぐるぐる回りはじめました。「カメラは固定」と足しました。すると人物が微動だにせず、5秒間ただ座っているだけの映像になりました。

そこからが本番でした。私は語尾を変え、形容詞を足し、順番を入れ替え、盛るたびに映像が頭の中の絵から遠ざかっていくのを見ながら、それでもあと一回だけと言い聞かせて生成ボタンを押し続けていました。
「シネマティック」「上質」「信頼感のある」。単語だけが増えていきます。気がついたら深夜1時、生成回数は7回。できあがった動画は、正直に言えば1本目とたいして変わりませんでした。
翌朝、私はプロンプトの画面を閉じました。代わりにノートを開いて、30秒で何をどの順番で言うのかを、手で書き出しました。

書いたのは、6行です。
0〜5秒、結論。「社長が自分でAIを触る場をつくりました」。5〜10秒、課題。「社員に任せても、判断のところで止まる」。10〜15秒、原因。「決める人がAIを触っていないから」。15〜20秒、解決。「週1回60分、社長本人が手を動かす」。20〜25秒、証拠。「会議資料をつくる時間がはっきり減りました」。25〜30秒、行動。「詳細はプロフィールから」。
書き終えるのに10分もかかりませんでした。前の晩の4時間は、いったい何をしていたのだろうと思いました。
いま思えば、私は「どんな映像にするか」ばかり考えていて、「何を言うか」を一度も紙に書いていませんでした。頭の中にはあった気がします。あった気がするだけで、言葉になっていなかった。だから毎回ちがう言い方でAIに渡していて、AIは毎回ちがう解釈を返してきていた。噛み合うはずがありません。
そのうえで、カット1の一行だけを動画生成AIに渡しました。
「40代男性の経営者、紺のジャケット、落ち着いた表情。ノートPCを閉じて、立ち上がる。正面固定から、ゆっくり寄る。朝のオフィス、窓からの逆光、背景ぼけ、実写風。5秒、等速。」
一発でした。前夜の7回が何だったのかと思うくらい、狙った絵がそのまま出てきました。残りの5カットも、同じ書き方でほぼ一度ずつ。
使ったサービスも、契約プランも、前夜とまったく同じです。変わったのは、AIの性能でも私のセンスでもなく、渡した情報の形だけでした。前の晩に書いていた「かっこいい感じで」を、「紺のジャケット」「窓からの逆光」「正面固定」に置き換えた。やったことは、本当にそれくらいです。
同じことを、ご支援先でも何度も見ています。ここから先は、複数の支援先での相談を、1社のモデルケースとして再構成しています。
注文住宅の工務店、社員42名。H社長から「完成見学会の告知を30秒の動画にしてSNSに出したい」とご相談をいただきました。販促担当の方が、夜な夜な動画生成AIと格闘しているとのことでした。
見せていただいたプロンプトは、私が深夜に書いていたものとよく似ていました。「新築の家、家族が幸せそう、あたたかい雰囲気で、おしゃれに」。生成された映像は、毎回ちがう家、毎回ちがう家族、毎回ちがう季節でした。
「もう20回は作り直しました」と担当の方はおっしゃいました。夜の残業時間を、まるごとそこに溶かしていたそうです。「センスがないんです」とも。センスの話ではなく、この動画で何を先に言うかが決まっていなかっただけです。実際、H社長に「見学会で、いちばん見てほしいものは何ですか」と伺うと、即答でした。「断熱です。夏に来ていただければ、玄関を入った瞬間にわかります」。
その一言が、カット1になりました。「玄関を入った瞬間、夏でも涼しい家です」。決まっていなかったのは映像ではなく、社長の頭の中にしかなかった一言を、誰も紙に書いていなかったことでした。
担当の方は、社長のその答えを聞いた瞬間に「ああ」と声を出されました。ご本人いわく、「幸せそうな家族」を撮ろうとしていたのは、他社の告知動画がそうだったからだそうです。真似ていたのは映像であって、伝えたい中身ではありませんでした。ここが揃っていないと、どれだけプロンプトを練っても、出てくるのは「よそでも見た30秒」になります。
動画は3つの層で設計する
ここからが本題です。
映像制作の現場には、昔から絵コンテという道具があります。何を伝えるかを決めた台本があり、それを何カットに割るかを描いた絵コンテがあり、その一枚ごとに「どう撮るか」の指示が書き込まれている。プロは必ず、この順番で上から下へ降りていきます。動画生成AIに渡すプロンプトは、この一番下の階にあたります。
つまり、動画は3つの層で設計します。
台本層。何を伝えるか。 30秒で言い切る主張と、結論と、順番を決めます。
カット層。何を映すか。 30秒を6カットに割り、1カットに1メッセージだけ載せます。
プロンプト層。どう撮るか。 1カットを、5つの要素で言語化します。

決め手は、順番だけです。上の層が決まっていれば、下の層はただ書き写す作業になります。逆に、下から書きはじめると必ず作り直しになります。台本がないままプロンプトをいじり続けても、どこにも着地しないからです。私が深夜にやっていたのは、絵コンテのない現場で、カメラの位置だけを7回変えるような行為でした。
念のため書いておくと、これは文章生成AIへの頼み方が上手いか下手かという話ではなく、動画は層の順番の話です。プロンプトの語彙をいくら増やしても、台本層が空のままなら結果は変わりません。逆に台本層さえ埋まっていれば、プロンプトの語彙は貧しくても構いません。実際、私が一発で通した一文に、気の利いた表現は一つも入っていません。
もう一つ、この3層のいいところは、社内で分担できることです。台本層は社長が決める。カット層は営業と販促で相談する。プロンプト層は担当者が手を動かす。上の層が紙に残っていれば、担当者が変わっても同じ動画が出せます。全部を一人の「動画がわかる人」に背負わせなくてよくなる。ここが、会社としていちばん効いてきます。
台本層──30秒を6カットに割る
台本層でやることは、30秒を6カットに割ることです。ルールは三つだけ。
1カットは5秒まで。長いカットほど、AIは勝手に動きます。
1カットに1メッセージ。二つ言いたくなったら、カットを割ります。
冒頭2秒で結論。残りの28秒は、全部その理由と証拠です。
割り付けの型も決まっています。カット1(0〜5秒)つかみ、結論を言い切る。カット2(5〜10秒)課題、相手の困りごと。カット3(10〜15秒)原因、なぜそれが起きるのか。カット4(15〜20秒)解決、どう変わるか。カット5(20〜25秒)証拠、実例や数字。カット6(25〜30秒)行動、次の一歩。

この6行が書けた時点で、動画の8割は完成しています。絵コンテでいう台本が、ここで確定するからです。残りは、書き写す作業になります。
型に当てはめると、書けないところがはっきり見えるのも利点です。多いのは、カット5の「証拠」で手が止まる会社です。証拠が出てこないなら、それは動画の問題ではなく、商品の説明の問題です。そこに気づけただけでも、6行を書いた価値があります。
とはいえ、経営者ご本人が白紙から6行を書くのは、意外と手が止まります。そこで、AIに質問役をやってもらいます。次のプロンプトは、移動中にスマホの音声入力で答えるだけで6行が埋まるように作りました。社長ご自身が、車の中や新幹線で使う前提です。
あなたは30秒動画の構成作家です。私に一問ずつ質問し、答えを踏まえて30秒の台本を完成させてください。
【ここに商品・サービスの説明と、今回の動画の目的を貼る】
質問は「誰に見せるか」「何を一番伝えたいか」「見たあとどう動いてほしいか」の3点を、必ず1問ずつ順番に聞くこと。私の答えが曖昧なときは、具体例を2つ出して選ばせてください。
3問すべて終わったら、次の表だけを出力:
| カット | 秒数 | 言うこと(20字以内) |
条件:カット1〜6・各5秒。カット1は結論を言い切る。1カット1メッセージ。専門用語と評価語(すごい・便利など)は使わない。出てきた表は、そのまま「社内の誰が見ても同じ動画になる指示書」として使えます。担当者に「いい感じの動画つくっておいて」と投げる前に、この表だけ渡してみてください。作り直しの回数がはっきり変わります。
すでにサービス説明が1行にまとまっているなら、ヒアリングを飛ばして割り付けだけを任せられます。販促担当の方が、既存のチラシのキャッチコピーを貼って使う場面を想定したプロンプトです。
あなたは動画の構成作家です。以下のサービス説明1行を、30秒6カットの型に割り付けてください。
【ここにサービス説明を1行で貼る】
型:カット1つかみ(結論)/2課題/3原因/4解決/5証拠/6行動。各5秒。
出力は次の表のみ:
| カット | 秒数 | ナレーション(30字以内・話し言葉) | 映すもの(目に見えるものだけ) |
制約:1カットに動作は1つ。評価語を使わず、事実と数字で書く。表の下に、今回は削るべき欲張った要素を3行以内で指摘すること。出力された表は、そのまま次の工程の入力になります。ここで欲張った要素を削っておくと、あとの生成が驚くほど素直になります。担当者が1本目を作る前の10分で回してください。
プロンプト層──1カットを5要素で書く
台本と割り付けができたら、ようやくプロンプトです。ここで書くのは、形容詞ではなく、カメラに写るものだけ。順番も決まっています。
①被写体。誰が、何が。年齢・服装・表情まで。
②動作。何をするか。動作はひとつだけ。
③カメラ。固定/ゆっくり寄る/横に流す、のどれか。
④光と質感。朝の逆光、背景ぼけ、実写風など。
⑤尺と速度。5秒、等速。
絵コンテの一枚一枚に書き込まれている撮影指示が、まさにこの5要素です。読点で区切って、①から⑤の順に並べるだけ。実例が、私が翌朝に一発で通したあの一文です。
「40代男性の経営者、紺のジャケット、落ち着いた表情。ノートPCを閉じて、立ち上がる。正面固定から、ゆっくり寄る。朝のオフィス、窓からの逆光、背景ぼけ、実写風。5秒、等速。」
迷ったときは、要素を足すのではなく削ります。「おしゃれに」「エモく」「シネマティックに」は全部消す。消しても映像は悪くなりません。むしろAIが解釈に迷う余地が減って、狙いに近づきます。
③のカメラを三択に絞っているのも、意図があってのことです。カメラの動きは、書けば書くほどAIが張り切ります。「ドローンで俯瞰しながら回り込む」と書けば、そのとおり回り込んで、肝心の表情が見えなくなる。伝わる動画のカメラは、たいてい止まっています。迷ったら「固定」を選んでください。
⑤の「等速」も、意外と効きます。速度を書かないと、AIは勝手にスローモーションを混ぜてきます。5秒しかない画面で0.5倍速をやられると、動作が半分しか終わりません。
とはいえ、頭の中の絵を5要素の順番へ並べ替えるのは、慣れるまで手間です。ここもAIに任せられます。次のプロンプトは、日本語で書いたカットの内容を5要素の1文へ変換し、ついでに形容詞を検出して置き換え案まで出します。
あなたは映像ディレクターです。以下のカット内容を、動画生成AI用のプロンプトに変換してください。
【ここにカットの内容を日本語で貼る】
出力1:①被写体(年齢・服装・表情)②動作(1つだけ)③カメラ(固定/ゆっくり寄る/横に流す のいずれか)④光と質感⑤尺と速度、の順に読点でつないだ1文。
出力2:入力に含まれる形容詞(おしゃれ・エモい・かっこいい等)を箇条書きで列挙し、それぞれ「目に見える表現」への置き換え案を1つずつ。
出力3:動作が2つ以上ある場合のみ、カットを分割した案を表で。これは、台本を書いた社長ではなく、実際に生成ボタンを押す担当者の道具です。カットごとに1回ずつ、1本の動画につき6回使います。出てきた1文は、良かれと思って書き換えないでください。そのまま貼るのが一番強いです。
一貫性は、固定文で縛る
ここまでで、狙った絵は出ます。残る問題が、カットごとに顔と服と光が変わることです。
原因は単純で、毎回ゼロからプロンプトを書いているから。毎回ゼロから書くというのは、毎回ちがう世界を新しく生み出すのと同じです。顔も服も光も揃うわけがありません。
対策は、プロンプトを二つのブロックに分けることです。
固定ブロック(全カット共通)。世界観=朝のオフィス、実写風。画質=4K、自然光、背景ぼけ。人物=40代男性、紺のジャケット。
可変ブロック(カットごとに変える)。動作と、カメラ。この二つだけ。

そして、6カット全部の先頭に、同じ固定文をそのまま貼り付けます。ここが肝心で、固定文を一字でも書き換えたら、別人が出てきます。言い回しを整えたくなっても我慢して、コピー&ペーストで貼るのが正解です。同じ人物を何本もの動画で使い回すなら、参照画像とシード値もそろえて固定します。
絵コンテでいえば、固定ブロックは全ページの欄外に印刷された美術設定にあたります。毎ページ描き直す人は、プロの現場にはいません。設定は一度決めて、あとは全ページで共有する。当たり前のようですが、AIに向かうと、なぜかみんな毎回描き直してしまいます。
工務店の例で言えば、固定ブロックはこうなりました。世界観=夏の午後、木造の新築住宅、実写風。画質・光=4K、自然光、玄関からの逆光、背景ぼけ。人物設定=30代の夫婦と小学生の子ども一人、私服。この3行を6カット全部の先頭に貼っただけで、家も家族も季節も、6カットを通して揃いました。
固定ブロックは、一度作れば会社の資産になります。次の動画も、その次の動画も、同じ3行を貼るところから始められます。作るのは1回きりですから、AIに聞かれるまま答えて作ってしまいましょう。
あなたは映像の美術監督です。まず次の3点を、1問ずつ順番に聞いてください:撮影場所と時間帯/画質と光/登場人物の年齢・服装・表情。
【ここに動画のテーマと、台本6行を貼る】
回答が揃ったら出力:
■固定ブロック(3行・全カット共通)
世界観:/画質・光:/人物設定:
■カット1〜6のテンプレ(6ブロック)
各ブロックは「固定ブロック3行をそのまま複製+可変欄(被写体/動作/カメラ)」の形で、コピーして使える状態にする。
最後に注意書きを1行:固定ブロックは1文字も書き換えない。出力されたテンプレは、テキストファイルにして共有フォルダに置いてください。担当者が変わっても、同じ人物・同じ光の動画が出続けます。
最後にもう1本。ここまでの型を知っても、最初のうちは必ずうまくいかない一本が出ます。そのとき、どこを直すかは実は決まっています。うまくいかなかったプロンプトを貼るだけで、四つの失敗パターンのどれに当たるかを判定させます。
あなたは動画生成プロンプトの校正者です。以下のプロンプトを診断してください。
【ここにうまくいかなかったプロンプトを貼る】
判定は次の4パターンのどれに当たるか(複数可):
A 形容詞ばかりで、目に見えるものが書かれていない
B 1カットに動作が2つ以上ある
C 固定ブロックがなく、毎回ゼロから書いている
D 音・ナレーションを最後に考えている
出力:
| 該当 | 根拠となる箇所(原文を引用) | 直し方 |
表のあとに、直した完成プロンプトを1つだけ。解説は不要。これは、生成がうまくいかなかった直後に、担当者がその場で回すためのものです。3回も使えば、自分の書き癖が見えてきます。私はAばかり指摘されました。書けば書くほど良くなると思い込んでいたからです。失敗はセンスの問題ではなく、直す場所がいつも同じところに集中しているだけです。
変わったこと
私の場合、再生成の回数は7回から1回になりました。いや、正確に言うと、6カット中2カットは2回ずつ生成しています。それでも、30秒の動画1本にかかる時間は、深夜1時までの4時間から、朝の40分になりました。
大きかったのは時間よりも、気持ちの変化でした。作り直しを繰り返している間、私はずっと「自分には映像のセンスがない」と思っていました。台本を先に書いた朝、その思い込みが消えました。うまくいかなかったのは、手順を知らなかっただけだったからです。
副産物もありました。動画を1本つくるたびに6行の台本が残るので、それがそのまま社内の資産になります。次のセミナー告知は、前回の6行を開いて中身だけ差し替えるところから始まりました。ゼロからの4時間が、差し替えの20分になったわけです。
工務店のH社長のところでも、同じ変化が起きました。カット1が「玄関を入った瞬間の断熱」に決まってから、販促担当の方の手が止まらなくなりました。以前は「どんな映像にするか」から考えていたのが、「何を言うか」から考える順番に変わったからです。完成見学会の告知動画は、そこから数日で公開されました。撮影には行かず、事務所のパソコンだけで。
面白かったのは、社長ご本人の反応です。できあがった30秒を見て、「これ、うちが普段お客様に話していることそのままですね」とおっしゃいました。新しいことを言ったわけではなく、いつも口で言っていたことを、初めて紙に6行で書いた。それだけの違いでした。
いま振り返ると、作り直しになる原因は、次の四つに集約されます。
形容詞ばかり書いている。 → 目に見えるものだけを書く。光、服、角度。
1カットに動作が2つ以上ある。 → 動作の数だけ、カットを割る。
毎回ゼロからプロンプトを書き直している。 → 固定ブロックは貼るだけ。触らない。
音とナレーションを最後に考えている。 → 台本の時点で、秒数と言葉を決める。
この四つのどれかです。逆に言えば、直す場所は四か所しかありません。絵コンテの階層で言えば、上の二つはプロンプト層の問題、下の二つは台本層の問題です。どちらの層でつまずいているかがわかれば、戻るべき場所も決まります。
保存版としてまとめておきます。固定ブロックは3行(世界観/画質・光/人物設定)。可変ブロックは5つ(被写体/動作/カメラ/光と質感/尺と速度)。原則は三つ、30秒は6カット、1カットは1動作、固定文は触らない。この一段落を、社内の共有フォルダの先頭に貼っておいてください。
型は、中身が決まってはじめて動く
動画生成AIの話をしているようで、これは会社の伝え方の話です。
30秒で何を言うかが決まっていない会社は、動画をつくらせても決まりません。AIは、決まっていないことを決めてはくれません。逆に、6行が決まってさえいれば、映像はもう手の届くところにあります。技術ではなく、順番の問題だからです。
そしてこの順番は、動画以外にもそのまま効きます。会社案内も、採用ページも、朝礼の3分も、結局は「何を、どの順で言うか」が先にあって、見せ方はそのあとです。動画生成AIは、それが決まっていないことを、いちばん残酷にあぶり出してくる道具だと思っています。
余談ですが、あの6行、そのまま営業トークの台本にもなりました。
だから今日おすすめしたいのは、動画生成AIを開くことではなく、紙を一枚出して、いま社外に伝えたい30秒を6行書いてみることです。つかみ、課題、原因、解決、証拠、行動。書けなければ、そこが本当の課題です。書けたら、この記事の5本のプロンプトを上から順に使ってください。それだけで、明日には1本目が出ます。
6行が書けたら、あとは今日ご紹介した5本を順番に回すだけで、1本目までたどり着けます。ヒアリング、割り付け、5要素変換、固定ブロック、失敗診断。この並びを崩さないでください。上から下へ降りるからこそ、下の層が書き写す作業になります。
弊社でも、いま作りたい動画を洗い出すところから、台本の設計、1本目の生成までをご一緒することがあります。ただ、最初の6行だけは、必ずご自身に書いていただくようにしています。そこを代わりに書いてしまうと、会社の言葉ではなくなってしまうからです。

深夜1時の7回目より、朝の1回目のほうが、ずっといい映像でした。変えたのは、たった6行です。
あわせて読みたい
AIへの頼み事は、作文ではなく「採寸」でした。──聞き方の型を選べば、答えが変わる
https://note.com/comix_ceo162230/n/nbd7fbc3c66e5
AIの成果は指示ではなく仕組みで決まる——ハーネス・ループ・グラフの3つの設計術
https://note.com/comix_ceo162230/n/n1a0254e912ef
AIは「やっておいて」では動かない。人も同じだった。
https://note.com/comix_ceo162230/n/n1f776c33a824
鈴木章裕
株式会社コミクス 代表取締役