見出し画像

Claude Code(Opus 5.5)で82秒のAIアニメを作って測った、コンテキストを食う工程と減らすための決まり【実測】

YoutubeでAI VTuberユニット「アルトルタ」を開発している四ツ谷です。

AIエージェントのClaude Code(モデルはClaude Opus 5.5)に手伝ってもらい、82秒のAIアニメ「アルトルタの紅葉狩り」を3日で作りました。台本、音声、絵コンテ、静止画、動画、仕上げ、書き出しまでの作業をClaude Codeに進めてもらい、私は方向の判断と、出来上がった絵や動画への修正の指示を行いました。

長い制作をAIに任せていると、AIが一度の会話で覚えていられる量(コンテキスト)を使い切りそうになることがあります。そこで今回は、工程の節目ごとに使用量を測りながら作りました。この記事は、どの工程がコンテキストを食ったのかの実測と、減らすために決めたことの記録です。

まずは完成した動画をご覧ください。

この動画は MiniMax H3 で生成した AI アニメです(Powered by MiniMax H3)。BGMは「あの日見た景色」(こばっと/OpenTracks)です。

結論

  • 使用量は、台本・音声・絵コンテ登録までで約22万トークン(上限100万の22%)、静止画の工程が終わった所で約71万(71%)になり、そこで一度圧縮しました。圧縮のあとの会話は、動画16本と仮つなぎ1版目までで26%、完成・投稿までで70%になりました

  • 食ったのは、動画や画像を「作る」作業そのものより、AIが「調べる」ための読み込みと、「指摘を受けて直して見せる」往復でした(どちらも推定)

  • 減らすために決めたことは7つあります。ただし、同じ作業を条件を変えて比べていないため、減らせたと断言はできません。次の作品で同じ節目を測って比べます

前提

  • 使ったAI:Claude Code(モデルはClaude Opus 5.5。私の環境のコンテキスト上限は100万トークン)

  • 動画の生成:MiniMax H3(ローカル実行、ComfyUI)

  • 作品:アルトルタの紅葉狩り。完成の長さは82.46秒

  • 制作期間:2026年9月28日から30日までの3日間

「コンテキスト」とは、AIが一度の会話で覚えていられる量のことです。単位はトークンで、読み込んだファイルも、AIが書いた文章も、画像を見た分も、すべてここに積み上がります。上限に近づくと、会話を要約して続ける「圧縮」をするか、新しい会話に引き継ぐことになります。

Claude Codeには、コンテキストとは別に、一定時間ごとの利用枠の上限もあります。この記事で測ったのは、コンテキストのほうだけです。節目ごとに、そのときの使用量を確認して記録しました。

作ったもの

紅葉の山と並木道を舞台にした、アルトとオルタの短編アニメです。台詞は11行、台詞のない場面が2つ、動くエンディングカードが5秒、エンドカードが3秒で、合計82.46秒になりました。制作の中身は次のとおりです。

  • 静止画:延べ約110枚。そのほかに、後から作り直した分が15枚。私からの修正の指示は4回、延べ13件でした

  • 動画:延べ26本(静止画から動画を作る方式、1344×768)。1コマあたりの生成時間は1.0秒から1.6秒で、長いショットほど1コマにかかる時間が増えました

  • 仕上げ:高画質化のSeedVR2(7B)で15本、1,961コマを約23分

  • 往復:仮つなぎ(編集途中の確認用の動画)を6版、完成を3版作りました

台詞そのものの長さは、句読点や記号を含む文字数を5.2で割ると見積もれます。読み上げ音声(AivisSpeech)を測ると、前作の「アルトルタのお月見」で1秒あたり5.19文字、今作で5.24文字でした。今作の台本は、1秒7文字で全体を見積もって約60秒と考えていましたが、行間や冒頭、エンドカードの時間を含む実測は74.4秒でした。

どの工程がコンテキストを食ったか

制作中に測ったコンテキスト使用量の推移です。
上限は100万トークンで、静止画の工程が終わった71%の所で圧縮しました

グラフの数値です。

  • 台本・音声・絵コンテ登録まで:220,701(上限の22%)

  • 棒人形の下絵の初版まで:307,392

  • 背景と基準画まで:406,491

  • 静止画の1巡目まで:506,061

  • 静止画が全16枠そろうまで:706,056(71%)。ここで圧縮

  • 圧縮のあと、動画16本と仮つなぎ1版目まで:263,514(26%)。圧縮で引き継いだ要約ぶんを含む

  • 完成・投稿・記録まで:697,436(70%)

節目ごとの増え方は、絵コンテ登録から棒人形の初版までが約9万、背景と基準画までが約10万、静止画の1巡目までが約10万、そこから全16枠がそろうまでが約20万でした。各区間には、その工程以外の作業(記録づくりなど)も含まれるため、工程だけの値ではありません。

1. 立ち上げ(約22万)

台本・音声・絵コンテ登録までの約22万は、会話が約15万、道具(ツール)の定義が約5万、指示書やメモリー、スキルの読み込みが約2万でした。

今作は、前作の制作用プログラムをコピーして、作品名などを置き換える形で始めました。増えたのは、AIが前作の道具の作りを調べるために読んだ分だったと推定しています。置き換える場所を検索して218行の結果を表示したこと、READMEを全文(約120行)読んだこと、登録用のプログラムを全文(194行)読んだことなどです。

2. 静止画の工程(約48万)

静止画の工程では、使用量が22万から71万まで、約48万増えました。

この工程では、生成した絵を複数枚まとめた一覧図にして、AIに画像として読ませて確認します。一覧図1枚を読むのに3千から5千トークンかかると見ています(推定)。修正の指示のたびに一覧図を読み直すので、この回数が増えの主な原因だったと推定しています。

3. 動画以降(圧縮後の約43万)

圧縮のあとの会話は、動画16本と仮つなぎ1版目までで26%(要約ぶんを含む)、完成・投稿・記録までで70%になりました。この間に増えた約43万は、仮つなぎの手直し(2版目から6版目)と完成3版のたびに、私の指摘を受け、道具を直し、並べた図を読み、記録を書く往復が主だったと推定しています。

2つの会話の使用量を単純に足すと約140万ですが、2つ目の会話には要約ぶんが入っているため、重なりがあります(推定)。重なりを引いても、圧縮せずに続けていたら上限の100万を超えていたと見込まれます(推定)。

減らすために決めたこと

今作では、次の7つを決めて進めました。効果を比べる対照実験はしていないので、「効いた」とは書かず、「こうした」という記録として読んでください。

1. 作品ごとに変わる中身は、1つの表に書く

ショットの割り振り(どの台詞をどのカットにするか)や、動画の演技の指示文など、作品ごとに変わる中身を、プログラム内の表に集めました。AIはその表だけを書けばよく、道具のコードを読んだり直したりしません。

2. 道具は数字の要約を返し、画像は一覧図で見る

生成や点検の道具は、生のログではなく、数字の表や合否の要約を返す作りにしました。画像は1枚ずつではなく、複数を1枚にまとめた一覧図で確認します。動画も、数本を1枚の並び図にまとめて見ました(動画の工程では5枚)。

3. 調べものは絞る。同じファイルは2回読まない

検索は、件数だけを先に見てから、必要な節だけを読みます。同じファイルを2回読まなくて済むように、要点は作業状態の文書に書いて、そちらを読みます。

立ち上げの読み込みが多かったので、次の作品からは、前作の作業フォルダを新しい作品用に複製する道具(件数だけを表示する)を作りました。これで立ち上げの使用量が減る見込みですが、まだ測っていません。

4. 人の修正指示は、1か所に集める

私の修正の指示は、チャットに書かず、自作の絵コンテアプリの「要修正」欄に書きます。AIはそれを一度に全部読んで対応し、読み終えたら欄を空にします。指示が会話のあちこちに散らばらないので、読み直しが減る見込みです。

5. 迷ったときは、3枚を並べて選ぶ

候補を見せるときは、同じ指示で乱数(シード)だけを変えた3枚を1枚の一覧にして見せました。言葉で何度も直そうとせず、直らなければ別の切り口に変えます。

6. 意味が2通りに取れる指示は、生成する前に選択肢で聞く

AIは、私の言葉を2通りに読むことがあります。作り方や場所が変わる次のような指示は、生成を始める前に、選択肢で聞いてもらいました。

  • 比喩:「止め絵のようなもの」のように、作り方まで決まるのかどうかが分からない言葉

  • 呼び名:「エンディングカード」と「エンドカード」のように、似ていて別のものを指す言葉

  • 場所の特定:「ずれている」が、画面のどこのことか

  • 向き:後ろ姿や横顔で、左右がどちらか

  • 作品全体に効く選択:色合わせをするかどうか

推測で生成して2回ずつ外れた場面が、選択肢で聞いたら1回で直りました。1回焼き直すと、約4分と、結果を一覧図で確認するぶんのコンテキストがかかります。

7. 長い生成は、会話から切り離して走らせる

動画の生成は、まとめて焼くと数十分かかります(今作は全16本、1,984コマで約45分)。AIの会話に付きっきりにさせず、生成は別のプロセスとして切り離して実行し、ログをファイルに書かせ、終わりと失敗の2つだけをAIに知らせる形にしました。

一見よさそうで効かなかったこと

生成AIの絵や動画には、言葉で直そうとしても直らない挙動がありました。実例を2つ紹介します。

寄りのカットでも地面が写る

胸から上の寄りのカットなのに、足元の地面や道が写り込みました。背景の参照画像を上の7割だけに切って渡しても、3枚とも地面や道が下に入りました(図の上段)。

原因は文のほうでした。画面の外にある道の説明、背景の節に書いた地面の説明、共通の場所の文(落ち葉の道)、書いた物を全部入れようと引くカメラの文が入っていたためです。これらを文から外すと、地面は消えました(図の下段)。

胸から上の寄りのカットを、3つのシード(乱数の種)で生成した比較です。
上段は、背景の参照を上だけに切っても地面が写った版、下段は、文から道と地面を指す語を外した版です

寄りやあおりのカットは、画面の外にある置き物を文から外します。場所の文を使い回さないことも大切です。参照の絵を切っても、文が地面を呼べば地面が出ます。

同じ頃に、「基準画は色と描き方だけに使え」「もっと大きく」と言葉で繰り返す直し方も試しました。しかし、道が中央のままだったり、意味を取り違えられたりして直りませんでした。

景色のカットを「少しだけ動かす」のは難しい

冒頭の紅葉の山々の景色を、葉が舞う程度に動かそうとしました。しかし今回は、1コマ目に写っている葉が、動画の中で動き続けました。

葉を降らせる指示、葉を横へ流す指示、1コマ目から葉を消して木の揺れだけにする指示と、3回試しました。葉が飛び続けたり、木の形や色が描き直されたりして、思うようになりませんでした。景色の細部は、動画にすると保たれにくいようです(推定)。

冒頭の景色のカットを動画にした8コマです。
2回目の試し(葉を横へ流す指示)の結果で、1コマ目(0.00秒)に写っている葉が、動画の中で漂いながら流れていきます

最終的には、このカットを動画にせず、静止画に後から左へ流れるカメラの動きを付ける処理にしました。3回ぶんで約5分と、確認の往復3回を使いました。景色だけのカットは、最初から静止画とカメラの後処理にするほうが速かったと推定しています。

圧縮か引き継ぎか

コンテキストが厳しくなったときの基準は、次のとおりです。

  • 同じ作業をそのまま繰り返すなら、圧縮して同じ会話で続ける

  • 新しいこと(作品を変える、やりかけを再開する、新しい実験をする)を始めるなら、引き継ぎ書を書いて新しい会話へ移る

圧縮の前には、4つ済ませます。作業状態を書くこと、開発の記録に追記すること、一時フォルダに置いた道具をプロジェクトの中へ移すこと、許可待ち・判断待ちを書き出すことです。判断待ちを書き出すのは、圧縮のあとに「承認済み」と取り違えないためです。

今作は、静止画の工程が終わった71%の所で1回圧縮し、圧縮後の会話で完成・投稿まで進めました。

限界と、次に確かめること

  • 1作品・1回の制作の実測です。同じ作業を条件を変えてやり比べていないため、7つの決まりが使用量を減らしたかどうかは分かりません

  • 「食ったのは、作るより調べる読み込みと往復」「画像1枚が3千から5千トークン」「2つの会話の合計が約140万で、要約ぶんが重なる」は推定です

  • 読み上げ速度の5.2文字は、2作品・同じ話者の実測です。別の話者や話速では測り直す必要があります

  • 節目ごとの使用量には、その工程以外の作業も含まれます

  • 使ったモデルはClaude Opus 5.5だけで、他のモデルとは比べていません。この使用量がモデルの特徴によるものかは分かりません

次の作品でも、同じ節目で使用量を測ります。立ち上げから絵コンテ登録までの約22万、静止画の工程を終えるまでの約71万と比べて、結果が出たらまた書きます。

まとめ

  • 長い制作では、「作る」作業よりも、AIが「調べる」ための読み込みと、「指摘、修正、確認」の往復がコンテキストを食いました(推定)

  • 対策の基本は、AIに読ませる量を減らすこと(1か所の表、数字の要約、一覧図、絞った検索)と、往復を減らすこと(選択肢で聞く、指示を1か所に集める)です

  • 使用量を工程の節目で測ると、どこを直せばよいかが見えてきます

前作「アルトルタのお月見」の制作記録は、こちらの記事に書いています。https://note.com/altolta_428/n/n0672a6608c36


X(旧Twitter)もやっています

日々の検証の様子や、記事にする前の途中経過はXで先に投稿しています。よかったらフォローしてください。

▼ アルトルタ(AI Vtuber Unit Ver.0.01)
https://x.com/Altolta_Project

note のフォローもお願いします

この開発記録は不定期に更新しています。続きが気になる方は、ぜひフォローをお願いします。

お知らせ

アルトルタ開発チームでは、配信で使えるOBS用ツール・オーバーレイをBOOTHで販売しています。zipを解凍するだけで使え、外部への通信は行いません。

▼ Altolta428(BOOTH)
https://altolta428.booth.pm/

いいなと思ったら応援しよう!