Opus 5.5に18分の解説動画を丸ごと作らせた。打ったのは4行、待ったのは83分
Claude Code(Opus 5.5)に4行の指示を送り、参考にしたい動画を1本見せました。83分後、18分28秒の解説動画がフルHDで書き出されていました。台本、ナレーション、イラスト、グラフ、字幕、BGMに加えて、サムネイルとYouTubeの概要欄までできています。途中で私が手を入れた箇所はありません。
費用はAPI料金に換算して約25.6ドル(約4,000円)です。私は定額のMaxプランなので、追加の支払いはありませんでした。音声と動画のソフトは、どちらも無料で使えるものです。
この記事では、83分の内訳、AIが自分で見つけて直したミス、人間に残った仕事を、作業ログと実際の画像でまとめます。
完成した動画はこちらです。

3か月前、「丸投げは無理」と書いていました
7月に、AIで動画制作をどこまで自動化できるかを試して、記事にしました。
そのときの結論は「完全自動化ではなく、人間が監督する制作工場」です。記事にはこう書いています。
AIに「良い動画を作って」と頼んでも、安定して良いものを作るのは難しい。
企画、台本、素材、編集と工程を分け、それぞれで人間が選んで直す。次は30秒の動画で試す、とも書きました。
9月22日にOpus 5.5が出たので、もう一度やってみました。今度は工程を分けず、30秒でもなく、「10分以上の動画を1本」とだけ頼んでいます。
送った指示は4行です

1行目は参考にしたい解説動画のファイルで、残りの3行が本文です。表記のゆれも全角の「1」も、送ったときのままにしてあります。
ただし、ゼロから始めたわけではありません。私のPCには次のものが最初から入っていました。
Claude Code、Node.js、Python、ffmpeg
無料の音声合成ソフト「VOICEVOX」
あらかじめ落としておいたフリーBGMが8ファイル
過去の動画づくりで失敗したことを書きためた、自分用の制作メモ
制作メモには「『シネマティックに』のような形容詞で頼まず、秒数や色コードで決める」「動きを等速にしない」といったルールが書いてあります。Claude Codeは作業の最初にこのメモを読んでいました。
83分の内訳

23時2分に送信し、完成の報告が来たのは0時25分でした。作業ログを数えると次のとおりです。
ツールの実行:208回(コマンド86回、ファイルの読み取り54回、書き込み25回、検索15回、ページの読み込み23回など)
書いたコード:約5,200行(映像が約4,600行、音声とミックスが約500行)
台本:127行、5,353字
場面:39、章タイトルなどのカード9枚
映像:33,234フレーム(1080p、30fps)
いちばん長かったのは映像づくりの30分で、レンダリングの18分、リサーチの17分が続きます。
参考動画を「なぞらない」ためにしていたこと
指示の2行目に「パクリと思われないくらいにはオリジナリティを出して」と書きました。ログを見ると、Claude Codeは序盤に次の2つをしています。
参考動画から一定間隔で画面を切り出し、一覧にして絵柄と構成を見る
ナレーションの声の高さを測る(中央値は約94Hzで、低い男性の声でした)
そのうえで3つを変えていました。絵柄は、室内が中心のフラットなイラストから、切り絵風と夜空へ。声は、低い男性から女性の読み聞かせ調へ。構成は「寓話」にして、最後に教訓を置く形です。

もう1つ、頼んでいない仕掛けが入っていました。冒頭で「この台本を書いたのは、今日比べる3つのAIのうちの1つだ」と予告し、最後にOpus 5.5自身だと明かします。
数字は、出典メモを作ってから台本にしていました
テーマは、発表から数日〜数週間しかたっていないAIモデルの比較です。Claude Codeは検索15回とページの読み込み23回で、各社の公式ページ、第三者の評価機関、報道を集め、使う数字と出典を1枚のメモにしてから台本を書いていました。台本を確定する直前に公式ページを読み直し、1か所を直した記録も残っています。

台本を書いているのは、比べられる側のOpus 5.5です。そのため、各社の自己申告と第三者の測定を分けて見せ、終盤には自分が負けた項目を一覧にする場面まで作っていました。

動画の中の数字は2026年9月26日時点のものです。この種の比較はすぐに古くなります。
AIは音を聴けないので、数値で選んでいました
完成の報告に、こう書いてありました。
私は音を聴けないので、No.7の読み聞かせ調は評判と話す速さの数値だけで選んでいます。
ログを見ると、声は5種類を同じ文章で合成し、1秒あたりの文字数を比べています。読み聞かせ調は1秒4.2文字でいちばん遅く、それを1.25倍速にして使っていました。
BGMも同じやり方です。手持ちの8ファイルについて音量、音の明るさ、テンポを測り、3曲を選んで章ごとに割り当てていました。ナレーションが入る間はBGMが自動で下がり、全体の音量は-14.4 LUFSにそろえてあります。
聴いて確かめる作業は、人間に残りました。
AIが自分で見つけて直した6つのミス
途中で私は何も指摘していません。以下はすべて、Claude Codeが自分で確かめて直したものです。
① 読み間違い
音声を合成する前に、全行の読みがなを書き出して確認していました。「金星」を「きんぼし」、「5分の2」を「ごふんのに」、「同じ表」を「どうじひょう」と読んでいたのを見つけ、35語の読み替え辞書を作って直しています。
② 数字とグラフのずれ
「66.4%」と読み上げる瞬間に棒が伸びるよう、句読点ごとの発声タイミングを計算して映像に渡す処理を、途中で足していました。

③ 字幕が単語の途中で折れる
句読点か助詞の直後で改行するように直しています。
④ 章ごとの見た目の崩れ
1章作るたびに静止画を書き出し、一覧にして自分で見ていました。文字の重なりなどは、その場で直しています。

⑤ 全127行の総点検
本番の書き出しの前に、台本1行につき1枚、合計127枚の静止画を書き出して確認していました。何も映っていない間や文字の重なりが約9か所見つかり、直しています。

⑥ 書き出しを自分で止めた
本番のレンダリングを始めて約2分半後、字幕の下に敷いた帯が1行ごとに点滅することに気づいて自分で止め、直してからやり直していました。やり直した本番は14分24秒で終わっています。

費用と、使ったもの
API料金に換算した内訳です(Opus 5.5の定価で計算、1ドル157円)。
出力 約35万トークン:7.0ドル
キャッシュの読み込み 約6,712万トークン:13.4ドル
キャッシュへの書き込み 約65万トークン:5.2ドル
合計:25.6ドル(約4,000円)
実際には定額のMaxプランの範囲で動かしたので、この金額を別に払ったわけではありません。
音声はVOICEVOX(No.7)、動画はRemotion、BGMはDOVA-SYNDROMEの3曲です。どれも個人なら無料で使えます。Claude Codeは最後に利用規約も調べていて、概要欄には「VOICEVOX:No.7」のクレジットと曲名が入っていました。PCは12スレッドのCPUを積んだWindows機です。

人間に残った仕事
3か月前の記事で、私は「人間は監督」と書きました。今回、監督の仕事として残ったのは次の5つです。
何を作るかを決める(4行)
品質の基準を、前もって文章で渡しておく(制作メモ)
音を聴いて確かめる
数字を、公開の前にもう一度確かめる
公開するかどうかを決める
「工程ごとに選んで直す」作業は、一度も発生しませんでした。ただ、制作メモがなくても同じ結果になったかどうかは分かりません。判断がなくなったのではなく、前もって文章にして渡せるようになった、というのが今の実感です。
まとめ
送ったのは4行と、参考動画1本
83分後に、18分28秒の解説動画と、サムネイル、概要欄ができていた
AIは6種類のミスを自分で見つけて直していた
費用はAPI換算で約25.6ドル。音声、動画、BGMは無料のもの
人間に残ったのは、最初の指示、音と数字の確認、公開の判断
同じ仕組みで、このあと心理学や行動経済学の解説動画を5本作りました。次の記事では、その5本で何を変えたかと、仕組みの中身を書く予定です。
この記事の下書きもClaude Codeと作りました。数字はすべて、当日の作業ログから数え直したものです。
