見出し画像

Opus 5.5に18分の解説動画を丸ごと作らせた。打ったのは4行、待ったのは83分

Claude Code(Opus 5.5)に4行の指示を送り、参考にしたい動画を1本見せました。83分後、18分28秒の解説動画がフルHDで書き出されていました。台本、ナレーション、イラスト、グラフ、字幕、BGMに加えて、サムネイルとYouTubeの概要欄までできています。途中で私が手を入れた箇所はありません。

費用はAPI料金に換算して約25.6ドル(約4,000円)です。私は定額のMaxプランなので、追加の支払いはありませんでした。音声と動画のソフトは、どちらも無料で使えるものです。

この記事では、83分の内訳、AIが自分で見つけて直したミス、人間に残った仕事を、作業ログと実際の画像でまとめます。

完成した動画はこちらです。

完成した動画から9カット

3か月前、「丸投げは無理」と書いていました

7月に、AIで動画制作をどこまで自動化できるかを試して、記事にしました。

そのときの結論は「完全自動化ではなく、人間が監督する制作工場」です。記事にはこう書いています。

AIに「良い動画を作って」と頼んでも、安定して良いものを作るのは難しい。

「AIで動画制作を自動化しようとしてわかった「できること」と「できないこと」」(2026年7月)

企画、台本、素材、編集と工程を分け、それぞれで人間が選んで直す。次は30秒の動画で試す、とも書きました。

9月22日にOpus 5.5が出たので、もう一度やってみました。今度は工程を分けず、30秒でもなく、「10分以上の動画を1本」とだけ頼んでいます。

送った指示は4行です

1行目は参考にしたい解説動画のファイルで、残りの3行が本文です。表記のゆれも全角の「1」も、送ったときのままにしてあります。

ただし、ゼロから始めたわけではありません。私のPCには次のものが最初から入っていました。

  • Claude Code、Node.js、Python、ffmpeg

  • 無料の音声合成ソフト「VOICEVOX」

  • あらかじめ落としておいたフリーBGMが8ファイル

  • 過去の動画づくりで失敗したことを書きためた、自分用の制作メモ

制作メモには「『シネマティックに』のような形容詞で頼まず、秒数や色コードで決める」「動きを等速にしない」といったルールが書いてあります。Claude Codeは作業の最初にこのメモを読んでいました。

83分の内訳

23時2分に送信し、完成の報告が来たのは0時25分でした。作業ログを数えると次のとおりです。

  • ツールの実行:208回(コマンド86回、ファイルの読み取り54回、書き込み25回、検索15回、ページの読み込み23回など)

  • 書いたコード:約5,200行(映像が約4,600行、音声とミックスが約500行)

  • 台本:127行、5,353字

  • 場面:39、章タイトルなどのカード9枚

  • 映像:33,234フレーム(1080p、30fps)

いちばん長かったのは映像づくりの30分で、レンダリングの18分、リサーチの17分が続きます。

参考動画を「なぞらない」ためにしていたこと

指示の2行目に「パクリと思われないくらいにはオリジナリティを出して」と書きました。ログを見ると、Claude Codeは序盤に次の2つをしています。

  • 参考動画から一定間隔で画面を切り出し、一覧にして絵柄と構成を見る

  • ナレーションの声の高さを測る(中央値は約94Hzで、低い男性の声でした)

そのうえで3つを変えていました。絵柄は、室内が中心のフラットなイラストから、切り絵風と夜空へ。声は、低い男性から女性の読み聞かせ調へ。構成は「寓話」にして、最後に教訓を置く形です。

冒頭の場面。切り絵風の公園から始まります

もう1つ、頼んでいない仕掛けが入っていました。冒頭で「この台本を書いたのは、今日比べる3つのAIのうちの1つだ」と予告し、最後にOpus 5.5自身だと明かします。

数字は、出典メモを作ってから台本にしていました

テーマは、発表から数日〜数週間しかたっていないAIモデルの比較です。Claude Codeは検索15回とページの読み込み23回で、各社の公式ページ、第三者の評価機関、報道を集め、使う数字と出典を1枚のメモにしてから台本を書いていました。台本を確定する直前に公式ページを読み直し、1か所を直した記録も残っています。

各社の公表値と、第三者が測り直した値を並べた場面

台本を書いているのは、比べられる側のOpus 5.5です。そのため、各社の自己申告と第三者の測定を分けて見せ、終盤には自分が負けた項目を一覧にする場面まで作っていました。

終盤の場面。Opus 5.5が負けた項目を自分で並べています

動画の中の数字は2026年9月26日時点のものです。この種の比較はすぐに古くなります。

AIは音を聴けないので、数値で選んでいました

完成の報告に、こう書いてありました。

私は音を聴けないので、No.7の読み聞かせ調は評判と話す速さの数値だけで選んでいます。

Claude Code(Opus 5.5)の完成報告より

ログを見ると、声は5種類を同じ文章で合成し、1秒あたりの文字数を比べています。読み聞かせ調は1秒4.2文字でいちばん遅く、それを1.25倍速にして使っていました。

BGMも同じやり方です。手持ちの8ファイルについて音量、音の明るさ、テンポを測り、3曲を選んで章ごとに割り当てていました。ナレーションが入る間はBGMが自動で下がり、全体の音量は-14.4 LUFSにそろえてあります。

聴いて確かめる作業は、人間に残りました。

AIが自分で見つけて直した6つのミス

途中で私は何も指摘していません。以下はすべて、Claude Codeが自分で確かめて直したものです。

① 読み間違い

音声を合成する前に、全行の読みがなを書き出して確認していました。「金星」を「きんぼし」、「5分の2」を「ごふんのに」、「同じ表」を「どうじひょう」と読んでいたのを見つけ、35語の読み替え辞書を作って直しています。

② 数字とグラフのずれ

「66.4%」と読み上げる瞬間に棒が伸びるよう、句読点ごとの発声タイミングを計算して映像に渡す処理を、途中で足していました。

読み上げに合わせて棒が伸びる場面

③ 字幕が単語の途中で折れる

句読点か助詞の直後で改行するように直しています。

④ 章ごとの見た目の崩れ

1章作るたびに静止画を書き出し、一覧にして自分で見ていました。文字の重なりなどは、その場で直しています。

Claude Codeが確認用に作った一覧。左上の黄色い文字はファイル名です

⑤ 全127行の総点検

本番の書き出しの前に、台本1行につき1枚、合計127枚の静止画を書き出して確認していました。何も映っていない間や文字の重なりが約9か所見つかり、直しています。

総点検に使われた一覧の1枚

⑥ 書き出しを自分で止めた

本番のレンダリングを始めて約2分半後、字幕の下に敷いた帯が1行ごとに点滅することに気づいて自分で止め、直してからやり直していました。やり直した本番は14分24秒で終わっています。

直したあとの確認用の一覧

費用と、使ったもの

API料金に換算した内訳です(Opus 5.5の定価で計算、1ドル157円)。

  • 出力 約35万トークン:7.0ドル

  • キャッシュの読み込み 約6,712万トークン:13.4ドル

  • キャッシュへの書き込み 約65万トークン:5.2ドル

  • 合計:25.6ドル(約4,000円)

実際には定額のMaxプランの範囲で動かしたので、この金額を別に払ったわけではありません。

音声はVOICEVOX(No.7)、動画はRemotion、BGMはDOVA-SYNDROMEの3曲です。どれも個人なら無料で使えます。Claude Codeは最後に利用規約も調べていて、概要欄には「VOICEVOX:No.7」のクレジットと曲名が入っていました。PCは12スレッドのCPUを積んだWindows機です。

サムネイルもClaude Codeが作ったものです

人間に残った仕事

3か月前の記事で、私は「人間は監督」と書きました。今回、監督の仕事として残ったのは次の5つです。

  • 何を作るかを決める(4行)

  • 品質の基準を、前もって文章で渡しておく(制作メモ)

  • 音を聴いて確かめる

  • 数字を、公開の前にもう一度確かめる

  • 公開するかどうかを決める

「工程ごとに選んで直す」作業は、一度も発生しませんでした。ただ、制作メモがなくても同じ結果になったかどうかは分かりません。判断がなくなったのではなく、前もって文章にして渡せるようになった、というのが今の実感です。

まとめ

  • 送ったのは4行と、参考動画1本

  • 83分後に、18分28秒の解説動画と、サムネイル、概要欄ができていた

  • AIは6種類のミスを自分で見つけて直していた

  • 費用はAPI換算で約25.6ドル。音声、動画、BGMは無料のもの

  • 人間に残ったのは、最初の指示、音と数字の確認、公開の判断

同じ仕組みで、このあと心理学や行動経済学の解説動画を5本作りました。次の記事では、その5本で何を変えたかと、仕組みの中身を書く予定です。

この記事の下書きもClaude Codeと作りました。数字はすべて、当日の作業ログから数え直したものです。

いいなと思ったら応援しよう!