
動画に音をつける30分が、なくなった。SkyReels V4が変えた制作工程の話
# 動画に音をつける30分が、なくなった。SkyReels V4が変えた制作工程の話
リード
AI動画を仕事で使い始めた人なら、この流れに慣れてくる頃だと思う。
テキストから動画を生成する。出てきたのは無音のクリップ。次にAdobeかDaVinciを開いて、音楽素材を探して、環境音を別のAIサービスで作って、それをタイムラインに乗せて、ズレを調整して、書き出す——。
生成AIで「時短できた」はずなのに、後処理だけで30分消えている。
SkyReels V4は、その30分を構造から壊しに来た。映像と音声を、一度の生成で同時に出す。「後から音を貼る」という工程が、そもそも存在しない設計になっている。
「後付け音声」がずっと当たり前だった理由
AI動画生成ツールが急速に広まった2023年〜2025年。SoraもVeoもKlingも、基本的には「映像を出力して、音は別に考えてね」という前提で作られていた。
理由はシンプルで、映像と音声は違う信号だから。映像はピクセルの連続、音声は波形の時系列。これを同じモデルで同時に学習・生成するのは、単純にアーキテクチャが複雑になる。だから商用ツールのほとんどは映像生成に集中して、音声は別の専門ツールに任せるか、後から手動で加えるかのどちらかだった。
OpenAIのSoraが映像品質で話題を集めながらも「音声なし」で批判されたのは、その典型例だと思う。
ただ、実務レベルで動画を量産しようとすると、この「分業前提」がじわじわ効いてくる。1クリップなら問題ない。でも10本、20本となると、後処理の積み重ねが無視できなくなる。WaveSpeedAIのレビューでは、SkyReels V4の導入後「1クリップあたり15〜20分の後処理を省けた」という報告が出ている。これが積み重なったときの差は、小さくない。
映像と音声を「同じ場所」で生成するという発想
SkyReels V4が採用したのは、デュアルストリームMMDiT(Mixed-Modal Diffusion Transformer)と呼ばれるアーキテクチャだ。難しそうな名前だが、要するに映像を担当する処理系と音声を担当する処理系が、同じテキスト情報を共有しながら並列で動く設計のこと。
電車の例えで言うと、従来のAI動画は「まず映像の車両だけ走らせて、別の音声の車両を後から連結する」方式。V4は最初から映像と音声の車両が連結した状態で出発する。だからタイミングがズレない。波が砕ける映像があれば、その瞬間に砕ける音が出る。犬が吠える映像なら、同じフレームで吠える。
これをシングルパス生成という。1回の処理で映像と音声が揃った状態で出力される。
現時点でこれをオープンソースで実現したのは、世界で初めて。SoraはAPIクローズド、VeoはGoogleの内部利用が中心で一般公開は限定的。それに対してSkyReels V4は、コードとモデルが原則公開される方針を取っている(V4のローカル実行用モデルの公開は2026年4月時点で準備中とみられる)。
開発したのは、シンガポールのSkywork AI
少し背景を。
SkyReels V4を作ったのはSkywork AI(SKYWORK AI PTE. LTD)というシンガポール法人で、2021年設立。中国系テック企業の昆仑万維(Kunlun Tech)との関連が複数のソースで報告されている。昆仑万維はAI投資にも積極的な中国のインターネット企業で、外部からの資金調達記録は確認できないが、その傘下でSkywork AIが動いているとすれば、開発リソースの規模には納得がいく。
バージョン履歴を見ると、V1(HunyuanVideoベースのI2Vモデル)からV2(無限長動画)、V3(Audio-to-Video 19Bモデル)と、段階的に音声への対応を強化してきた流れがわかる。V4は「映像と音声の統合」というゴールに向けた集大成で、2026年2月に論文が公開され、4月3日に製品版がローンチされた。
無料で試せる範囲と、APIの現実的な使い方
使い方は大きく3つある。
一番手軽なのはWebアプリ。`skyreels.ai` にアクセスしてアカウントを作れば、2026年4月時点では無料で50クレジットが付与される。クレジットカード登録は不要で、アカウントさえあれば当日中に試せる。
より本格的に使うならAPIが選択肢に入る。料金は$8.40/分(2026年4月時点)。開発元は「競合比40%安い」と主張しているが、この比較対象の詳細は公式に明記されていないため、実際の用途とコストは自分で試算してほしい。
ローカルで動かしたい場合、V1〜V3のモデル重みはHuggingFaceで公開済み。V4については論文(arXiv: 2602.21818)が先行公開されており、ローカル実行用の重みは準備中の可能性が高い。GPU環境があるならAtlas CloudのようなGPUクラウドでV4の実行環境が提供されているので、そちらが現実的かもしれない。
動画を量産する仕事をしているなら、月の制作本数を考えてAPIとWebアプリのどちらが割に合うか、一度計算してみる価値はある。
Veo 3.1やKlingと何が違うのか
ArtificialAnalysisのベンチマーク評価では、V4が「Text-to-Video with Audio(音声つき動画生成)」部門でKling 3.0とVeo 3.1を上回ったとXで報告された。ただし2位という情報も混在していて、4月時点でランキングが変動している可能性がある。順位よりも「競合水準の品質を出せる」という点を素直に見るほうがフェアだと思う。
Veoは最大60秒超の動画を安定して出せる点が強い。Soraは2026年3月24日にWebアプリをシャットダウン(APIは同年9月まで継続)で、その需要の受け皿という側面もV4にはある。
15秒という制限は明確なデメリット。ナラティブのある動画や商品紹介の長尺クリップを作りたい場合、VeoやKlingのほうが現実的な選択肢になる。
音楽・複雑なSFXについても同様で、V4が得意なのはアンビエント音や環境音の同期。BGMや劇伴が必要なコンテンツは、音楽生成ツールとの組み合わせが現実的だとレビューでも指摘されている。完全に後処理ゼロになるわけではなく、「後処理の種類が変わる」に近い。
僕がV4を積極的に使わないと思う場面がある。ブランドフィルムのように、音楽演出が核にあるコンテンツだ。環境音は自動で付くが、そのブランドの世界観に合った音楽は、結局人間かDAWに頼ることになる。V4の真価が出るのは、より実用的で短い素材——SNS用のショートクリップ、プレゼン用のデモ動画、Webサイトのビジュアルコンテンツ——だと感じる。
まとめ・Next Action
「無音で出て、音は別途」というAI動画のデフォルトに、V4は違う答えを出した。オープンソースでそれをやっているのは今のところここだけ、というのも見逃せないポイント。
15秒制限はある。音楽は別途必要。けれど、1クリップごとに音を当てる手間が丸ごとなくなるという実感は、量を作る人ほど大きい。
試し方は簡単。`skyreels.ai` にアクセスして、アカウントを作る。無料で50クレジット使えるので、テキストを入力して動画を1本出してみてほしい。音がついた状態で動画が返ってきた瞬間の感覚を、一度体験してみてほしい。感想があればコメントで教えてもらえると嬉しい。
あなたが普段作る動画の中で、この「音声同時生成」が一番使えそうな場面はどこですか? SNS用のショートクリップか、プレゼン資料か、それとも別の用途か——コメントで教えてください。
*出典:*
- arXiv論文(2602.21818): https://arxiv.org/abs/2602.21818
- WaveSpeedAI – SkyReels V4 Review: https://wavespeed.ai/blog/posts/skyreels-v4-review/
- WaveSpeedAI – V4 vs Veo 3.1 vs Sora 2: https://wavespeed.ai/blog/posts/skyreels-v4-vs-veo-sora/
- Artificial Analysis X投稿(ベンチマーク評価): https://x.com/ArtificialAnlys/status/2034149350495162625
- Atlas Cloud – SkyReels V4 Guide: https://www.atlascloud.ai/blog/ai-updates/skyreels-v4-coming-soon-features-release-date-how-to-use-on-atlas-cloud
- Let's Data Science – SkyReels V4 リリース: https://letsdatascience.com/news/skyreels-releases-v4-for-native-audio-visual-3f0967d4