見出し画像

【MiniMax H3】高速化LoRA「PDD」をTurbo・20ステップと比較。ほぼ同じ画で約3.7倍速

こんにちは、ルアラボの案内役、ルアです。

AI 動画を「実写っぽく」作ろうとすると、とにかく時間がかかります。僕の仕組みでは、8秒の動画1本に13分以上かかっていました。速くする方法(Turbo)もあるのですが、使うと顔がてかったり、絵っぽくなったりして、本番には使えずにいました。

そこに、MiniMax H3 用の新しい高速化「PDD」が出てきました。そこで、今までの設定・PDD・Turbo を、同じ指示・同じ乱数の種で作って見比べてみました。

読んでみて参考になったら、スキ(♡)を押してもらえるとうれしいです。フォローしておくと、続きの検証も届きます。

この記事で分かること - 高速化の方式ごとに、見た目と時間がどう違ったか(動く比較つき) - Turbo をやめて、PDD 4ステップを標準にした理由 - PDD が「普通の LoRA」ではなく、ComfyUI が古いと黙って効かないこと - そのまま使える設定

1. 困っていたこと

ポイント:実写っぽさを取ると遅い。速さを取るとAIっぽい。その板挟みでした。

動画を作る AI は、砂嵐のようなノイズから少しずつ絵を浮かび上がらせます。その「少しずつ」の回数がステップ数です。回数が多いほど丁寧になりますが、そのぶん時間がかかります。

  • 今までの設定(Turbo 無効・20ステップ): 画はきれい。でも 8秒で13分以上

  • Turbo(4ステップ): 4倍ほど速い。でも色が濃く、絵画のようになりがち

以前の記事で、「AIっぽさを消すには Turbo を切る」と書きました。その代わりに、時間は我慢していたんです。

2. PDD って何?

ポイント:少ない回数で、元の丁寧な道のりをなぞるように覚えさせた追加ファイルです。

PDD(Parallel Decoding Distillation)は、NVIDIA が 2026年7月に発表した方法です。Alibaba のチームがそれを MiniMax H3 に当てはめて、8ステップ用の追加ファイル(Acc LoRA)を公開しました。

たとえるなら、20か所の曲がり角がある道を、要所の8か所だけで曲がっても同じ場所に着けるように練習した地図です。Turbo も同じ「近道」の仲間ですが、PDD はもとの道のりにより忠実だ、というのが売りでした。

公式の資料では 4ステップでも使えるとされていたので、8ステップと4ステップの両方を試しました。

3. 比べ方

ポイント:3つの場面を、4つの方式で。指示と乱数の種は全部同じにしました。

  • 夜の机でタイピング: 速い指の動き、湯気、回る扇風機

  • 日本語で話す自撮り: 顔、口の動き、肌や服の質感

  • ルア(参照画像4枚から): 同じ人に見えるか、ニットや眼鏡の質感

方式は「Turbo 無効 20ステップ」「PDD 8ステップ」「PDD 4ステップ」「Turbo 4ステップ」の4つです。GPU は RunPod の A40、縦長 0.8MP(672×1216)、8秒で作りました。

4. 結果:時間

ポイント:PDD 4ステップは、今までの約3.7倍速。1ステップの重さは、どの方式も同じでした。


意外だったのは、1ステップにかかる時間が、どの方式でも約37.6秒で同じだったことです。追加ファイルを入れても1回の計算は重くならず、速さの差は回数だけで決まっていました。

それでも 4倍・2.5倍の速さにならないのは、どの方式にも最初の準備(約40秒)と、最後に映像へ戻す処理(約60秒)が同じだけかかるからです。

5. 結果:見た目

ポイント:PDD は 4でも8でも、20ステップとほぼ同じ構図・同じ雰囲気。Turbo だけ別物になりました。

まず、動く比較です(左から 20ステップ・PDD 8・PDD 4・Turbo 4。音は入っていません)。


同じ乱数の種なのに、PDD は 20ステップと机の配置も色味もほぼ同じです。Turbo だけ、カメラの角度からまるで違う動画になりました。


手元を拡大すると、違いが見えてきます。20ステップは手の血管までよく出ています。PDD は産毛まで細かく出ていますが、指が少し太く見えます(ちょっと笑ってしまいました)。一方で、20ステップは打鍵の動きが少し雑でした。どれも、ぱっと見て困るほどの違和感はありません。


話す場面では、Turbo の顔が一番てかっていて、顔の動きにも少し違和感がありました。PDD 8 は 20ステップと顔立ちが少し変わりましたが、不自然さはほぼありません。動きのなめらかさは、20ステップがわずかに上に見えます。PDD 4 はとても自然で、服の生地感だけは PDD 8 の方が上でした。


僕(ルア)の場面では、Turbo にはっきりした失敗が出ました。


Turbo は、胸元に字幕のような文字が入り込んでしまいました。これは使えません。PDD は 4も8も、20ステップとほとんど見分けがつかないレベルです。細かく見ると、ボタンの形が少し違ったり、髪の質感が少し AI っぽかったりします。


6. 結論:これからの使い分け

ポイント:ふだんは PDD 4ステップ。細部まで絶対に出したいカットだけ 20ステップ。Turbo は使いません。

  • Turbo 4ステップ: 速さは PDD 4 と同じくらいなのに、てかり・構図の崩れ・謎の文字が出た。もう使いません

  • PDD 8 と PDD 4: どちらも使える。2つの差は小さいので、時短が目的なら 4ステップ

  • Turbo 無効 20ステップ: 手の血管のような細部まで必ず出したいカットだけ

ルアラボでは、指定しない限り PDD 4ステップで作ることにしました。8秒1本が約13.5分から約3.7分になり、GPU 代は約17円から約5円になります(A40 $0.49/時。1ドル=約157.5円、2026年9月26日で換算)。長い動画ほど効いてきます。

7. つまずいたこと:PDD は「普通の LoRA」ではなかった

ポイント:ComfyUI が古いと、エラーも出ずに半分しか効きません。v0.35.0 以降が必要です。

ここからは、自分で試す人向けの技術の話です。

PDD のファイルは「LoRA」という名前ですが、中身は2つに分かれています。

  • 本体に足す、ふつうの LoRA(差分)

  • 最後の出力の部分を 32本に増やした「ヘッド」 のまとまり。1ステップごとに、使うヘッドを切り替えます

古い ComfyUI は、2つめのヘッドを読めません。しかもエラーを出さずに捨ててしまいます。生成はできてしまうので、気づきにくいんです。僕の生成サーバーも ComfyUI v0.34.6 だったので、そのままでは効かない状態でした。

ComfyUI 本体は、v0.35.0(2026年9月9日公開)から公式に対応しています(開発者の kijai さんによる変更 #15908 )。対応した ComfyUI なら、ふつうの「LoRA 読み込み」ノードで読めます。正しく読めたかは、起動ログにこの行が出るかで確かめられます。

Module diffusion_model.final_layer.video_out has resizing Lora - force loading
Module diffusion_model.final_layer.audio_out has resizing Lora - force loading

8. 設定(そのまま使える形)

ポイント:公式のワークフローの「Turbo 用 LoRA」を差し替えて、ステップ数とサンプラーを変えるだけです。

  • ComfyUI: v0.35.0 以降

  • LoRA: ComfyUI 形式に変換したもの(文字から動画は FL2VA、参照画像ありは Ref2VA)。models/loras/ に置く

  • ステップ数: 4(または 8)

  • サンプラー: euler(2次のサンプラーは使わない)

  • スケジューラー: simple

  • ガイダンス: CFG 1.0(公式ワークフローの BasicGuider のまま)

LoRA の入手先(Hugging Face)
https://huggingface.co/Kijai/MiniMax-H3-experimental/tree/main/loras
  MiniMax-H3-FL2VA-Acc-8Step_comfy.safetensors
  MiniMax-H3-Ref2VA-Acc-8Step_comfy.safetensors

元の配布(Alibaba PAI、MiniMax-H3 Community ライセンス)
https://huggingface.co/alibaba-pai/MiniMax-H3-Acc-LoRAs

ComfyUI の対応(#15908)
https://github.com/comfyanonymous/ComfyUI/pull/15908

ファイル名は「8Step」ですが、4ステップでもそのまま使えます。ステップ数を 5〜7 や 9 以上にすると、学習したときの区切りから外れてノイズになる、という報告があります(僕は試していません)。

9. 自動化キットにも組み込みます

販売中の自動化キット(P22)にも、この PDD 4ステップを標準の設定として組み込む予定です。ComfyUI を上げる手順も含めて、キットの生成サーバーに入れます。準備ができたら、キットの記事と X でお知らせします。

キットは、コマンド1つでネタ選びから動画作成、YouTube への下書き保存まで進められる一式です。発売記念価格(9,800円)は 2026年10月4日までです。


関連記事

Turbo を切ると AI っぽさが消えた、という前の検証です。今回の「20ステップ」はこの設定です。

実写寄せのプロンプト全文と設定値をまとめた記事です。

役に立ったら、スキやフォローで教えてもらえると励みになります。

AIの利用について

この記事の構成と下書きに AI(Claude)を使っています。比較の動画は MiniMax H3 で生成し、見比べた評価は人が行っています。表とグラフは、測った数字からプログラムで描いています。

いいなと思ったら応援しよう!