メインコンテンツへスキップ
見出し画像

【Z-ImageTurbo】簡単All in Oneモデル、ControllNet、LoRAなど最新まとめ!

    話題沸騰中のZ-Image-Turboは60億(6B)パラメータとモデルサイズが小さく、VRAM16GBのGPU環境で動作するのがウリのリアル系画像生成モデルです。

    AIモデルは超高性能で小型化へと向かっているようですね。


    ●Z-Image-Turboの特長

    • 8STEPでOKのturbo仕様(速い)

    • Flux並みのフォトリアル画質の高さ(きれい)

    • プロンプト(英語・中国語)追従性の高さで(正確)


    僕のIntel Core Ultra7PCに搭載のIntel Arc Graphics GPUでもちゃんと動きました。
    ただし、1024^2の生成時間は9Stepsで6分ほど・・・😱
    もっともFLUX系はGGUF版もまともに動きませんので。

    そんなZ-Image-Turbo、ドロップからわずか10日で、派生モデルやらControlNetやLoRAなどが続々登場しています。
    なんというスピード感でしょう!
    こんな風に、いろいろ面白いものが出たので、Z-Image-Turboの2025年12月6日現在の最新情報を整理しました。


    ↓ ↓ ↓  動画も出しました!(本記事とほぼ同じ内容です)



    画像
    Z-Image-Turbo-AIO使用   9steps/cfg:1.0/dpmpp_2m - sgm_uniform

    1.Z-Image モデルの種類と導入法


    導入方法は大きく分けて「All-in-One(全部入り)」と「通常モデル(パーツ分離)」の2通りがあります。


    【A】最もお手軽なAll-in-Oneモデル          (Z-Image-Turbo-AIO)

    画像
    Z-Image-Turbo-AIO使用   9steps/cfg:1.0/dpmpp_2m - sgm_uniform


    Checkpoint・CLIP・VAEが1つにパッケージされているので、これ1つDLしてCheckpointを切り替えるだけでOK。

    最もトラブルが少なく設定が簡単な導入法です。


    AIOのモデルは2種類。

    通常モデル同様に、使用するVRAMサイズによる使い分けが推奨されています。

    1.AIO bf16:20GB


    DL:
    z-image-turbo-bf16-aio.safetensors

    ※FP8より高速で高画質

    ・NVIDIA GeForce VRAM16GB以上推奨
    ・Intel Arcの16GB以上推奨。


    2.AIO fp8: 10 GB


    DL:
    z-image-turbo-fp8-aio.safetensors

    ・NVIDIA GeForce VRAM8~10GBで動作。

    どちらのモデルも

    • ファイル格納場所:
      ComfyUI/models/checkpoints/

    • ワークフロー:
      標準の Load Checkpoint ノードでロード可能。

    → 画像の基本ワークフローだけで動きます。


    【B】通常版 ベースモデル
           (z_image_turbo_bf16/fp8)


    画像生成の通常構成で使用します。
    ワークフローをカスタムする場合に推奨。
    ※普通に各ファイルを個別配置します。

    画像



    1.bf16 高精度モデル: 12.3GB


    VRAM16GB以上推奨
    z_image_turbo_bf16.safetensors

    2.fp8 軽量化モデル: 6.15 GB


    VRAM8~10GBで動作
    z-image-turbo-fp8-e4m3fn.safetensors:

    ファイル格納場所:
    ComfyUI/models/diffusion_models/
    ※checkpointに格納しても動きますが正式にはここでした。


    【 z_image_turbo のワークフロー】



    ◆サンプル・ワークフロー 1:基本ワークフロー

    画像

    ▼必要に応じて「通常モデル」グループと「GGUFモデル」のグループを入れ替えてご利用ください。

    ノード構成の詳細

    1. Load checkpoint/Load Diffusion model:
      z_image_turbo_[xxx].safetensors をロード。
      重い処理なので初回ロードは時間がかかる。

    2. Load CLIP (または専用Text Encoder Loader): qwen_3_4b.safetensors をロード。

      • 重要: QwenモデルはCLIPとは異なるアーキテクチャであるため、ComfyUIのバージョンが古いと正しく認識されない。nightly版へ「Update ComfyUI」が必要 。

    3. Load VAE:
      ae.safetensors をロード。

    4. CLIP Text Encode (Positive/Negative):

      • Qwenエンコーダーを使用してプロンプトを入力する。

      • Prompting Tip:
        自然言語での記述が推奨される。
        「1girl, masterpiece」のようなタグ形式よりも、
        「A cinematic photo of...」のような文章形式の方が、Qwenの言語理解能力を活かせる 。

      • Negative Prompt: 蒸留モデルであるため、負のプロンプトの効果は限定的。ほとんどの場合、空欄か最小限の記述でOK 。

    5. KSampler (サンプリング設定):

      • Steps: 8 (固定推奨)。
        これ以上増やしても画質向上は望めない。
        でも、減らすと崩れる。

      • CFG (Guidance Scale): 1.0 〜 2.0。
        蒸留モデルのため、高いCFG値(例:7.0)は画像の色飛びや崩壊(Burn artifacts)を招く 。

      • Sampler:
        euler または dpmpp_2m 推奨

      • Scheduler:
        simple または sgm_uniform 推奨

    6. VAE Decode & Save Image:
      最終画像の出力。


    【C】GGUF 量子化モデル
    (Z-Image-Turbo-Q4_K_M.gguf 他)


    GGUF版(VRAM 8GB以下向け):
    Z-Image-Turbo-Q4_K_M.gguf など、圧縮率によって、いろいろあります。低VRAM用、中画質。
    ※バランスよいのはz-Image-Turbo-Q4_K_M.ggufらしい。

    GGUF モデルのファイル格納場所:
    models/diffusion_models/

    ※Text EncoderとVAEは共通。

    • ワークフロー:
      注意点: GGUFモデルを読み込むには、ComfyUIに「ComfyUI-GGUF」カスタムノードをインストールする必要があります 。


    2.Z-Image 用の ControlNet
        (Fun ControlNet Union)

    Z-ImageのcontrolNet(Fun ControlNet Union)は、
    1つの「Unionモデル」ですべてを制御します。

    画像
    1.ポーズ画像を入力(※普通の人物写真でOK)

    ▼

    画像
    2.Fun ControlNet Unionの openposeで棒人間(ポーズ)を抽出

    ▼

    PROMPT:
    Cinematic fashion editorial photograph, Full-length shot of a female Japanese model with short red hair, full smile, striking a dynamic pose on a luxurious, glass-walled rooftop terrace in the heart of Manhattan. The background features a breathtaking, panoramic night view of the New York City skyline, with the glowing Empire State Building and infinite glittering city lights creating a gorgeous urban bokeh. She wears a deconstructed yet elegant asymmetrical one-shoulder couture dress in wine red and golden hues. It features sheer tulle, organza, and delicate lace inserts, a structured bodice with a diagonal tape lattice pattern, ruched textures, and sculptural cascading ruffles at the hips. Shot with dramatic sidelight, a slightly low angle, and a shallow depth of field to emphasize the model against the vibrant metropolis.

    ▼

    完成:z-image turbo bf16 +Fun ControlNet Unionの出力画像

    画像
    入力画像のポーズを反映

    Fun ControlNet Union


    【要注意】ファイル格納フォルダ: 

    これをmodels/controlnet/ に入れても動きません。
    このモデルは「パッチ」として動作するためです。

    ここにDLします▶  ComfyUI/models/model_patches/


    ◆サンプル・ワークフロー2: FunComtrolnetUnion

    画像

    設定:

    • control_type: プルダウンで pose や canny を選択。

    • strength: 0.65 ~ 0.80 推奨 (1.0は強すぎて画質が劣化)



    ■フォルダ構成:

    ダウンロードした各種ファイルは、
    以下のフォルダ内に配置します。

    ComfyUI/
    └── models/
        ├── checkpoints/
        │   └── z_image_turbo_fp16.safetensors
        │   |
        │   └── z-image-turbo-bf16-aio.safetensors
        │   └── z-image-turbo-fp8-aio.safetensors
        │
        ├── diffusion_models/
        │   └── z-image-turbo-fp8-e4m3fn.safetensors
        │   └── z_image_turbo-Q4_K_M.gguf
        │
        ├── text_encoders/
        │   └── qwen_3_4b.safetensors
        │
        └── vae/
        │   └── ae.safetensors
        │
        ├── model_patches/
        │   └── Z-Image-Turbo-Fun-Controlnet-Union.safetensors
    

    3.LoRA: Z-Image-turbo用
      コントラスト改善


    Z-Image Turbo特有の「眠たい色味(低コントラスト)」を補正するLoRAがあります。
    ※個人的にはそれほど大きな差異は感じませんでしたけど。

    また、civitaiにZ-Image用のキャラ系LoRAがじゃんじゃんUPされてますので、そちらも覗いてみてはいかがでしょう。

    ●Color Z Image Turbo film LoRA

    • Z Image Turboのコントラストと彩度を強調して、1950-60年代のテクニカラー映画のような鮮やかな発色と質感を再現。レトロな雰囲気の生成に最適 。

    DLリンク:
    Technically-Color-Z-Image-Turbo


    このLoRAの導入方法

    • ファイル格納場所:
      ComfyUI/models/loras/ (通常通り)

    • ワークフロー:
      通常通り、Load Checkpoint (またはDiffusion Model) の直後に Load LoRA を追加します。

    • 推奨のLoRA強度: 0.6 ~ 0.8

    • トリガーワード:t3chnic4lly


    その他 LoRA:

    ●Space Worlds 01

    ・宇宙船、宇宙ステーション、サイバーパンク都市の背景生成に特化。Flux版データセットからの移植版 。

    ・トリガーワード : プロンプト依存


    ●Z-Image Turbo "de-distilled"

    ・蒸留モデルの挙動を抑制し、CFGスケールを効かせやすくするための実験的LoRA。より詳細な制御が可能になる 5。

    ・トリガーワード : なし


    画像

    (参照URL)

    本記事は以下サイトを参照しています。


     
     

    cue

     
     
    こんにちは。AI映像研究会のcueです。 AIによる画像・映像・音声・音楽制作を研究してます。 映画、音楽、アプリ開発、そしてロードバイクが大好き。 広告クリエイティブ、プロンプトエンジニアなどやってます。

    あなたへのおすすめ