
2026年:静止画のAI高画質化・アップスケールのまとめ【ローカルAI】
はじめに
生成AIを利用した静止画像の高画質化・アップスケール手法は無数に存在し、一長一短あります。本記事では、筆者がComfyUIで利用している(写実的な画像の)アップスケールモデルやその特徴を紹介していきたいと思います。
AIの高画質化・アップスケールをざっくり2つに分けると、
① アイデンティティを保つもの
② アイデンティティを保たないもの
に分けられます。どちらも「綺麗になる」事に関しては同じですが、「似ているが別画像になる事」を許すかどうかです。
たとえば、小さな解像度でAI生成してから再度大きな解像度でimg2img、latentアップスケールするHires-fix手法は②になります。顔からスタイルまで大きく変更を受けます。そもそも最初の生成は途中生成物(ラフ画)なので、アイデンティティを保つ必要がありません。
他にも、背景や模様、動物の素材画像の解像感が悪いなと感じた時に、学術的・生物学的に正しくなくても構わず、ただ解像感を上げたいという場合にも有効です。
しかし、本記事では、主にアイデンティティを保つ①の用途に注目したものを紹介したいと思います。
ただ拡大するもの
高画質化するわけではありませんが、拡大する時に、直線や曲線で補間する手法です。
ピクセル解像度を合わせ、アップスケール後の画像とブレンドする事で、オリジナルの情報を保つためのリファレンスとしても利用できます。

計算負荷が高いと言われますが、静止画1枚ならば全く差はありません。
※ 整数倍の拡大でかつ情報の損失を抑えたい場合やピクセルアートの場合は他の方法も有効です
基本的なAIアップスケール
拡散モデルを利用しないAIでアップスケールします。さまざまなAIモデルが存在します。強いAI効果はありませんが、オリジナルに忠実な高画質化を行う事ができます。

ノイズを増やす事が多いですが、高速で綺麗な画像をアップスケールする場合に適しています
※ 他にも用途(アニメやJPEG劣化など)に応じて様々なAIモデルがあります
拡散モデルのアップスケール
拡散モデルを利用すると、情報として全く存在しないものまで生成できるので、大きく画質を向上させる事ができますが、アイデンティティも大きく失います。そのための「工夫」が必要になります。
※ また、最終的に拡散モデル生成になるため、生成できる品質や解像度は、そのモデル依存になります。一般的なモデルは2K解像度あたりが上限なので、それ以上にする場合は、タイルで分割したアップスケール(ultimalte-sd-upscaler等)を行う必要があります。
一般的な手順は、
① 上記のアップスケールモデルで目的の解像度にする
② VLMや画像入力CLIPを利用してプロンプトを作る
例ではollama qwen3-vl(vlm)
あらかじめホストにollamaとqwen3-vlを導入しておく必要があります
③ canny(輪郭)やdepthマップを利用して制約を作る
例ではcannyを利用
④ 拡散モデルで生成
例ではZ-Image-Turboを利用
denoisingを0.3〜0.4あたりにする

GPU資源の奪い合いを回避するために、緩衝時間(5秒)を挟んでいます。ollama側のkeep_aliveを0にする事、ComfyUI側で、「--disable-smart-memory --cache-none」が推奨です



服の模様などを勝手に生成していますが、最低限のアイデンティティを保っています
画像編集AIモデルのアップスケール
上述の手法は、古典的になりつつあります。最近は何でもOKの画像編集AIモデルがあるので、基本的に「綺麗にして!」系のプロンプトで事足りるようになっています。GoogleのNano BananaやChatGPTのクラウドAIでも可能です。
※ これからは、特化したAIモデルやサービスは、性能面においても汎用AIに飲み込まれていくのでしょうね。規模の小さなAIや旧技術では、特化(チューニング)すれば、その領域で性能が高いというのが定石でしたが、AIが高性能化・大規模化する昨今では、人間と同じで、日本語だけ学んだ人よりも、外国語も学んだ方が、日本語能力が上がる傾向があるのと同じなのでしょう
ただし、まだ完璧ではなく、使い分けは必要です。拡散モデルなので、確率的にオリジナルのアイデンティティを大きく失う事もあります。また、2K程度のすでに高画質な画像を4Kにしようとしても上手くできません。
解像度の悪い画像や、ボロボロの写真、色あせた写真の「修復」に利用するのが適していると思います。

アップスケールに特化した拡散AIモデル
最近よく話題になっているのが、動画もアップスケール可能なSeedVR2を利用した静止画アップスケールです。4K程度まで可能です。汎用性も高く、複雑な事が必要ないので、とりあえず高画質化したいという用途には最適だと思います。
上述した他の拡散モデルの利用法は、アップスケールに特化していない一般的な画像生成AIモデルなので、ControlNetやプロンプトなどの「制約」をつけないとアイデンティティを保てません。
一方で、アップスケールのみに特化したSeedVR2等のモデルは、それらを利用することなくアップスケールできます。


例ではfp8_scaled版を利用していますが、fp16の方が有意に綺麗になります。処理時間やVRAMとの相談になると思いますが、利用できる場合はfp16の方が良いと思います。
まとめ
AIは黎明期なので、基本的に「新しいは正義」が継続して正しく、汎用が特殊を浸食していく傾向もありますが、細かな用途や特性においては、パフォーマンスも含めて一長一短がまだ存在します。
付録
本記事で利用したComfyUIのワークフローを、支援者様(メンバーシップ)向けに添付しています。参考程度にご利用ください。

必要のないものは、無効化(Ctl+B)や削除してください
※ RTX 3060 12GBの場合は、z-image-turboのControlNetの動作が厳しいようです。512x512→1024x1024なら正常終了しますが、1024x1024→2048x2048はVRAMが足りません。動作しない場合は、範囲選択して「Ctl+B」で無効化できます。
※ 例として利用している入力画像はAI生成ですが、高精細な画像なため、そのままで良い結果を出しますが、解像度が高いだけでぼやけているような画像の場合は、一度縮小させた方が良いことが多いです。

※ ollamaを利用する場合は、あらかじめollamaを導入している必要があります
※ 次のカスタムノードを利用しています
rgthree-comfy
comfyui-custom-scripts
comfyui-kjnodes(sleep機能)
comfyui-ollama
seedvr2_videoupscaler