
【究極のローカル日本語文字修正AI】Boogu-Image-0.1を使ってみた話②【Inpaint】
はじめに
前回のつづきです。
Ernie-Image、HiDream-O1-Image、Ideogram 4など、ローカル環境でも日本語をある程度正しく生成できるようになってきましたが、画像編集AIとしてまともに日本語を表示できるモデルは、Boogu-Imageが初めてだと思います。
※ HiDream-o1も参照機能がありますが、ちょっとイマイチでした
Ernie-Image等の通常のtxt2imgモデルでも、手作業で文字を修正することはできますが、単なるimg2imgであるため限界があります。一方で、ちゃんとした画像編集AI機能を使えば、スタイルなどを維持したまま、全く別の文字に書き換えることが可能になります。

プロンプト:Change letter to "平成の百貨店"
クラウドAIでは当たり前になった機能ですが、ローカルAIでは長年の課題でした。やっとまともな「日本語修正AI」を利用できるようになりました。
ComfyUIワークフロー
Krita-ai-diffusionが対応してくれればより簡単にできるでしょうが、とりあえずComfyUIで利用できるようにします。

(ComfyUI managerから導入可能な)カスタムノードcomfyui-inpaint-cropandstitchを利用して、

クロップ部を1024x1024に拡大し、

その部分のみで編集AIを利用したインペイントを行います


まとめ
通常の画像生成版(txt2img)にはTurbo版があるので高速生成できますが、Edit版は25ステップ実行する必要があるので遅いです。
※ 筆者環境のようにマルチGPUであれば、1.8倍程度の速度にはできます。モデルの間に「MultiGPU CFG Split」を挟むだけです。モデルアーキテクチャ依存の機能ですが、Boogu-Image-Editは利用できるようです。(Qwen-Image-Editと同じ?)

付録
本記事で利用したComfyUIのjsonファイルを支援者様(メンバーシップ)向けに添付します。参考程度にご利用ください。