メインコンテンツへスキップ
見出し画像

ComfyUIを使わずにAnimaを動かす ―― Stable Diffusionの次に来る"自然文"の波に、潮目が変わる前に

    ずっとStable DiffusionはローカルのAUTOMATIC1111版で遊んできたのだけど、最近「Anima」という新しい画像生成AIモデルが気になっていた。アニメ・イラストに強いと評判で、使ってみたさはあるものの、調べると基本はComfyUI前提の情報ばかり。ノードをつなぐUIはどうも肌に合わず、できれば慣れたWebUI系で動かしたい。

    そんなわけで「ComfyUI以外でAnimaを動かす」を目標に環境を組んでみたので、その手順と所感を備忘録として残しておく。同じように1111から入って、Animaも触ってみたい人の役に立てば。

    なお最初に断っておくと、自分はこの分野の専門家ではないし、Animaも新しいモデルなので手探りの部分が多い。「自分の環境ではこう動いた」「こう理解している」という一次体験ベースの記録として読んでもらえると。

    そもそもAnimaって何?

    ざっくり言うと、CircleStone Labsが2026年5月に正式版を公開したアニメ・イラスト特化の画像生成AIモデル。ポイントは、これがSDXLやIllustrious系とは別アーキテクチャだということ。

    何が違うかというと、テキストの解釈にQwen-3というLLM(言語モデル)を使っている。SDXL/Illustrious系がタグ(単語)の羅列で指示するのに対して、Animaは自然な文章で書いた指示を理解できる。実際に触ってみると、ここがいちばん「今までと違う」と感じる部分だった(後述)。

    そして重要なのが、この別アーキテクチャゆえに、今使っているA1111ではそのまま動かないということ。さらにA1111系列の中でも対応状況に差があって、自分が調べた範囲では、

    ・ComfyUI ―― ネイティブ対応(でも今回は避けたい) ・Forge Neo ―― 対応。A1111そっくりのUIで動かせる ・reForgeなど他のA1111系 ―― 非対応

    という状況だった。つまり「ComfyUI以外で、慣れたUIで」となると、実質Forge Neoが本命になる。

    今回のゴールと方針

    やりたかったのは次の3つ。

    ・ComfyUIを使わずにAnimaをローカルで動かす ・今ある1111のSDXL/Illustrious系モデルやLoRA資産も活かしたい(共有したい) ・AnimaとIllustriousを行き来できる運用にする

    導入には「EasyForgeNeo」というワンクリックインストーラーを使った。これはForge NeoをWindows・NVIDIA GPU環境に簡単に入れてくれるもので、特にAnimaでの生成に特化して最適化されている。関連モデルの自動ダウンロードや推奨設定、便利なstyles.csvなどが最初からパッケージされているのが楽でいい。

    ちなみに自分の既存の1111は別フォルダにそのまま残して、EasyForgeNeoは新規に別構築した。1111をいじるわけではなく、環境がもう一つ増えるイメージ。Animaは別アーキテクチャなので、今の1111に手を加えても動かないから、別に立てるのが正解になる。

    導入手順

    【ステップ0:動作要件の確認】

    EasyForgeNeoの要件はこんな感じ。

    ・NVIDIA GPUのWindows PC(NVIDIA以外は本作では非対応) ・20GB以上の空きストレージ(最低要件。モデルを増やすともっと要る) ・NVIDIAドライバのバージョンが580以上 ・インストール先のフォルダ名にスペースや特殊文字を含めない

    GitやPythonを事前に入れる必要はなく、そこは全部自動でやってくれる。1111を構築済みならGPU・OS条件はまず問題ないはず。

    【ステップ1:インストーラーの入手と配置】

    公式(GitHubのEasyForgeNeoリポジトリ)から「EasyForgeNeoInstaller.bat」を右クリックで保存する。左クリックだと中身が表示されるだけなので、必ず右クリック保存で。

    次に、それを置く空フォルダを用意する。自分は「D:\EasyForgeNeo」にした。Cドライブ直下でもいいが、容量に余裕のあるドライブの、浅くて短い英数字パスが理想。深い場所や日本語・スペース入りのパスは避ける(ここは1111でもおなじみのハマりどころ)。

    【ステップ2:インストーラーの実行】

    ・インストーラーは管理者として実行しないこと。普通にダブルクリックでOK。 ・「WindowsによってPCが保護されました」と警告が出たら、「詳細表示」→「実行」。ネットから落としたbatなので出るだけで問題ない。 ・黒い画面が立ち上がって「動作に必要なモデルなどをダウンロードします。よろしいですか?」と聞かれたらEnter。

    ここから先は自動で、Forge Neo本体・拡張機能・Animaのモデル一式(拡散モデル+Qwenテキストエンコーダー+VAE)が順番に落ちてくる。回線とPC次第でそれなりに時間がかかるので放置でいい。

    なお、RTX 30シリーズ以上のGPUを検知すると、最適化オプション(sage/flash/nunchaku)を有効にしてセットアップしてくれる。

    【ステップ3:Civitai APIキー ―― ここが地味に詰まる】

    画像
    APIキーコピー画面

    途中でCivitaiのAPIキー入力を求められる。最初、自分は「空欄でも進めるだろう」と思ってEnterしたら、エラーで弾かれた(このインストーラーは空欄を許さない作りだった)。Anima派生モデルやLoRAをCivitaiから落とすのに使うので、結論としてはキーを取得して入れるのが早い。

    手順は画面に出ているとおり。

    ・Civitaiの「civitai.red/user/account」を開く ・ページを下にスクロールして「API Keys」セクションへ → [Add API key] ・[Name] に easy などと入れて保存 ・生成されたキー文字列をコピー → 黒い画面に貼り付け → Enter

    ここで一点ハマったのが貼り付け。黒い画面(コマンドプロンプト)はCtrl+Vが効かないことがあって、自分は右クリックで貼り付けたら入った。それでもダメなら、キーを手入力してしまうのが確実。キーは作成直後しか全文表示されないので、出たらすぐコピーしておくこと。

    入力したキーは「EasyForgeNeo\EasyTools\Civitai\CivitaiApiKey.txt」に保存される。ここに文字列が入っていれば、キーがちゃんと通った証拠。

    【ステップ4:起動と初回生成】

    画像
    起動初期画面

    インストールが終わると黒い画面は自動で閉じる(完走の合図)。「D:\EasyForgeNeo」の中に「ForgeNeo.bat」が生成されていれば成功。

    ForgeNeo.batをダブルクリックすると起動する。初回は準備に時間がかかるので、「Running on local URL: に続けて 127.0.0.1:7860 のようなアドレスが表示されるまで待つ。準備ができると自動的にプラウザにWebULが開く(開かなければ手動で127.0.0.1:7860へ)。この黒い画面はサーバー本体なので、生成中は閉じないこと。

    起動すると、画面はかなり1111っぽい。ただプロンプト欄が拡張機能で強化されていて、タグが個別のチップ表示になっていたりするので、最初は少し戸惑うかも(慣れると編集はむしろ楽)。

    ありがたいことに、EasyForgeNeoの推奨設定のおかげで、Animaを動かすのに必要な3点セット(チェックポイント/テキストエンコーダー qwen_3_06b_base/VAE qwen_image_vae)が最初から選択済みになっていた。Animaはこの3つを正しく指定しないと動かないのだけど、そこをお膳立てしてくれているので、もうGenerateを押すだけで1枚出せる状態だった。

    画像
    そのまま生成すると

    実際に出してみると、看板に書いた「ANIMA」の文字がほぼ崩れず出ていて、これがAnimaの片鱗かと感心した。

    1111のSDXL/Illustrious資産を共有する

    ここが今回いちばんやりたかったところ。Forge NeoはAnimaだけでなくSD/SDXL系も使えるので、1111のモデルやLoRAを共有すれば、AnimaとIllustriousを一つのWebUIで切り替えて使える。

    方法はいくつかあるが、自分は「起動オプションでパスを指定する」方式にした。1111側のフォルダを正(マスター)として扱えて、リンクを張る手間もなく、戻すのも簡単だから。

    注意点として、ForgeNeo.batを直接書き換えると更新で巻き戻ってしまう。なので自分専用のバッチを別に作る。中身を見ると、ForgeNeo.batは引数を素通しする作りで、COMMANDLINE_ARGSが設定済みならそれを尊重する仕組みになっていた。だから本体を触らず、引数を渡すだけのバッチを一つ作ればいい。

    「D:\EasyForgeNeo」に、こんな内容で「ForgeNeo_Mine.bat」を作成する(メモ帳で書いて、保存時にファイルの種類を「すべてのファイル」にして拡張子.batで保存)。

    @echo off set COMMANDLINE_ARGS=--ckpt-dir "D:\stable-diffusion-webui-dev\models\Stable-diffusion" --lora-dir "D:\stable-diffusion-webui-dev\models\Lora" call "%~dp0ForgeNeo.bat"

    パスの部分は自分の1111のモデル/LoRAフォルダに置き換えること。以降はこのForgeNeo_Mine.batから起動すると、1111側のSDXL/Illustriousモデルやそこに入っているLoRAが、Forge Neoの一覧にAnimaのモデルと一緒に並ぶ。

    ここで一つ面白い挙動があった。LoRAは「--lora-dir」で指定した1111側のフォルダ"だけ"を見るようになる(参照先が置き換わる)一方、Checkpointは「--ckpt-dir」で1111側を指定しても、Forge Neo標準のフォルダも見続けたまま"追加で"1111側も見る、という非対称な動きをした。なので、neo側にチェックポイントを置いても反応するのに、neo側にLoRAを置いても出てこない、ということが起きる。

    この挙動はWebUIの派生やバージョンで差があるらしいので断定はしないが、自分の環境ではこうだった。結論として、混乱を避けるためにモデルもLoRAも全部1111側にまとめて、中をサブフォルダ(Anima用/Illustrious用)で分類する運用にした。これだと一覧でフォルダ分類されて表示されるので見分けやすい。

    なお当然だけど、IllustriousのLoRAはAnimaでは使えないし、その逆もできない(アーキテクチャが違うため)。自作のIllustrious向けLoRAをAnimaで使おうとしても噛み合わないので、そこは分けて考える必要がある。

    AnimaとIllustriousの設定使い分け

    画像
    切り替え画面

    Forge NeoにはUI Presetという機能があって、「anima」「xl」などアーキテクチャごとに切り替えられる。Illustrious系はSDXLベースなので「xl」プリセットを使う。

    ただ、UI Presetが覚えてくれる項目は限られていた。自分の環境で確かめたところ、xlに切り替えると、

    ・記憶される … Checkpoint、VAE / Text Encoder

    ・初期化される … Sampling Method、Hires.fix(チェックが外れる)、CFG Scale

    という挙動だった。つまりモデルとエンコーダー周りは前回の状態を覚えてくれるが、サンプラー・Hires・CFGといった生成パラメータは毎回プリセット既定値に戻る。保存ボタンも見当たらず、中身がプログラム側で固定定義されている作りらしいので、ユーザーが自分の数値を上書き保存する用途のものではないようだった。起動時の初期状態を固定したいなら Settings > Defaults > Apply で1セットだけ決められるが、これはxl用とanima用を切り替える使い方はできない。

    なので実用上は、xlに切り替えたあと、Sampling Method・Hires.fix・CFG Scaleの3つは手で設定し直す、という前提で運用している。逆に言えば、毎回直すのはこの3項目だけで済むということでもある。

    自分の場合、その3項目もxlのときの値は体で覚えているので手直しは一瞬だが、Animaはまだ手探り。なので「起動直後=Anima最適の状態」のままにしておいて、xlを使うときだけ手動で切り替える、という運用に落ち着いた。理解が浅いほうを自動で正しくしてくれる状態に乗っかる発想。

    参考までに、自分が基準にしている両モードの数値メモ。Anima側はEasyForgeNeoの初期値そのまま、Illustrious側は一般的な定番+普段の感覚。

    【Anima の設定】
    ・UI Preset … anima
    ・VAE/TE … qwen_image_vae + qwen_3_06b_base(必須)
    ・Sampling Method … ER SDE
    ・Schedule Type … Beta
    ・Steps … 32
    ・CFG … 4(低め)
    ・Shift … 3
    ・解像度 … 1024×1024

    【Illustrious(xl) の設定】
    ・UI Preset … xl
    ・VAE/TE … 両方外す
    ・Sampling Method … Euler a / DPM++ 2M系
    ・Schedule Type … Automatic
    ・Steps … 28前後
    ・CFG … 5〜7
    ・Shift … なし
    ・解像度 … 1024×1024

    切り替えで事故りやすいのが、CFGとサンプラーとShift。

    CFGはAnimaが4と低めで正解。SDXLの感覚(7前後)で上げすぎると、Animaは破綻しやすい。逆にIllustriousでCFGを4まで下げると眠い絵になる。「Anima=低め、Illustrious=やや高め」とセットで覚えておくと混乱しない。

    Shiftというのは、Animaのようなフローマッチング系アーキテクチャ特有のパラメータで、SDXLには無い。ものすごくざっくり言うと、ノイズから絵を作る過程で、序盤(全体の構図)と終盤(細部)のどちらに計算の重みを置くかを調整するつまみ。初期値の3でAnima向けに調整されているので、まずは触らなくていい。

    それから解像度の考え方も違う。SDXLは「512で生成→Hires.fixで1024へ」という流れに慣れていたが、Animaは最初から1024で生成するのが基本(初期値が1024×1024)。すでに完成度の高い1024画像ができているので、さらに上げるときのHires.fixのDenoising strengthも低め(0.3前後)でいい。xlの感覚で0.6まで上げると、せっかくの絵を作り直して破綻させてしまう。同じHires.fixでも、出発点(512か1024か)が違うので適正値も違う、という理解。

    実際に使ってみた所感

    ここからが本題というか、Animaの「良さ」の話。

    いちばん感じたのは、やはり自然文プロンプトの強さ。「カフェの窓辺で両手でカップを持って雪を見る銀髪の少女」みたいな、誰が・何を・どうしている、という関係性を含んだ情景を、文章で書くとちゃんと汲んでくれる。しかも試行回数ゼロ、一発でかなり狙い通りのものが出た。タグ羅列だと要素がバラけがちなところが、文章だと意図した構図にまとまりやすい。

    試しに、まったく同じ情景を「タグ羅列」と「自然文」の両方で出し比べてみた(Seed・モデル・解像度は揃えた)。題材は「図書館で本を読む眼鏡の少女」。

    画像
    タグ版-図書館で本を読む少女

    ▲ タグ版:1girl, black hair, glasses, library, bookshelf, sitting, reading book, holding book, open book, desk lamp, indoors,

    画像
    自然文-図書館で本を読む少女

     ▲ 自然文版:masterpiece, best quality, score_7, safe.
    A girl with black hair and glasses is sitting at a desk in a library, reading an open book she holds in her hands. Tall bookshelves stand behind her, and a small desk lamp lights the page,

    自然文は開いた本に視線を落とし、机・ランプ・背後の本棚もきちんと配置された。「読書している」という行為まで再現されている。

    この差が、Animaの言語理解の強さなのだと思う。「本を読んでいる」という"行為"を、タグの組み合わせではなく文意として汲んでくれる。ちなみに屋上で風に吹かれる少女のような題材だと、タグ版と自然文版でそこまで大きな差は出なかった(どちらも成立した)。なので「自然文が常に圧勝」というより、視線・動作・要素同士の関係を含む指示ほど自然文が効く、という印象。

    画像
    文字が崩れづらい

    文字を入れられるのも面白い。「Good Morning」と書いた紙を持たせたら、手書き風の文字がほぼ崩れず出た。Illustrious系では文字はまず崩壊するので、これは別アーキテクチャならではの強み。

    さらに、Qwenの言語理解が強いおかげか、日本語をGoogle翻訳した簡易的な英文でも、文として意味が通っていればある程度狙ったものが出る。タグ辞書を完璧に覚えていなくても情景を作れるのは、発想の転換だった。ちなみに日本語そのままでも理解できるかと思って試したが、さすがにそれはまだうまくいかなかった。英語(翻訳でも)経由が安定する。

    精度を上げるコツとしては、主語と動作をはっきりさせること、情景を一つの長文に詰め込まず文を分けて書くこと、あたりが効く印象。ただこのへんのベストプラクティスは新しいモデルゆえまだ固まりきっていないので、実際に出し比べて自分の手で掴んでいくのが結局いちばん確実だと思う。

    使い分けとしては、文字入り・複雑な情景・一発で構図を決めたいものはAnima、作り込んだ自作キャラLoRAを使うならIllustrious、というふうに棲み分けると、両環境を持っている強みが活きる。

    最後に ―― AI生成を使うにあたって

    これは技術の話とは別に、自分のスタンスとして書いておきたい。

    AI生成を使う以上、権利的に完全にクリーンと言い切れる領域ではない、と自分は思っている。だからこそ、使うモデルや素材のライセンス・規約は各自で確認してほしいし、自分も確認するようにしている。商用利用の可否なんかは特にモデルによって違うので、ここで一律にどうこうとは言えない。

    強い言葉で誰かを縛りたいわけではなくて、あくまで自戒として、表に変に出さない。流出させない。節度を持って楽しむ、というくらいの距離感でやっている。そのうえで、新しいモデルに触れて「こんなことができるのか」と驚く時間は、純粋に面白い。

    Animaはまだ新しくて情報も手探りだけど、ComfyUIを避けて慣れたUIで動かせたし、1111の資産とも共存できた。同じことをやりたい誰かの備忘録になれば。

    それと、これは個人的な感覚なのだけど、これから先はAnimaのような「自然文で指示する」タイプのモデルが増えていくんじゃないかと思っている。タグを正しく積み上げる作法から、言いたいことを文章で伝える作法へ。LLMをテキストエンコーダーに据える流れは、たぶん一過性のものではない。そう考えると、まだ情報が出そろっていない今のうちに、慣れたUIで実際に触れる環境を組めたのはよかったと思う。新しい潮流に、出遅れずに乗れた感じというか。これから来るかもしれないものを、早めに自分の手で確かめておけたのは、単純に楽しかった。

    (この記事の設定値や挙動は自分の環境での記録です。モデルやバージョンによって変わる部分があるので、参考程度に)

    あなたへのおすすめ