メインコンテンツへスキップ
見出し画像

話題の新型モデル「Anima 2.9B」を検証。プロンプト応答性が向上!?

     従来のAnimaをちょっぴりスペックアップした「Anima 2.9B」のpreview1がリリースされました。
     基本的な仕組みは従来のものと同じですが、「Transformer Block」というプロンプトと画像をすりあわせて画像を描画する部分が、従来の28ブロックから40ブロックに拡張されています。
     つまり「仕上げをする作業場が増えた」Animaです。

     プロンプトの解析・理解力に変更があったわけではなくて、あくまで「従来のルールで行う作業の回数が増えた」だけなので、「今まで理解できなかったプロンプトが使えるようになった!」とか「描写のクオリティが爆上がりした」といった劇的な性能向上が見込めるわけではありません。
     細かな部分でプロンプト解釈ミスや、ディテールの描写の食い違いなどを補正できる可能性が増えた…というような理解でよいかと思います。

    画像
    2.9B。小さなサキュバスを掴む人の手の図。
    イラストリアスだとかなり難しかったけど、Animaだと良い感じで出せる。
    こちらは指の数も正しいし、重なりによる構造破綻もなし。
    2.9Bすばらしい! と思いきや…
    画像
    従来型Animaでもちゃんと出ます。
    強いて言うなら羽が悪魔と天使が混在してるのが残念(プロンプトはdemon wing)。
    なお2.9B版にいる小さな妖精は従来版でも出現することがあったので比較対象にならず。
    服の質感は2.9Bの方があるけど、誤差の範囲かもしれません。
    画像

    結論:従来型と大きくは変わらない

     長々と読むのが面倒な人もいると思うので、最初に結論書いちゃいます。
     
    まず8/19時点での使用環境は以下となっています。

    • 「ForgeNEO」最新版なら、通常のAnimaと同じ感覚で使える。

    • 「Comfy」はカスタムノードの導入が必要です。

    • LORAは従来型を利用できます。

    • Controlnet-LLLiteはNEOは現時点では未対応。Comfyもカスタムノードが必要だと思いますが存在するかは分かりません。


     気になる描画性能の方ですが、従来型と大きな違いはないです。
     ただ大きくはないけど、ある程度の進化は感じられます。
     まだプレビュー版なので、今後学習が進んで正式版になったときは状況が変わる可能性もありますが、現在では乗り換えても劇的な違いは生じません。
     それを踏まえうえで「スペック的な理論値」込みで違いを書くと…

    ・良い点
     ディテールの正確さや描き込みの緻密さ、また構図全体を見渡した上で相互関係の合理性などの向上が期待できる。

    ・悪い点
     生成時間が長くなる。
     消費メモリが増える。
     従来型のLORAは使えるが完全互換ではない。
     2.9B用に学習したLORAは従来型では使えない。

     従来型から乗り換えるかどうかは、この辺のトレードオフをどう考えるかです。
     自分は変なポーズのnsfwイラストを描くことが多いので、ディテールの整合性が上昇する可能性というのがもの凄く魅力的なのでかなり乗り換え気味です。
     でも例えばシンプルなポーズの単体イラスト作成などだとあまりメリットがないかもしれません。
     専用LORAを作ればディテールアップも望めますが、後方互換がないのがまぁまぁ不便ですしね…。

     絵柄については、2.9Bは派生モデルが少ないので好みの絵柄を出しにくいという一面がありますが、そこは絵柄LORA使うとかHiresfixで従来モデルを指定するとかである程度は対応できます。
     自分の場合は以前紹介した「Anima画像をリアスモデルで自動i2iする機能拡張」を使っていることもあり、絵柄による不満は生じていません。


     以下、従来型との違いについて、もうちょっと詳しい説明。

    1:モデルの互換性

     2.9BはTFブロックが28から40に増えているため、従来のAnimaとして読み込もうとするとブロックの数が合わなくてエラーがでます。そのため40層に増やしたことに対応する処理を入れなければなりません。
     ForgeNEOは本体側で2.9B対応しているので、最新バージョンならそのまま使えます。追加インストールなどは一切不要です。
     Comfyは40層に対応させるためのカスタムノードが必要とのことです(Comfy使ってないのでどこで探すか分かりませんが、検索すればすぐ見つかると思います)。

    2:LORA

     Anima用のLORAはTFブロックを28層で学習しているので、従来型のLORAを使おうとするとエラーがでます。
     NEOは最新版は対応済み。
     Comfyは専用のパッチなどで対応します。
     ただし対応の仕方が「従来の層の内容を新たに追加した層にコピーする」もしくは「追加された層はスキップする」という単純な方式なので、本来の意図とは違う効果を発揮する可能性があります。とくに緻密な再現性を追求したLORAなどだと無視できない影響があるかもしれません。

     自分の手持ちのLORAで試したところ、絵柄もキャラもポーズも、どのLORAも問題なく動きました。

    3:LORAの学習

     2.9Bの40層学習に対応したスタンドアローンの学習ツール、もしくは2.9Bの配布ページで紹介されているSD-SRIPTSのfolk版を使って学習できます。
     40層学習した方が効果的なLORAになりやすいはずなので、本格的に2.9Bを使うなら、LORA学習も視野に入れるとよいかと思います。

     自分は下記のスタンドアローン版をインストールして、Anima版の素材をそのまま流用してLORAを作ってみました。特に問題なく作成できましたし、効果も従来版より向上しているのが確認できました。


    4:ControlNet-LLLite

     AnytestなどのControlNet-LLLiteも28層で学習しているため、そのままでは動きません。
     また8/19現在だとNEOは未対応です。
     Comfyの状況は分からないのですが、少なくともLllite対応のカスタムノードが必要なはずです。

     処理としてはブロック数の違いを吸収するだけなので、AIにAnimaと2.9Bの違いを解析させたのちブロック数の違いを吸収するための指示を出せば簡単に対処できます。
     一応、NEOの機能拡張として自分が作成した「Anytestが問題なく動いた改修版」を置いておきます。Built-inの「sd_forge_controlllite」を無効化して、改修版を有効にすればOKです。
     ただ近いうちにNEO公式が対応する可能性もあるので、急ぎでなければそちらを待った方が安全ですし、使う場合でもオリジナルを一時的に無効にして、改修版を臨時で使うことを強く推奨します。

    以下、メンバー専用部分で、サンプルで出力した「対戦車ライフルを構える少女」「朝焼けが差し込む部屋」「巨大な手につかまれるミニサキュバス」「メカニカル少女」の比較検証を行っています。

    画像
    画像
    画像
    画像

    あなたへのおすすめ