メインコンテンツへスキップ
見出し画像

【2026年9月最新】PixAI Tagger v1.0の解説(v0.9、WD EVA02との比較)

    2026年9月下旬にPixAIの最新Taggerモデル「PixAI Tagger v1.0」がオープンソースモデルとして公開されました。同月にリリースされたPixAI独自のクローズド画像生成モデル「Tsubaki.3」の開発にも利用されたということで期待できそうです。

    ・・・が、まったく話題になってません。

    Tagger自体が地味なツール(AIモデル)なのでしかたないところでしょうか。

    ならばということで、自分で調べたり使ってみたりしました。

    Taggerについて

    Taggerとは

    Taggerとは、画像に描かれた人物・物・特徴・画風などを表す短い語句、すなわち「タグ」を自動で検出・推定するツールやAIモデルです。主に以下の用途で使用されます。

    • 画像生成モデルやLoRA作成のための学習画像にタグを付ける

    • 画像にタグを付け、画像ビューアや管理ソフトで検索・分類しやすくする

    • 画像のタグを推定し、似た画像を生成するプロンプトの参考にする

    ちなみにタグではなく自然言語(文章)で表すことをキャプション、キャプションするツールやAIモデルのことをCaptionerと呼んだりします。

    なお画像入力可能なLLMやVLMでもTaggerと同様のことはできますが、タグ推定に関してはTaggerのほうが遥かに高性能です。検閲解除などの面倒なこともありません。

    本記事で扱うTagger

    本記事では、PixAI Taggerを含めてDanbooruを対象にしたTaggerのみを扱います。すなわち以下のようなものです。

    • 学習データ:Danbooruサイトに登録された画像とタグ

    • 入力データ:アニメ・イラスト画像

    • 出力データ:入力データにマッチするDanbooruタグのリスト

    e621を対象にしたZ3D E621 Convnextや、主に自然言語でキャプションするFlorence-2は扱いません。

    PixAI Taggerの概要

    PixAI Taggerは、アニメ・イラスト生成AIプラットフォームのPixAIを運営するMetanomaly社のPixAIチームが開発したTaggerです。オープンソースモデルとしては第一弾のv0.9が2025年9月10日、v1.0が2026年9月19日に公開されました。

    PixAI Taggerは現在広く使用されているWaifuDiffusion (WD14) とはモデル形式が異なり、一部ツールでしかサポートされていません。そのためWD14で最新(といっても2024年7月リリース)のSmilingWolf/wd-eva02-large-tagger-v3を使っているユーザーが多いです。しかしPixAI Tagger v0.9を利用しているユーザーの評価は高いようです。

    PixAI Tagger v0.9

    PixAI Tagger v0.9は、現在も広く利用されているwd-eva02-large-tagger-v3の分類ヘッド (classification head) を新しいデータセットで引き続き学習させ、キャリブレーションの補助としてembedding-space MixUpを利用したと説明されています。

    ・より新しいデータ。より最近の版権キャラクターを認識します。
    ・デフォルト設定は検出優先。検索や収集・整理に適した設定になっています。目的の精度に合わせて閾値を調整してください。
    ・キャラクターにフォーカス。ここに時間を費やしました。それはスコア評価にも表れています。

    https://huggingface.co/pixai-labs/pixai-tagger-v0.9 より

    主要なスペックは以下のとおりです。

    項目内容パラメータ数317.9million(3.179億)入力解像度448×448語彙13,461タグ、2カテゴリカットオフ2025年1月\begin{array} {l|l} \bf{項目} & \bf{内容} \\ \hline \text{パラメータ数} & \text{317.9million(3.179億)} \\ \hline \text{入力解像度} & \text{448×448} \\ \hline \text{語彙} & \text{13,461タグ、2カテゴリ} \\ \hline \text{カットオフ} & \text{2025年1月} \\ \end{array}

    語彙の内訳は以下のとおりです。

    カテゴリタグ数 推奨説明閾値general (0)9,7410.30衣装、ポーズ、小道具、構図など(1girl, long_hairなど)character (4)3,7200.75キャラクターの名前~0.85\begin{array} {l|r|c|l} \bf{カテゴリ} & \bf{タグ数} & \bf{推奨} & \bf{説明} \\ & & \bf{閾値} & \\ \hline \text{general (0)} & \text{9,741} & \text{0.30} & \text{衣装、ポーズ、小道具、構図など} \\ & & & \text{(1girl, long\_hairなど)} \\ \hline \text{character (4)} & \text{3,720} & \text{0.75} & \text{キャラクターの名前} \\ & & \text{~0.85} \\ \end{array}

    より多くのタグを検出する設計のため、閾値を調整しないと誤検出が多くなります。特にキャラクターの閾値は高めの値が推奨されています。
    またキャラクターにフォーカスしているため、背景の検出性能は弱い可能性があります。

    PixAI Tagger v1.0

    PixAI Tagger v1.0のアーキテクチャと評価については、「Tsubaki.3 技術レポート(07章 Tagger)」でも詳しく説明されています。

    PixAI Tagger v1.0は(v0.9の延長ではなく)、画像・動画のセグメンテーション(領域切り分け)モデルとして定評のあるSAM 3 (Segment Anything Model 3) の画像バックボーンを採用しています。

    主要なスペックは以下のとおりです。

    項目内容パラメータ数486.3million(4.863億)入力解像度1008×1008語彙30,877タグ、6カテゴリカットオフ2026年5月\begin{array} {l|l} \bf{項目} & \bf{内容} \\ \hline \text{パラメータ数} & \text{486.3million(4.863億)} \\ \hline \text{入力解像度} & \text{1008×1008} \\ \hline \text{語彙} & \text{30,877タグ、6カテゴリ} \\ \hline \text{カットオフ} & \text{2026年5月} \\ \end{array}

    語彙の内訳は以下のとおりです。

    カテゴリタグ数 推奨説明閾値general (0)15,0430.17衣装、ポーズ、小道具、構図など(1girl, long_hairなど)character (4)8,3080.27キャラクターの名前style (1)4,9170.15画風、アーティスト(絵師)などcopyright (3)2,4600.24キャラクターの登場作品(touhou, blue_archiveなど)meta (5)1450.17媒体、解像度、ステータスなど(highres, official_artなど)rating (9)40.41rating:g, rating:s, rating:q, rating:e (general, safe, questionable, explicit) \begin{array} {l|r|c|l} \bf{カテゴリ} & \bf{タグ数} & \bf{推奨} & \bf{説明} \\ & & \bf{閾値} & \\ \hline \text{general (0)} & \text{15,043} & \text{0.17} & \text{衣装、ポーズ、小道具、構図など} \\ & & & \text{(1girl, long\_hairなど)} \\ \hline \text{character (4)} & \text{8,308} & \text{0.27} & \text{キャラクターの名前} \\ & & & \text{} \\ \hline \text{style (1)} & \text{4,917} & \text{0.15} & \text{画風、アーティスト(絵師)など} \\ & & & \text{} \\ \hline \text{copyright (3)} & \text{2,460} & \text{0.24} & \text{キャラクターの登場作品} \\ & & & \text{(touhou, blue\_archiveなど)} \\ \hline \text{meta (5)} & \text{145} & \text{0.17} & \text{媒体、解像度、ステータスなど} \\ & & & \text{(highres, official\_artなど)} \\ \hline \text{rating (9)} & \text{4} & \text{0.41} & \text{rating:g, rating:s, rating:q, rating:e} \\ & & & \text{(general, safe, questionable, explicit)} \ \end{array}

    v0.9と比較してすべての項目でスペックが向上しています。特に一般タグ (general) は1.5倍、キャラクタータグは2.3倍に増えました。2026年5月までのキャラクター知識があることが嬉しい人もいるでしょう。

    もっともタグカテゴリの重要性・必要性は用途によって異なります。
    画像ビューアや管理ソフトで検索・分類するためであれば、キャラクターの推定は重要だと思います。しかしキャラクターLoRA作成において学習画像のキャラクターがすべて同じであれば、キャラクターの推定は不要です。またタグを画像生成に利用する場合、古い画像生成モデルでは新しいタグが効かないこともあり得ます。

    主要Taggerとの比較

    スペック比較

    2026年10月現在の主要なTaggerのスペックをまとめた表です。

    画像

    2026年にリリースされたWD EVA02 Tagger 2026 Canary、OppaiOracle V1.1と比較してもスペックが高く、高性能であると期待できます。

    スコア比較

    HFのPixAI Tagger v1.0ページに掲載されているベンチマーク結果によると、PixAI Tagger v0.9を含む7つの主要なTaggerとの比較において、スコアでは首位だったそうです。一方で推論性能(処理速度)はもっとも遅かったそうです。

    • 一般タグに対する総合スコア:3つの総合スコアすべてで首位

    画像
    https://huggingface.co/pixai-labs/pixai-tagger-v1.0 より
    • 推論性能:もっとも低速

    画像
    https://huggingface.co/pixai-labs/pixai-tagger-v1.0 より

    ユーザー評価

    以下は、私が確認した限りnoteにおける唯一のPixAI Taggerの評価を含む記事です。本記事が2本目の記事になります。どれだけマイナーなモデルなんだ・・・。

    PixAI Tagger v0.9を含む主要なTaggerについて、それぞれ実際に使用したうえで評価されているようです。2026年9月時点の情報となっていますが、残念ながら本記事執筆時点ではPixAI Tagger v1.0については記載されていません。

    PixAI Tagger対応ツール

    PixAI Taggerは現在広く使用されているWD14とはモデル形式が異なり、一部ツールしか対応していません。ここでは私が知っているPixAI Taggerに対応したツールを紹介します。

    ImageTaggerGUI(旧名: PixAI Tagger ONNX GUI)

    単体で動作するGUIツールです。
    もともとはPixAI Tagger v0.9専用のツールとして開発されましたが、現在では主要なTagger・Captionerモデルに加え、Gemini・OpenAI・Claude・Grok・ローカルVLMなどにも対応しています。

    しかしPixAI Taggerについては本記事執筆時点ではv0.9しか対応されていません。使用モデルの定義はハードコードされており、ビルドも必要なので素直にv1.0対応されるのを待ったほうが良いです。頻繁に更新されているので近日中に対応されると思います。

    画像

    szxex/stable-diffusion-webui-wd14-tagger

    A1111系WebUIの拡張機能です。
    stable-diffusion-webui-wd14-taggerはforkが多いですが、拙作のものを含めてPixAI Taggerには非対応です。szxex氏のこちらのforkは、PixAI Taggerを含めた主要なTaggerに対応しており、Forge Neoでも動作します。

    PixAI Taggerについては本記事執筆時点ではv0.9しか標準対応されていませんが、設定ファイルに追記することでv1.0に対応可能です(手順は後述)。こちらも頻繁に更新されているので近日中に標準対応されると思います。

    画像

    ComfyUI Booru Tagger

    ComfyUIのカスタムノードです。
    PixAI Taggerについてはv0.9とv1.0の両方に対応しています。
    私は使ったことが無いので詳しく解説できません。

    PixAI Tagger 1.0の利用方法

    Hugging Face Spaceでの利用

    PixAI公式がHugging Face Space上でのデモ環境を提供しています。

    お試しで画像を1枚タグ付けするだけならこれで十分です。

    画像

    szxex/stable-diffusion-webui-wd14-taggerでの利用

    szxex/stable-diffusion-webui-wd14-taggerは本記事執筆時点ではPixAI Tagger v0.9しか標準対応されていません。ここでは設定ファイルに追記してv1.0に対応させる手順を説明します。

    PixAI Tagger v1.0のモデルファイルは、Mexes氏によりONNX形式に変換されたものを使用します。

    FP32 / FP16 / INT8の3形式が配布されていますが、GPU (CUDA) 利用の場合は FP16、CPU利用および互換性重視の場合はFP32を利用するのがよいです。ただし私の環境ではGPU処理ではなくCPU処理となりました(他のstable-diffusion-webui-wd14-taggerでも同様)。

    以下はFP16の利用手順です。FP32を利用する場合は 'model_fp16.onnx' を 'model.onnx' に変更してください。szxex/stable-diffusion-webui-wd14-taggerはインストール済みであるものとします。

    • 準備:設定ファイルへの追記
      A1111系WebUI拡張機能のインストールフォルダ (extensions) にあるstable-diffusion-webui-wd14-tagger\tagger\user_append.py の13行目付近
      append_interrogators: Dict[str, Interrogator] = {
      の直後に以下の内容を追記します。

            'pixai-tagger-v1.0': GeneralInterrogator(
                'pixai-tagger-v1.0',
                 repo_id='Mexes/pixai-tagger-v1.0-onnx-fp32-fp16-int8',
                 model_path='model_fp16.onnx',
                 tags_path='selected_tags.csv',
                 categories_map={'0':'general','4':'character','1':'style','3':'copyright','5':'meta','9':'rating'},
            ),

    A1111系WebUIを(再)起動した後は、他のstable-diffusion-webui-wd14-taggerと同様の操作です。

    1. pixai-tagger-v1.0の選択
      Taggerタブに移動し、「Interrogator」でpixai-tagger-v1.0を選択します。見当たらない場合は設定ファイルへの追記で失敗している可能性が高いので見直してください。

    2. カテゴリ閾値の設定
      「Interrogator Option (split by comma)」でカテゴリ閾値を設定します。推奨値の場合は以下のとおりです。

    category_thresholds={"general":0.17, "character":0.27, "style":0.15, "copyright":0.24, "meta":0.17, "rating":0.41}
    画像

    ただしほとんどの場合、generalとcharacter以外のカテゴリのタグは重要ではないので、面倒であれば「Interrogator Option (split by comma)」には何も入力せず「Threshold(全体の閾値)」と「Character Threshold(キャラクターの閾値)」のスライダーで設定するだけでも構いません(推奨値はそれぞれ0.17と0.27)。

    画像

    閾値は、
    「Interrogator Option (split by comma)」
    →「Threshold」スライダー
    →「Character Threshold」スライダー
    の順に適用されるため、「Interrogator Option (split by comma)」を使用する場合は各スライダーを0などの十分に低い値に設定してください。

    また、generalとcharacter以外のカテゴリタグが不要であれば、「Categories」のチェックを外すことで結果から除外することができます。

    テスト

    2つの画像をそれぞれ3つのTaggerでタグ付けしてみました。

    • タグ付けする画像のキャラクター

      • ブルーアーカイブ 橘ヒカリと橘ノゾミ(Danbooru登録:2024年4月)

      • ブルーアーカイブ 白尾エリ(Danbooru登録:2025年8月)

    • 使用するTagger

      • WD EVA02-Large Tagger v3(カットオフ:2024年2月)

      • PixAI Tagger v0.9(カットオフ:2025年1月)

      • PixAI Tagger v1.0(カットオフ:2026年5月)

    テスト1:画像

    • 解像度:1152×896

    • ブルーアーカイブ 橘ヒカリと橘ノゾミ(Danbooru登録:2024年4月)

    • 背景:少し細かめ

    • 画像生成モデル:Anima base-v1.0(カットオフ:2025年9月)

    画像

    テスト1:WD EVA02-Large Tagger v3

    閾値:0.35

    multiple girls, tail, long hair, train, halo, 2girls, pantyhose, train station, demon tail, yellow eyes, armband, boots, smile, green hair, black footwear, skirt, pointy ears, hat, long sleeves, railroad tracks, jacket, yellow halo, shorts, people, closed mouth, grin, looking at viewer, very long hair, peaked cap, pleated skirt, black shorts, black tail, shirt, twintails, blue headwear, multiple boys, white pantyhose, green halo, black skirt, demon girl, outdoors

    テスト1:PixAI Tagger v0.9

    閾値:一般 0.30、キャラクター 0.75

    train, multiple unit train, demon tail, locomotive, multiple girls, green halo, twins, train station, blue armband, halo, train station platform, tail, railroad tracks, armband, 2girls, long hair, peaked cap, black tail, shako cap, sisters, tactile paving, hat, green hair, siblings, skirt, black footwear, double-breasted, twintails, boots, pleated skirt, long sleeves, buttons, pointy ears, demon girl, looking at viewer, smile, outdoors, shorts, black skirt, jacket, hand on own hip, white pantyhose, yellow eyes, pantyhose, shirt, very long hair, people, black jacket, standing, ticket, white gloves, wavy hair, demon horns, closed mouth, black hat, black belt, kepi, day, blush, black shorts, belt, reaching towards viewer, open mouth, outstretched arms, full body, blonde hair, sidelocks, multiple boys, reaching, nozomi (blue archive), hikari (blue archive)

    • 誤検出

      • 特徴:demon horns

      • 衣装:shako cap(シャコー帽), kepi(ケピ帽)

      • その他:ticket

    • 未検出

      • 特徴:grin (25%)

    テスト1:PixAI Tagger v1.0

    閾値:一般 0.17、キャラクター 0.27、その他はそれぞれ推奨値

    blue archive, multiple girls, highres, twins, pantyhose, tail, siblings, sisters, 2girls, demon tail, green hair, blue armband, halo, train, white pantyhose, long hair, hat, twintails, gloves, shorts, train conductor, armband, skirt, white gloves, train station, yellow eyes, multiple boys, pointy ears, looking at viewer, peaked cap, smile, pleated skirt, grin, long sleeves, boots, very long hair, outdoors, absurdres, standing, green halo, jacket, blue shorts, day, black shorts, buttons, sidelocks, closed mouth, black skirt, double-breasted, multiple others, black tail, railroad tracks, blue skirt, short shorts, black hat, full body, blue hat, demon girl, outstretched arms, multiple unit train, sky, hair between eyes, blue boots, belt, black boots, people, hikari (blue archive), nozomi (blue archive)

    • 検出(他の2モデルでは未検出だったもの)

    • 未検出

      • ポーズ・構図:hand on own hip (15%)

    テスト2:画像

    • 解像度:832×1216

    • ブルーアーカイブ 白尾エリ(Danbooru登録:2025年8月)

    • 背景:適当

    • 画像生成モデル:Anima base-v1.0(カットオフ:2025年9月)

    画像

    テスト2:WD EVA02-Large Tagger v3

    閾値=0.35

    1girl, shirt, solo, black skirt, black footwear, white shirt, hat, witch hat, black socks, black headwear, skirt, long hair, socks, pleated skirt, jacket, black jacket, smile, outdoors, sky, open clothes, broom riding, long sleeves, breasts, open jacket, cloud, bow, crossed legs, shoes, magic, earrings, sidesaddle, looking at viewer, white hair, hair between eyes, broom, blue sky, red bow, open mouth, day, collared shirt, jewelry, braid, bowtie, sitting, large breasts, very long hair, red bowtie, black choker, orange eyes, choker, blush, :d, single braid, black gloves, witch, halo, fingerless gloves, school uniform, loafers, thighs, red eyes, cloudy sky, gloves, tree

    • 検出(他の2モデルでは未検出だったもの)

      • 背景:tree

    • 誤検出

      • 衣装:black choker

    • 未検出

      • 特徴:haloの色 (17%)

      • 衣装:striped bow (5%)

      • 背景:mountain (21%)

    テスト2:PixAI Tagger v0.9

    閾値:一般 0.30、キャラクター 0.75

    broom riding, witch hat, black socks, sidesaddle, broom, 1girl, socks, hat, black skirt, sky, outdoors, white shirt, skirt, black hat, solo, long hair, shirt, cloud, pleated skirt, open mouth, crossed legs, blue sky, white hair, shoes, smile, halo, witch, bow, braid, day, black choker, looking at viewer, black jacket, earrings, school uniform, black footwear, bowtie, sitting, jacket, open clothes, red bowtie, collared shirt, red bow, breasts, open robe, long sleeves, magic, single braid, black gloves, choker, red halo, open jacket, kneehighs, loafers, gloves, hair between eyes, large breasts, jewelry, fingerless gloves, thighs, yellow eyes, hat bow, mountain, :d, blush, black robe, water, lake, loose bowtie, cloudy sky, yellow halo, very long hair, braided ponytail, shirt tucked in, legs, red eyes, mountainous horizon

    • 検出(他の2モデルでは未検出だったもの)

      • 背景:mountain, mountainous horizon

    • 未検出

      • 衣装:striped bow (13%)

      • 背景:tree (30%)

    テスト2:PixAI Tagger v1.0

    閾値:一般 0.17、キャラクター 0.27、その他はそれぞれ推奨値

    highres, blue archive, witch hat, ai-generated, 1girl, hat, skirt, broom, halo, white hair, solo, absurdres, broom riding, breasts, socks, long hair, shirt, witch, white shirt, crossed legs, smile, black skirt, open mouth, magic, bow, pleated skirt, large breasts, jacket, thighs, outdoors, looking at viewer, sky, long sleeves, sitting, red bow, black socks, bowtie, braid, school uniform, tilted halo, yellow halo, hair between eyes, orange eyes, earrings, multicolored hair, jewelry, kneehighs, cloud, black jacket, shoes, striped bow, blue sky, very long hair, black shoes, blush, black hat, day, :d, eri (blue archive)

    • 未検出

      • 衣装:fingerless gloves (10%)

      • ポーズ・構図:sidesaddle (17%)

      • 背景:tree (3%), mountain (3%)

    感想

    2つの画像でテストしただけですが、PixAI Tagger v0.9では(設計どおり)多くのタグを検出する一方で誤検出も多かったのが、v1.0では誤検出が無くなりました。検出力はWD EVA02-Large Tagger v3よりは確実に高く、PixAI Tagger v0.9とは同等かそれ以上だと感じました(見るところが違う感じ)。

    ただ処理時間については、WD EVA02-Large Tagger v3とPixAI Tagger v0.9がいずれもCPU処理 (AMD Ryzen 7 9800X3D) で1秒未満だったのに対して、PixAI Tagger v1.0は9秒以上かかりました。GPU (CUDA) で処理できれば大幅短縮できるかもしれませんので、できた場合は本記事を更新するようにします。

    おまけ:styleタグの検出

    タグカテゴリの「style」は所謂「絵師タグ」のことですが、過度な期待はしないほうがよいです。

    下の画像のように、私が見てもすぐ分かるような画風であれば検出されますが、ほとんどの場合は検出されません。うまく検出できた場合でも、クリエイターの迷惑になるような使い方はしないようにしましょう。

    画像

    まとめ

    2026年9月下旬にリリースされた最新Taggerモデル「PixAI Tagger v1.0」について解説しました。

    WD EVA02-Large Tagger v3を使っている人が多いと思いますが、リリースから2年以上が過ぎ、さすがに古さを感じるようになっています。PixAI Taggerの使用を検討してみてはどうでしょうか?

    このような感じで、技術的な内容を分かりやすく基本無料で解説しています。「スキ」「フォロー」「チップ」で応援よろしくお願いします。質問がありましたら遠慮なく「質問箱」へどうぞ。


    本記事の文章・画像等の無断転載・複製・改変・盗用を禁じます。
    発見した場合は黙認せず対応します。これらの行為を発見された方は、相手ではなく私までお知らせください。

    あなたへのおすすめ