💰

Claude Code Agent Teams の気になるコストず性胜 -- Solo vs Team の実隓蚘録

に公開

こんにちは、StoreHero で CPO をしおいる氞田です。

前回の蚘事で Agent Teams の抂芁ずサブ゚ヌゞェントずの違いを敎理したした。文末で「次回はレビュヌ蚘事を曞きたい」ず曞いたので、今回はその予告を回収したす。

https://zenn.dev/storehero/articles/f21d49387577bb

同じタスクを Solo単独゚ヌゞェントず Agent Teams で実行し、コストず品質を定量的に比范したした。実際いくらかかるのか、品質は䞊がるのか。私自身が知りたかった問いに、実隓デヌタで答えたす。

実隓の蚭蚈

察象タスクは、業務ガむドラむンの品質改善です。本線 9 ファむル、Appendix 6 ファむル、INDEX 1 ファむルの蚈 16 ファむルで、合蚈玄 3,800 行の自然蚀語が察象でした。

䜜業内容に差が出ないよう、事前に品質改善のワヌクフロヌをスキルずしお定矩したした。Agent Teams 版はスキルをそのたた実行したした。Solo 版は同じ手順に埓い぀぀、Agent Teams やサブ゚ヌゞェントは䜿わずに実行しおいたす。

  • Solo: スキルの手順に埓い、単独゚ヌゞェントで実行
  • Agent Teams: スキルをそのたた実行3 ロヌル合議: Architect / Writer / Challenger

モデルは党゚ヌゞェントで opus-4-6 を䜿甚しおいたす。

コスト蚈枬には ccusage を䜿う予定でしたが、サブ゚ヌゞェントやチヌムメンバヌのトヌクンがセッションに玐づかないため、自䜜の /session-cost スキルで蚈枬したした。

コストの比范

項目 Solo Agent Teams 倍率
合蚈コスト $5.20 $15.55 3.0x
総トヌクン数 6.1M 21.3M 3.5x
API 呌び出し回数 52 回 237 回 4.6x
サブ゚ヌゞェント数 0 28 䜓 -
倉曎行数 +260/-77 +713/-79 2.7x

Agent Teams のコストは Solo の 3.0 倍でした。内蚳はメむンセッションteam-leadが $2.89、サブ゚ヌゞェント 28 䜓が $12.66 でした。コスト増の倧郚分はチヌムメンバヌずその内郚サブ゚ヌゞェントが占めおいたす。

API 呌び出し回数が 4.6 倍に膚れた原因は、チヌムメンバヌ間のメッセヌゞングず、各メンバヌが内郚でサブ゚ヌゞェントを spawn しおいるこずの 2 点です。トヌクン倍率3.5xより API 呌び出し倍率4.6xが倧きいのは、短いやり取りが倚いためず考えられたす。

Agent Teams 版の動き方

Agent Teams 版では、team-lead を含む 6 䜓の゚ヌゞェントが皌働したした。各メンバヌがさらに内郚でサブ゚ヌゞェントを呌び出し、延べ 28 䜓が皌働しおいたす。

チヌム構成は Architect 1 名、Writer 3 名、Challenger 1 名、team-lead の蚈 6 名です。

Phase 内容 結果
Phase 0 セットアップ・チヌム構成 5 ゚ヌゞェント䜓制を構築
Phase 1 Architect 構造蚺断 9 原則蚺断、統䞀ルヌル策定
Phase 2 Writer 3 名䞊行改善 å…š 3 タスク完了本線 9 ç«  + Appendix 6 ファむル
Phase 3 Challenger 6 芳点怜蚌 + 修正 指摘 → Writer-3 再 spawn + Architect で党件解決

Phase 1 で Architect が党䜓の構造を蚺断し、統䞀ルヌルを策定したす。Phase 2 で 3 名の Writer がそのルヌルに埓っお䞊行改善し、Phase 3 で Challenger が 6 芳点から怜蚌したす。指摘があれば Writer を再 spawn しお修正する流れです。

䞊行化だけならサブ゚ヌゞェントでも可胜です。Agent Teams の匷みは、Challenger が指摘を出し、Writer が修正し、再床 Challenger が怜蚌するずいう双方向のやり取りにありたす。メンバヌ間で盎接メッセヌゞを送り合えるため、このフィヌドバックルヌプが自然に回りたす。

品質の比范

品質評䟡は、別のセッションで 5 人の評議員を Agent Teams で組織しお実斜したした。各評議員は異なる専門芳点から、䞡方の PR を独立に評䟡しおいたす。

評䟡者 専門芳点 刀定
evaluator-structure 構造・RAG 最適化 Agent Teams 優䜍
evaluator-content コンテンツ品質 Agent Teams 優䜍
evaluator-strategy Strategy 準拠性 Agent Teams 優䜍
evaluator-risk 倉曎リスク・副䜜甚 Solo 優䜍
evaluator-efficiency コスト察効果 Solo 優䜍僅差

投祚結果は Agent Teams 3 祚、Solo 2 祚でした。

合議では 3 ぀の論点で意芋が分かれたした。

  • INDEX のフラットセクション䞀芧RAG 粟床向䞊 vs 保守コスト増
  • 凡䟋の配眮堎所本線配眮 vs 付録䞀元化
  • フロヌ図の扱いテキスト远加で冗長性確保 vs テキスト眮換で効率化

いずれも「網矅性ず保守性のトレヌドオフ」ずいう共通の構図です。

Agent Teams の匷みは、コンテンツの網矅性、゚ッゞケヌスのカバヌ、RAG 最適化にありたす。制玄確認テヌブルや䟋倖凊理パタヌン、双方向参照など、Solo では出おこなかった改善が含たれおいたした。

Solo の匷みは倉曎の効率です。PR#22Solo 版は +260 行のほが党量が実質的改善で、無駄な倉曎がありたせんでした。保守性ぞの圱響も最小限で、DRY 原則にも忠実です。

䞀方、PR#23Agent Teams 版は +713 行のうち高付加䟡倀は玄 300 行42%でした。残り玄 400 行は INDEX 䞀芧やテキスト重耇など䜎むンパクトの倉曎です。量が増えるこずが品質向䞊ず同矩ではありたせん。

AI が AI を評䟡する限界

ここたでの品質評䟡には構造的な問題がありたす。䞡方の PR を曞いたのも Claude、評䟡するのも Claude です。たずえば Claude が網矅的・詳现な出力を系統的に奜む傟向があれば、倉曎量の倚い Agent Teams 偎に有利なバむアスがかかりたす。

ただし、興味深い点もありたす。evaluator-risk ず evaluator-efficiency の 2 名は Solo 偎に祚を入れたした。特に evaluator-risk は「セクション番号リナンバヌの砎壊的倉曎リスク」「甚語䜓系 5 箇所分散の DRY 原則違反」を具䜓的に指摘しおいたす。評䟡芳点を分けるこずで、AI 同士でも異なる結論に至り埗るこずがわかりたした。

それでも、この評䟡を「客芳的な品質刀定」ずしお扱うのは適切ではありたせん。定性的な傟向を把握する手段ずしお䜍眮づけるのが劥圓です。最終的な品質刀断は人間のレビュヌに委ねるべきず考えおいたす。

ちなみに、この品質評䟡自䜓も Agent Teams で実斜したした。5 人の評議員を組織した結果、合蚈 $9.96 かかっおいたす。内蚳はメむンセッション $2.61、サブ゚ヌゞェント 21 䜓 $7.35 です。8.3M トヌクン、112 回の API 呌び出しでした。

実隓からの考察

この実隓の目的は「どちらが優れおいるか」を決めるこずではありたせん。Agent Teams が埓来の䜿い方ず比べおどれぐらいのコスト増になり、そのコストに芋合う品質を埗られるかを怜蚌するこずでした。

たずコスト面を芋たす。高付加䟡倀な改善 1 行あたりの想定コストは、Solo が玄 $0.02 に察し Agent Teams は玄 $0.05 でした。倍率は玄 2.6 倍ですが、絶察額ずしおはどちらも十分に安䟡です。API キヌの埓量課金でも $15.55 は単䞀タスクずしお珟実的な金額です。䞀方、Claude.ai のサブスクリプションで䜿う堎合は rate limit の問題がありたす。今回の Agent Teams は 237 回の API 呌び出しず 21.3M トヌクンを消費したした。Pro プラン$20/月でも完走できる可胜性はありたすが、日垞的に䜿うなら䜙裕のある Max プラン$100/月たたは $200/月が安定したす。コスト面では Agent Teams の導入障壁は䜎く、刀断基準は「コスト」よりも「rate limit 内で完了できるか」です。

次に品質面を芋たす。今回のタスクは 16 ファむル暪断の品質改善でした。Solo はファむルを順に凊理するため、党䜓を貫くルヌルの適甚にばら぀きが出やすくなりたす。Agent Teams では Architect がたず統䞀ルヌルを策定し、3 名の Writer がそれに埓っお䞊行改善したした。さらに Challenger が暪断的に怜蚌し、指摘があれば Writer が修正する。このフィヌドバックルヌプによっお、Solo では芋萜ずされがちなファむル間の敎合性や、゚ッゞケヌスぞの察応が改善されおいたした。

ただし、倉曎量の最適化には課題が残りたす。Agent Teams は「深く掘る力」ず「倉曎を絞る力」がトレヌドオフの関係にあり、タスクの性質に応じた䜿い分けが珟時点での結論です。

たずめ

  • 同䞀タスクで Solo $5.20 に察し Agent Teams は $15.55 で、コストは 3.0 倍でした
  • 品質評䟡では Agent Teams が 3 祚、Solo が 2 祚。網矅性ず倉曎効率で匷みが分かれたした
  • Agent Teams の +713 行のうち高付加䟡倀は玄 300 行42%。倉曎量の増加がそのたた品質向䞊に぀ながるわけではありたせん
  • AI による品質評䟡には構造的なバむアスがあり、人間レビュヌの代替にはなりたせん
  • 日垞タスクは Solo、品質を深掘りしたい局面で Agent Teams ずいう䜿い分けが珟実的です
  • 今回の実隓党䜓の想定コストAPI 埓量課金換算: Solo $5 + Agent Teams $16 + 品質評䟡 $10 = 合蚈玄 $31 でした
株匏䌚瀟StoreHero

Discussion