メインコンテンツへスキップ
見出し画像

Fable 5かOpus 5か。答えは「どっちが賢いか」ではありませんでした

    「Fable 5とOpus 5、うちはどっちを使えばいいですか」。この夏、いちばん多く受けた質問です。私も比較記事を読み漁りました。でも、何本読んでも決まらない。あとになって理由が分かりました。問いの立て方が違ったんです。決め手は「どっちが賢いか」ではなく、「その席に、どんな仕事を座らせるか」でした。今日はその話をします。

    画像

    なお、この記事に登場するS社長は、複数の支援先の事例を、1社のモデルケースとして再構成しています。出てくる金額や時間も一例として読んでください。

    なぜ、点数比較では決められないのか

    2026年7月24日、AnthropicがClaude Opus 5を発表しました。これで、同じ会社の中に上位モデルが二つ並ぶ形になりました。上に Claude Fable 5、その下に Claude Opus 5 です。

    値段は、きれいに2倍差がついています。

    Claude Opus 5 ── 入力 $5 / 出力 $25(100万トークンあたり)

    Claude Fable 5 ── 入力 $10 / 出力 $50(100万トークンあたり)

    「じゃあ倍の性能差があるんだな」と思いますよね。私も最初はそう考えました。ところが報道された数字を並べると、話がややこしくなります。CursorBench 3.2 では、Opus 5 は最高effortで Fable 5 のピークスコアとの差が0.5ポイント以内。OSWorld 2.0 では、Fable 5 の最高スコアを3分の1のコストで達成したと報じられています。ソフトウェア開発の Frontier-Bench v0.1 では前世代 Opus 4.8 の2倍、ARC-AGI 3 では既存モデルの3倍。

    しかも、入る文章の量ではもう差がつきません。どちらもコンテキストは100万トークン、最大出力は128,000トークン。「長い資料をまるごと読ませられるか」という比べ方は、この二つのあいだでは意味を持たなくなりました。

    机の上に、同じ仕事に対する見積書が二枚並んでいると思ってください。書いてある中身はほとんど同じで、金額だけが倍違う。経営者がいま突きつけられているのは、そういう選択です。

    画像

    点数が接近して、値段だけ2倍。この状況で「高いほうが安心」と決めるのは、2026年7月の時点では必ずしも合理的な判断になりません。かといって「点数がほぼ同じなら安いほうでいい」とも言い切れない。Anthropic自身が、両者の差を「単純な能力の差というより、複雑な計画立案能力が異なる」と説明しているからです。

    そもそも公開されている点数は、モデル同士を比べるための物差しです。自社の仕事で役に立つかどうかを測るために作られた物差しではありません。だから何本読んでも決まらない。決まらないのが当たり前でした。

    私はこの一文で、探す方向が変わりました。総合力を比べるのをやめて、「複雑な計画立案が要る仕事は、うちのどこにあるのか」を先に探しにいったんです。

    そうすると、順番が逆だったことに気づきます。モデルを先に選んで仕事を割り当てるのではなく、席を先に決めて、そこに座らせる相手をあとから選ぶ。この順番に変えた途端、比較記事を読む必要がほとんどなくなりました。

    「うちは一番いいモデルしか使わない」と言っていたS社長の話

    S社長は、社員22名の測量設計事務所を経営しています。図面、報告書、役所への提出書類。紙とやりとりの量が多く、社長自身が最後の確認をしている業務がいくつも残っていました。

    最初にお会いしたとき、S社長ははっきりこう言いました。

    「うちは一番いいモデルしか使いません。どうせ払うなら、いちばん良いものにお金を払いたい」

    気持ちは分かります。私も同じことを言っていた時期があります。安いほうを選んで品質が落ちたら、結局は自分で直すことになる。それなら最初から上位を使うほうが安上がりだ、という発想です。

    そこで全業務を上位モデルに寄せました。議事録の要約も、報告書のたたき台も、メールの文面も、社内マニュアルの整形も、全部です。

    最初の1か月は快調でした。出てくる文章の質が高い。これまで社長が夜に手直ししていた報告書の下書きが、朝には形になっている。若い社員が書いた文章も、体裁が揃って返ってくる。事務所の空気が変わったのが、外から来た私にも分かるくらいでした。社員も「これは楽になる」と喜んでいました。

    雲行きが変わったのは、月末の請求額を見たときです。金額そのものより、S社長が引っかかったのは内訳でした。

    「一番かかってるの、マニュアルの整形なんですね」

    そうなんです。判断がいちばん軽い仕事が、費用をいちばん食っていました。理由は単純で、量が多いから。文字数の多い仕事を何十回も回せば、その分だけ積み上がります。判断の重さと費用は連動しません。連動するのは「出す文字の量 × 回数」です。

    逆に、いちばん判断の重い「この案件を取りにいくかどうか」は、月に数回しか発生しません。だから内訳の下のほうに沈んでいて、目にも留まらない。会社にとっていちばん大事な仕事が、費用の一覧では最下位にいる。この時点でもう、費用の大小と仕事の重さがまったく別物だということが、数字に出ていました。

    S社長はすぐに手を打ちました。今度は逆方向です。

    「じゃあ全部、安いモデルにしましょう」

    これで費用は下がりました。目に見えて下がりました。たたき台が返ってくるスピードも、むしろ速くなった。ここまでは狙いどおりです。

    S社長は満足そうでしたし、私もこの時点では止めていません。一度うまくいかない形を通っておかないと、なぜ役割を分けるのかが腹に落ちないからです。理屈で先回りして説明しても、たいていは元のやり方に戻ってしまいます。

    問題は2か月目に出ました。S社長が、以前より遅くまで事務所に残るようになったんです。

    何をしていたのか。段取りの穴を拾っていました。

    たとえば、ある案件の見積り作成を任せる。返ってくる見積書はきれいです。数字も合っている。ところが、その案件には現地立ち会いが2回必要で、そのうち1回は元請けの都合で日程が読めない。この「読めない部分をどう見積もるか」が、まるごと抜けている。指摘されないまま、整った書類として出てくる。

    別の日には、提出書類の副本の部数が抜けていました。役所ごとに違うので、決まった正解がありません。正解がないものは、指摘もされない。整った書類として上がってきて、印刷まで済ませたあとにS社長が気づいて、刷り直す。

    S社長はそれを毎回、自分で見つけて、自分で埋めていました。

    「作業は速くなったんですけどね。私の仕事、増えてませんか、これ」

    もう少し正確に言うと、増えたのは仕事の量ではなく、社長が最終工程に立つ回数でした。速く上がってくるぶんだけ、確認の回数も増える。S社長自身がそれを言葉にしたのは、この面談の終わりごろです。

    「これ、私が全部の最後に入っちゃってるんですよね」

    ここが分かれ目でした。

    S社長は最初、「安いモデルに落としたのが失敗だった」と考えました。だから上位に戻そうとした。私が止めたのは、そこです。

    戻したら、また月末の請求額に驚きます。そして「高いと払えない、安いと自分が働く」の往復に入る。この往復に入っている経営者を、私はずいぶん見てきました。

    問題は、モデルの高い安いではありませんでした。全部を同じモデルに任せていたことが問題だったんです。

    上位に全部やらせた1か月目も、安いモデルに全部やらせた2か月目も、構造は同じです。仕事の中身がまるで違うのに、同じ相手に、同じ扱いで渡していた。

    考えてみれば、会社ではそんなことはしません。マニュアルの体裁を整える作業と、来期の設備投資を決める判断を、同じ人に同じ時間単価で頼む会社はない。前者はできる人にどんどん回すし、後者は社長が自分で悩む。当たり前のことです。

    その当たり前を、AIの使い方には持ち込んでいなかった。

    「じゃあ、うちのAIにも役職を作ればいいんですか」

    S社長がそう言ったとき、話がようやく前に進みました。役職というより、席です。誰が座るかを決める前に、その席が何をする席なのかを決める。私たちは、席の設計から始め直しました。

    司令塔という席には、どんな職務が座るのか

    最初に作ったのが、司令塔の席です。

    この席の職務は、三つだけにしました。決める、分解する、検収する。

    決めるは、方針を選ぶ仕事です。この案件は取りにいくのか見送るのか。書類を先に作るのか、先方に確認を入れるのが先か。選択肢を並べる仕事ではなく、並んだ選択肢から一つを選ぶ仕事です。

    分解するは、決めたことを実行できる形に割る仕事です。「見積書を作る」で終わらせず、「現地条件の確認 → 数量の拾い出し → 単価の当てはめ → 不確定要素の扱い方針 → 書式への流し込み」まで刻む。刻んだうえで、どれを誰に渡すかまで決める。

    検収するは、上がってきたものを、抜けの有無で見る仕事です。整っているかではなく、足りているか。ここでS社長が毎晩やっていた「段取りの穴拾い」が、初めて誰かの職務になりました。

    画像

    この三つを並べたとき、S社長が言いました。「これ、演奏してないですね」

    そのとおりです。司令塔は、自分では音を出しません。楽器を持たない指揮者と同じです。

    オーケストラの指揮者は、バイオリンも弾かないし、トランペットも吹かない。それでも、あの席がいちばん重い。テンポを決め、どのパートをいつ立たせるかを決め、音が揃っていなければ止める。ステージの上で唯一、音を出さない人が、全体の出来を決めています。

    司令塔の席も同じです。報告書を書くのは司令塔ではありません。議事録を要約するのも、メールの下書きを作るのも違う。司令塔がやるのは、この案件では何を先に決めるべきかを出し、仕事を割り、上がってきたものの穴を指摘すること。

    だから司令塔が出す文字数は、実際に手を動かす側よりずっと少なくなります。この「口数の少なさ」が、あとで単価の話にそのまま効いてきます。

    司令塔を選ぶ3つの基準と、ピラミッド型の単価設計

    ここからは、S社長と一緒に作った手順をそのまま書きます。

    席の設計は、いまの支出の内訳を見るところから始まります。どの仕事に量が集中しているかが分からないと、どこに高い相手を当てるべきかも決まりません。S社長には、最初の面談の宿題としてこれを渡しました。請求明細が手元になくても、「何を月に何回頼んでいるか」の体感で構いません。

    あなたは中小企業のコスト設計に強い経営参謀です。
    以下は、私の会社でいまAIに頼んでいる仕事の種類と、月あたりのおおよその回数です。
    
    【ここに「仕事の種類:月◯回」を思い出せる範囲で箇条書きで貼る】
    
    次の手順で整理してください。
    1. 各仕事を「量が多い仕事」と「量は少ないが判断が重い仕事」に仕分ける
    2. 仕分けの理由を、1行ずつ添える
    3. 高い上位モデルを当てるべき仕事はどれか、安いモデルで足りる仕事はどれかを、理由つきで示す
    4. 最後に「この配分でいくと、費用のかかり方はどこに寄るか」を3行でまとめる
    
    出力は箇条書きのみ。専門用語は使わず、社員に見せられる言葉で書いてください。

    この試算をやると、たいていの会社で同じ結果が出ます。量が多いのは、判断の軽い仕事です。そして、判断の重い仕事は回数が少ない。この非対称が、あとで効いてきます。

    内訳が見えたら、司令塔の席に座る相手を選びます。基準は三つです。

    基準① 計画立案の質 ── 段取りと、先回りの問い

    Anthropicが Fable 5 と Opus 5 の差を「単純な能力の差というより、複雑な計画立案能力が異なる」と説明していると書きました。この一文は、選び方をそのまま教えてくれています。司令塔の席で見るべきは、答えの正しさではなく、段取りの立て方です。

    見分け方は簡単で、こちらが渡していない論点を、向こうから出してくるかどうかを見ます。

    「見積りを作って」と言ったときに、そのまま作り始めるのか。それとも「この案件、現地確認は何回想定ですか」「相手側の日程が読めない部分はありますか」と聞き返してくるのか。後者が、司令塔の席に必要な動きです。

    これを自社の懸案で試すための依頼文がこれです。手元の「気になっていることリスト」を、そのまま貼って使えます。

    あなたは経営者の相談相手です。以下は、私がいま抱えている懸案のリストです。
    
    【ここに気になっていること・迷っていることを、思いつくまま箇条書きで貼る】
    
    これを2つに仕分けてください。
    A. 計画を立てる力や、あちらを立てればこちらが立たない判断が要る問い
    B. 調べれば答えが出る問い、手順が決まっている問い
    
    そのうえで、Aの問いだけを次の形に整えてください。
    ・問い(1文)
    ・答えを出すために必要な前提情報
    ・私が決めなければならないこと
    
    Bは一覧にまとめるだけで結構です。仕分けの理由も1行ずつ添えてください。

    Bに仕分けられた問いは、司令塔に持っていく必要がありません。調べれば済むからです。Aだけが残る。S社長の場合、20個ほど貼って、Aに残ったのは4個でした。この4個が、司令塔の席の仕事量です。少ないでしょう。少なくていいんです。

    基準② 判断の一貫性

    二つ目は、同じことを聞いたときに同じ答えが返るか、です。

    司令塔は決める席なので、ここがぶれると下流が全部やり直しになります。月曜に「A案でいく」と言い、水曜に同じ材料から「B案がいい」と言う相手を、決める席には座らせられません。

    見るのは正解率ではなく、判断の理由が同じかどうかです。結論が変わってもいい。ただし「前提が変わったから結論を変えた」と言えるかどうか。言えないなら、それはただの揺れです。

    点数には出ない部分なので、自社の仕事に合わせた観察表を作ってしまうのが早いです。

    あなたはAI導入の評価設計を手伝う専門家です。私の会社の業務は次のとおりです。
    
    【ここに自社の業種と、AIに任せたい業務を3〜5行で書く】
    
    新しいAIモデルを自社の仕事で見極めたいのですが、公開されている点数(ベンチマーク)以外に、
    実際のやりとりの中で観察すべき観点を10個挙げてください。
    
    次の3つの角度を必ず含めてください。
    ・返してくる問いの質(こちらが気づいていない論点を出せるか)
    ・前提の確認(曖昧な指示に確認を返すか、勝手に進めるか)
    ・抜け漏れの指摘(段取りの穴を先に言えるか)
    
    各観点は「観察する場面」「良い状態」「悪い状態」の3点セットで、
    そのまま印刷してチェック表に使える形で出してください。

    S社長の事務所では、この10観点を印刷して、2週間、新しいモデルを試すたびに手書きで丸をつけていました。ベンチマークのスコアは1点も見ていません。それで十分に決まりました。

    一貫性を試すには、実際に決めごとを渡してみるのがいちばんです。来週の会議のアジェンダを、そのまま材料にします。

    あなたは経営会議の事務局です。以下は来週の会議アジェンダです。
    
    【ここに会議の議題を箇条書きで貼る】
    
    各議題を、会議の前にAIへ相談するための「諮問事項」に変換してください。
    1つの議題につき、次の3点セットで出力します。
    
    ・背景(1行。前提を知らない相手にも通じる書き方で)
    ・決めたいこと(1文。「AかBか」の形が望ましい)
    ・欲しい判断材料(3つまで。数字・比較・リスクのどれかを必ず含める)
    
    議題の文言をそのまま流用せず、私が何を決めたいのかが一読で分かる文にしてください。

    これをやると、会議そのものが変わります。議題が「◯◯の件」ではなく「AかBか」の形で並ぶからです。S社長のところでは、会議の時間が短くなったと聞きました。

    基準③ 会社全体の単価設計

    三つ目が、いちばん誤解されるところです。

    司令塔に高いモデルを座らせたら、会社全体のAI費用も2倍になる。多くの経営者がそう思っています。実際は、そうなりません。

    私の会社では、いま最上位の Fable 5 を司令塔の席に置いています。設計・分解・判断・検収の専任で、成果物そのものは書かせません。本体の作業は Opus 5、軽めの実装や調査は Sonnet 5、整形や検索は Haiku 4.5 に降ろします。単価はこう並びます。

    Claude Fable 5 ── 入力 $10 / 出力 $50(100万トークンあたり)

    Claude Opus 5 ── 入力 $5 / 出力 $25

    Claude Sonnet 5 ── 入力 $3 / 出力 $15

    Claude Haiku 4.5 ── 入力 $1 / 出力 $5

    画像

    上にいくほど単価が高く、下にいくほど安い。ピラミッドの頂点が最高単価です。それでも全体がふくらまないのは、頂点の面積がいちばん小さいからです。

    そして、この面積の差はそのまま口数の差になります。上の席はひとことで済ませ、下の層が長い文章を書く。

    画像

    AIの費用は、やりとりした文字の量で決まります。そして司令塔は、自分で成果物を書きません。返してくるのは、方針の一文と、分解した手順と、穴の指摘だけ。長い報告書を書くのは、その下で手を動かす側です。

    いちばん単価の高い席が、いちばん文字を出さない。ここが設計の勘所です。単価の高さは、口数の少なさで相殺されます。

    S社長のところでも同じ形にしました。司令塔だけ上に上げ、報告書の本文づくりはその下、マニュアル整形と検索はいちばん下。1か月目に費用をいちばん食っていたマニュアル整形は、判断が要らない仕事なので、迷わず最下層に置けます。

    この割り当ては、一度決めたら固定してしまってください。案件ごとに「今回はどの層に投げようか」と毎回悩みはじめると、その悩む時間そのものが社長の仕事になります。決めるのは最初の一回だけ。あとは仕事の種類を見て、機械的にどの層かが決まる。そこまで作って、ようやく設計が済んだと言えます。

    ひとつ、正直に添えておきます。最上位の席を、どの会社でも作れるわけではありません。Fable 5 には30日間のデータ保持が必須という条件があり、データを一切残さない運用を求められている会社では、リクエストがそのままエラーになります。生物学やサイバーセキュリティに近い領域では、安全上の判定でリクエストが拒否されることもあります。これは性能の話ではなく、制約の話です。自社の情報の扱い方によっては、司令塔の席は最上位ではなく、その一段下が現実解になります。それでも設計そのものは何も変わりません。席が先で、座る相手はあとです。

    最後に、その席へ実際に投げる定型文を置いておきます。決めかねている案件があるときに、そのまま使ってください。

    あなたは私の参謀です。私はいま、次の案件を決めかねています。
    
    【ここに案件の状況を話す。音声入力でかまいません。まとまっていなくて結構です】
    
    まず、私の話から前提を箇条書きで復元し、抜けている情報があれば先に質問してください。
    質問が済んだら、次の3点セットを作ってください。
    
    1. 選択肢の比較(3案まで。それぞれ「取れるもの」と「捨てるもの」を明記)
    2. リスク(起きる確率と、起きたときの影響を分けて書く)
    3. 推奨案と、その理由(私が反対しそうな点への反論も添える)
    
    結論から先に書いてください。長い前置きは要りません。

    S社長はこれを、移動中に音声入力で投げています。事務所に戻るころには、比較とリスクと推奨案が並んでいる。あとは読んで、選ぶだけです。

    席を決めたあと、S社長の一日はこう変わりました

    半年たって、S社長の一日は形が変わりました。

    前は、朝いちばんに自分でAIへ指示を出すところから始まっていました。「あれ作って」「これ直して」を何十回。夕方になると、上がってきたものを一つずつ見て、抜けを埋める。帰りが遅くなるのは、この最後の工程のせいでした。

    いまは、朝に司令塔へ渡すのは一つだけです。「今日の案件はこれ。どういう順番でいくべきか」。返ってくるのは作業の指示ではなく、段取りと、こちらへの質問です。「相手からの回答待ちが2件あります。これが返る前に進められるのはどこまでですか」。

    答えるのは、S社長。決めるのは人間の側だからです。

    そこから先は、下の層が動きます。S社長は途中経過を見ません。上がってきたものは、まず司令塔が受けて、穴を指摘してから社長のところに来ます。夕方に社長が見るのは、一度ふるいにかけられたあとのものです。

    社員側にも変化がありました。以前は「社長に見せる前の確認」を各自が気にしていて、そこで手が止まっていたそうです。いまは、穴を指摘する役が別にいるので、そこを通してから出せばいい。差し戻される怖さが減ったぶん、若い社員が先に手を挙げるようになったと聞きました。

    請求額の見方も変わりました。前は、月末に総額を見て「高い」「安い」と言っていました。いまは、内訳を席ごとに見ます。

    上の席の費用が伸びていたら、判断のいる案件が増えた月です。悪い増え方ではありません。下の席の費用が伸びていたら、量が増えた月。こちらは、そもそも人がやらなくていい作業が増えただけなので、むしろ喜んでいい。

    「総額が上がった」ではなく「どの席で上がったか」を見る。同じ請求書が、まったく別の意味に読めるようになります。

    数字でいうと、S社長のところは全体の費用が2割ほど下がりました。ただ、この数字は会社ごとの業務量でいくらでも変わるので、一例として読んでください。S社長本人が価値を感じているのは、そこではないそうです。

    「夜に、自分が拾いものをしなくてよくなったのが大きいです」

    段取りの穴を拾うのは、社長の仕事ではありませんでした。その仕事に席を用意していなかったから、空いた席の分を社長が埋めていた。それだけの話だったんです。

    画像

    モデル名で悩む前に、席を設計してください

    新しいモデルは、これからも出ます。半年後には、いまの構図もどこか変わっているはずです。

    そのたびに、会社で使っているものを全部入れ替えるかどうか検討するのは、正直しんどい話です。

    でも、席が設計してあると、この検討が驚くほど軽くなります。考えるのは「この席に座らせる相手を変えるか」だけになるからです。会社全体をひっくり返す話にはならない。指揮台に立つ人を替えるかどうかであって、オーケストラを解散するわけではありません。

    私自身、一度この司令塔の席を Opus 5 に入れ替えて、数日で元に戻したことがあります。理由は賢さの差ではなく、席に求めていた仕事の輪郭が、こちらの側でぼやけてしまったからでした。

    だから、経営者の方に申し上げたいのは一つです。

    モデル名で悩む前に、席を設計してください。

    自社の仕事のうち、決める・分解する・検収するに当たるものはどれか。それは月に何回発生するのか。誰がいま、その仕事を「ついで」でやってしまっているのか。

    たいていの会社では、その「ついで」の担い手が社長です。段取りを組むのも社長、抜けに気づくのも社長、最後に決めるのも社長。だから社長の時間が消える。

    席を作るというのは、その仕事に名前をつけることです。名前がついた瞬間に、初めて「誰に座ってもらうか」という問いが立ちます。逆に言えば、席がないうちは、どんなに賢いモデルを契約しても、社長の夜は短くなりません。

    そして席さえ決まっていれば、次に何が出てきても慌てずに済みます。見るのは総合点ではなく、この席の三つの職務をこなせるかどうかだけ。判断の材料が減るので、決めるのも速くなります。

    画像

    おわりに ── 指揮台は、空けておいてはいけない

    「Fable 5かOpus 5か」という問いに、私はいまこう答えています。

    「どちらが賢いかは、御社にとって二番目の問題です。まず、指揮台に誰も立っていない状態をやめましょう」

    点数の比較記事は、これからも増えます。読むのは楽しいですし、私も読みます。ただ、あれは楽器の性能表です。誰にどのパートを任せ、どのテンポで進めるかまでは、性能表には書いてありません。

    そこを決めるのは、経営者の仕事です。そして、その決め方を形にしたものが、席の設計です。

    もし今日、一つだけ手を動かすなら。いま自分がAIに頼んでいる仕事を紙に書き出して、「量が多い仕事」と「判断が重い仕事」に線を引いてみてください。線の上と下で、任せる相手を変える。それだけで、来月の請求書の読み方が変わります。

    指揮台は、空けておいてはいけません。座る相手を選ぶのは、そのあとです。

    あわせて読みたい

    あなたのClaude Code、まだ「ひとり」で働かせていませんか?

    https://note.com/comix_ceo162230/n/nfa96da3a048d

    Codexを使いこなす社長は、コードを1行も読まない

    https://note.com/comix_ceo162230/n/n8ef5eb2043ea

    あなたのAI、買ってきたままの設定で使っていませんか?

    https://note.com/comix_ceo162230/n/ne3a0ef43b77b


    鈴木章裕

    株式会社コミクス 代表取締役

     
     
    AI活用のご相談→ https://www.comix.co.jp/contact/ 株式会社コミクス代表取締役。生成AI活用支援実績304社(2026年9月末現在)。営業・資料作成の効率化、AIエージェント導入を支援。何から始めるか迷っている段階でもご相談ください。

    あなたへのおすすめ