
文章はうまい、でも数字は任せられない。Claude Opus 5 を4人のAIに盲検採点させた結果
こんにちは、れん学長です(2026年7月25日時点)。
Fable級の性能が半額になったと言われている Claude Opus 5 を、損せずに使うにはどうすればいいのか。今回はそこを検証しました。
単価だけ見ると、確かに半分なんですよ。でも実際に触ってみたら、そのまま鵜呑みにすると引っかかるところがいくつか出てきました。
そこで、同じニュース解説を Opus 5 と GPT-5.6 Sol の両方に書かせて、どちらがどのAIの作か伏せたまま、4人のAI審査員に採点させたんです。結果は、Opus 5 の4戦0勝4敗でした。

ただ、ここからが面白いところで。私が自分の目でパッと見た印象は、まったく逆だったんです。
新しいモデルが出るたびに「で、結局どっちを使えばいいの?」ってなりますよね。ベンチマークの点数表を眺めても、自分の仕事にどう効くのかは全然見えてこない。
私はこれまで、note の記事を Claude のいちばん上のモデルである Fable 5 に書かせていて、Opus 5 に乗り換えていいのか迷っていました。この記事はその答えを探した記録です。
読み終わる頃には、Opus 5 と Fable 5 と GPT-5.6 Sol を、自分の仕事のどこに割り振ればいいかの目安が持てるはずです。
同じ内容を動画でも解説しています。3Dの作り比べや盲検採点のレポート画面は、動いている画面で見た方が早いので、そちらもどうぞ。
まず、何が出たのか

2026年7月24日、Anthropic が Claude Opus 5 を公開しました。前の世代の Opus 4.8 が5月28日なので、2か月弱での更新です。
さっき触れた「半分の単価」が具体的にどういう数字なのか、そこから見ていきましょう。
料金は入力100万トークンあたり5ドル、出力100万トークンあたり25ドルで、Opus 4.8 から据え置かれています。
Fable 5 は入力10ドル、出力50ドルなので、単価はちょうど半分になります。
Claude の Max プランでは標準のモデルになり、Claude Pro プランでは選べる中で一番強いモデルになりました。
トークンというのは、AIが文章を数えるときの単位です。日本語ならだいたい1文字が1トークン前後だと思っておけば大丈夫です。
ちなみに、一度に扱える情報量の100万トークンも、賢さと料金を5段階で選べる「努力レベル」も、今回の新機能ではありません。どちらも前のモデルからあったものです。
実はこれ、Opus 5 自身が「今回追加された」と書き間違えたポイントなんですよ。後で詳しく書きますね。
ベンチマークは、何を測っているのか

ベンチマークというのは、AI同士を同じ条件で競わせる共通テストのことです。学力テストと同じで、問題の作り方によって測っているものがまるで違うので、名前だけ見ても中身は分かりません。
今回目立った4つを、何のテストなのかから見ていきましょう。
Frontier-Bench v0.1 は、計算生物学や物理シミュレーション、設計、証明といった難しい仕事を、コマンドを打ち込む画面の中だけで自力で進めさせる試験です。Opus 5 は43.3点で、Fable 5 の33.7点も Opus 4.8 の18.7点も上回りました。前の世代の2倍以上ですね。
ARC-AGI-3 は、説明書のない初見のゲームに放り込んで、目的もルールも自分で探り当てられるかを見る試験です。4か月前に公開されたときはどの最先端モデルも1点未満で、一方の人間は全部クリアしていました。そこに Opus 5 が30.2点で入ってきたので、今回いちばん落差が大きい数字です。
OSWorld 2.0 は、人間なら1時間半かかるパソコン作業を、マウスとキーボードごと任せる試験です。Opus 5 は70.6点で、Fable 5 の66.1点を上回りました。
AutomationBench は、営業や経理や人事の仕事を、47種類の業務アプリをまたいでやり切れるかを見る試験です。全条件を満たして初めて合格なので、首位の Opus 5 でも26.0点、つまり4件に1件しか完走できていません。無人で任せられる段階ではないですね。
で、全部で勝っているわけではありません。自律的にプログラムを書く DeepSWE v1.1 では、GPT-5.6 Sol の72.7点、Fable 5 の69.7点に対して Opus 5 は68.8点で、3番手でした。
3Dとデザインは、確かに強そう

数字より分かりやすいのが、実際に作らせた例です。
同じ指示で Opus 5 と Fable 5 に3D場面を作らせた比較投稿があります。投稿主によると、テントの質感や設定パネルの描き込みで Opus 5 の方が上だったそうです。
https://x.com/birdabo/status/2080340647622623315
私も自分の目で見てみたんですが、確かに質感がいいんですよね。デザインまわりは、もしかしたら Opus 5 の方が強いのかもしれません。
風洞、つまり物体に風を当てて空気の流れを見る実験装置を、そのまま動くものとして作らせたデモもあります。
https://www.youtube.com/watch?v=4WQd-8d5j4k
これがかなりリアルなんですよ。空気や水の流れを計算で再現する数値流体力学という分野があるんですが、たぶんその考え方を当てはめて作っているんじゃないかなと思います。あくまで私の推測ですけどね。
こういうものをサクッと作って動かして見られるようになっているのは、素直にすごいなと思いました。
公開前から使っていた Ethan Mollick さんは、良いモデルではあるけれど少しクセがある、短い作業では Fable 5 と同等かそれ以上だった、という趣旨の感想を書いています。
https://x.com/emollick/status/2080709278441033746
記事を書かせて、作者を伏せて採点させてみた

ここからが本題です。
Claude にパソコン作業をさせる道具、Claude Code に検証を組んでもらいました。Opus 5 と GPT-5.6 Sol に同じ指示を投げて解説記事を作らせ、ファイル名から作者が分からないようにしてから、4人のAI審査員に採点させています。
先に読ませた方を高く評価してしまう癖を打ち消すために、2人には Opus 5 の記事を先に、残り2人には GPT の記事を先に見せました。審査員には採点の前に公式資料を取りに行かせて、数字を照合させています。評価軸は6つで、合計30点満点です。
合計点は GPT-5.6 Sol が27.8点、Opus 5 が22.0点で、4人全員が GPT の勝ちと判定しました。
順番を入れ替えても勝敗は変わりませんでした。
Opus 5 が勝った軸は「非エンジニアへの理解しやすさ」だけで、4.8対4.0でした。
逆に「事実の正確性」は2.3対5.0と、大きく開きました。
Opus 5 が間違えたのは、こういうところです。
さっき触れた努力レベルの5段階を、今回の新機能のように書いていました。
AutomationBench の難易度を「最先端モデルでも10パーセント未満」と書いていましたが、それは3か月前の水準です。
OSWorld 2.0 の点数を「公表されていない」と書いていました。公式発表のページだけ見て、詳しい資料まで取りに行かなかったんじゃないかなと思います。
そして、測定条件の違う数字を同じ表に並べていました。
正直に言うと、私が自分の目で読んだときの印象は「Opus 5 の方が圧倒的に読みやすい」でした。都合の悪い部分もちゃんと書いてあってコンテンツにしやすそうだし、Opus 4.8 と比べて文章の質がはっきり上がっています。正確性を抜きにすれば、そのまま note に載せられるくらいの完成度です。
でも、その読みやすい文章の中に、間違いが混ざっていた。しかも「確認済み」と書き添えられていた。ここが怖いところなんですよ。
仕事で使ったら、直してくれた。ちょっとやりすぎたけど

もう一つ、実務での話をさせてください。
私はリアルタイムで動かしているシステムがあるんですが、それが昨日止まっていたんです。しかも私は気づいていませんでした。
Opus 5 に直してもらったら、無事に動くようになりました。再発防止もお願いしたところ、バージョンを上げるときにより安定した手順を踏むようにする、という改善まで足してくれたんですよね。ここまでは本当に良かったです。
ただ、その先がありました。
私は Chatwork に目的の違うチャットルームを2つ持っていて、障害の通知はそのうちの片方にだけ送るようにしていたんです。でも、そこだと気づきにくいからと、もう片方にも送るように勝手に変えられていました。「2か所に送るようにしておきますね」という感じで。
いや、そこまではやらなくていいよ、と。
Fable 5 を使っていると、意図を汲み取って先回りしてくれるのがすごく心地いいんですが、Opus 5 だと「あれ、なんかちょっと違和感あるな。まあいいんだけどね」という瞬間が、少しだけあります。
さっきの Mollick さんの「クセがある」は、たぶんこういうことなんじゃないかなと思っています。
「半額」は、本当に半額なのか

最初に書いた「Fable 5 の半分の単価」という話に戻ります。ここが、私はけっこう引っかかっているんですよ。
単価が半分でも、1つの問題を解くのに何往復もしていたら、結局かかるお金は減りません。逆に単価が高くても、少ない往復で解ければ出力するトークンの量が減るので、1問あたりのコストは安くなります。
実際、Cursor が公開している測定では、Opus 5 が1課題あたり8.23ドルで70.0点、Fable 5 が17.32ドルで70.5点でした。ここではきれいに半額が成立しています。
でも私がもっと大事だと思っているのは、お金より人間の注意力の方です。
AIに任せた仕事を確認して判断するのって、けっこう集中力を使うんですよね。余計なことをしない、意図を汲み取る、違和感なく進めてくれる。この滑らかさが、そのまま人間側のコスト削減になります。その意味では、今のところ Fable 5 が頭一つ抜けているかなというのが私の実感です。
ちなみに今週、私の Fable 5 の枠が全部なくなってしまって、今は Opus 5 しか使えません。だから今週からは否応なく Opus 5 で書いていて、この記事自体がその一本です。直接の比較は次の宿題ですね。
私の使い分けは、こうします

ここまでの検証を踏まえた、今の私の結論です。
数字やベンチマークの定義みたいに、どんどん変わっていく情報の調査は GPT-5.6 Sol にやらせます。大事な値はもう一度レビューさせて検証してから使います。
その調査結果を渡して記事の形にするのは、Opus 5 に任せます。読ませる文章、心を動かすキャッチコピーは、やっぱり Claude が強いです。
手を離して長く任せたい仕事は、当面 Fable 5 に置いておきます。違和感なく進めてくれる分、私が見張る時間が減ります。
事実の正確さがそのまま質になる学術的な文章なら、調査から執筆まで GPT の中で閉じるのもありかなと思っています。今回試したのはニュース解説だけなので、ここは推測です。
数字のベースさえ取れているなら、note の記事も Opus 5 に任せていいかもしれません。
動画でも解説します
記事だけだと伝わりにくいところもあります。
特に「Opus 5 と Fable 5 の3D比較」と「盲検採点のレポート画面」は、実際の画面で見た方が一発で分かります。動画では、止まったシステムを直してもらったときのやり取りもそのまま見せています。
動画はこちら👇️
まとめ

読みやすさは Opus 5、事実の正確性は GPT-5.6 Sol。読みやすい文章ほど、間違いが「確認済み」の顔をして混ざる。
長く任せる仕事の滑らかさは、今のところ Fable 5。
調査は GPT、記事化は Opus という分業が現時点の最適解。
要は、Opus 5 は文章のうまい同僚、GPT-5.6 Sol は数字に強い同僚、Fable 5 は放っておいても気が利く同僚だということです。どれか一人を選ぶ話ではなくて、3人に別々の仕事を渡すのが正解だったんですね。
まずは、あなたが今AIに任せている仕事を「調べる」と「書く」に分けてみてください。分けるだけで、どっちに何を渡せばいいかが見えてきます。

この記事が参考になったら、いいねで教えてください。次回は Fable 5 と Opus 5 を同じ仕事で直接比較した結果を書く予定なので、続きが気になる方はフォローしておいてもらえると嬉しいです。
あなたも、AIに頼んだ以上のことを勝手にやられて「そこまでやらなくていいよ」と思った瞬間、ありませんでしたか。コメントで教えてもらえると、次の記事のネタになります。
それではまた、れん学長でした!
📢 れん学長のAIツール実験室
メンバーシップでは、この記事では書ききれなかった実験ログや、AI活用の試行錯誤をもう少し踏み込んで共有しています。今回の盲検採点をどう組んだかの中身も、そちら側で扱う予定です。
価格や参加条件、どんな内容が読めるかは、入口記事にまとめています。
気になっていた方は、まず内容をのぞいてみてもらえるとうれしいです。
👉 メンバーシップの入口記事をのぞいてみる