見出し画像

シルバーウィーク、AIの勢力図が変わった──GPT-6 Astra・Sol・LunaとClaude Fable・Opus・Sonnetを徹底比較

シルバーウィークに流れてきたAIの新製品ニュースを見て、「また名前が増えた」と思った人もいるだろう。けれど、2026年9月の動きは、型番の更新として読むにはもったいない。

OpenAIはAstraでGPT-6の到達点を先に示し、19日後にSolとLunaで価格の裾野を広げた。一方のAnthropicは、Fable 5.1を出した同じ月に、その性能へ迫るOpus 5.5を投入した。 先端モデルがどこまで賢くなるかだけでなく、その知能をいくらで使えるかが動いた月なのだ。[1][2][3]

そこで、GPT-6 Astra・Sol・Lunaと、Claude Fable 5.1・Opus 5.5・Sonnet 5を一緒に比べる。会社をまたぐ対決、同じ会社の新旧・上位下位の関係、料金と精度の食い違いまで追うと、連休明けに試したいモデルが見えてくる。

情報確認日は2026年9月23日。 公式仕様、第三者評価、筆者の計算・解釈を区別している。6モデルを筆者が同条件で実測したレビューではない。

1. 発売順を知ると、今回のニュースがつながる

まず、別々の発表を一本の時間軸に並べよう。日付は公式資料の表記で、日本での提供開始時刻とは区別する。

発表・発売日:6月30日

  • モデル:Claude Sonnet 5

  • 今回の比較で重要な意味:現行の価格・速度重視の比較対象

発表・発売日:9月1日

  • モデル:Claude Fable 5.1

  • 今回の比較で重要な意味:難しい推論と長時間のエージェント作業を担う上位候補

発表・発売日:9月3日

  • モデル:GPT-6 Astra

  • 今回の比較で重要な意味:GPT-6がまず最上位から登場

発表・発売日:9月22日

  • モデル:GPT-6 Sol・Luna

  • 今回の比較で重要な意味:GPT-6の選択肢が中価格・低価格へ広がる

発表・発売日:9月22日

  • モデル:Claude Opus 5.5

  • 今回の比較で重要な意味:新しい5.5系列の第一弾、Fableとの境界を揺さぶる

発売日は各社の変更履歴・モデル資料・発表による。[1][2][4][3]

ここで大切なのは、SolとLunaが出たからAstraが旧型になったわけではないことだ。OpenAIは現在もAstraを最も難しい一連の仕事に向けたモデルとして位置づけ、GPT-6の家族に3モデルを並べている。新しい日付と上位の能力は、同じ意味ではない。[5]

Anthropic側も、数字だけで並べると見誤る。Opusの「5.5」はFableの「5.1」より大きいが、異なる系列の版番号である。名前の序列だけでFableが常に上、あるいは5.5だからすべて上、と判断せず、現行の評価と用途を見る必要がある。

なお、9月23日時点の比較対象はSonnet 5。Sonnet 5.5とHaiku 5.5は、Opus 5.5の発表で今後数週間の登場予定とされている。未発売のモデルを、すでに使える選択肢へ混ぜない。[3]

2. Astraを先に出したOpenAI——「できる」を「使い続けられる」へ

Astraの役割は、単発の質問への回答だけに収まらない。コード、ブラウザ、業務用ソフトを使う複数手順の作業を、成果物まで進めることが公式ガイドで強調されている。調査して、比較して、資料を作る。問題を調べ、修正し、動作を確かめる。その一連の流れに価値を置くモデルだ。[5]

そこへSolとLunaが来た。標準の入力・出力単価で比べると、SolはAstraの5分の1、Lunaは100分の1。同じGPT-6でも、使うたびの予算感はまるで違う。Solは複雑な開発やエージェント処理、Lunaは対象を絞った大量処理の候補として読むと分かりやすい。[6][7][8]

この順番から見えるのは、「まず能力の上限を見せ、次に利用できる回数と場面を増やす」という展開だ。これは発売順と価格に基づく筆者の解釈であり、OpenAIの社内戦略を確認したものではない。

たとえば、問い合わせ1万件を分類して要対応のものを抽出する仕事と、難航する移行プロジェクトを数時間かけて前へ進める仕事では、必要な知能も許容できる料金も違う。Astraだけでは費用が合わなかった前者にLunaを試し、Solでは行き詰まる後者をAstraに任せる。新製品の意味は、単にAstraを安く置き換えることに限定されない。

同じGPT-6でも、同じ設定を移せるとは限らない

Astraは推論をしない「none」設定を持たず、APIでのツール利用にはResponses APIが必要だ。SolとLunaは「none」を含む推論設定を備える。料金だけで入れ替える前に、実装が前提としている推論・ツールの条件も見る必要がある。[1][7][8]

「高いモデルには長い指示、安いモデルには短い指示」とも限らない。比較するときは、完成条件と必要な資料を揃え、各モデルがその仕事をどこまで自力で進められるかを見る。細かく手順を固定しすぎると、上位モデルが別の良い進め方を選ぶ余地まで消してしまう。

一つの大きな仕事を、どの能力と予算で進めるか。完成までの道筋でモデルの役割が変わる。

3. OpusがFableに迫ると、Sonnetの立ち位置も変わる

Anthropicの発表の核心は、Opus 5.5が多くの仕事でFable 5.1水準の性能を示す、という説明にある。高価な系列だけに任せていた仕事を、より低い単価でこなせる可能性がある。この主張はメーカー発表なので、後の第三者評価と分けて読む。[3]

Fable 5.1は、難しい推論や長時間の自律的な作業に向けたモデルだ。Opus 5.5が来ても、特定の仕事でFableのほうが安定するなら利用理由は残る。ただし「上位の名前だから常に最良」と考え、費用差を払う前提にはできなくなった。現在の自分の成果物で差が出るかを問い直すタイミングである。[2]

その下にはSonnet 5がいる。Solと通常の入力・出力単価が同じなので、日常の開発・文章・調査に使う中価格帯の直接比較は、Sol対Sonnet 5が自然だ。一方、SonnetからOpusへ上げる場合、単価は2倍。修正回数や手戻りが減るなら、その差を払う意味がある。[4][9]

つまり比較は三方向になる。Sol対Sonnetは同じ予算帯での選択。Astra対Fableは同じ上位単価での選択。そしてOpus対Astra・Fableは、上位の仕事を、より低い単価でどこまで奪えるかの比較だ。OpusをSol・Lunaだけと並べると、この面白さが落ちてしまう。

MythosとHaikuはどう扱う?

Fable 5.1とMythos 5.1は同じ能力を持ち、提供上の安全対策が異なるとAnthropicは説明している。Mythosは審査を伴うアクセスプログラム等を通じた限定提供であり、一般利用者が自由に選べる第7候補としては扱わない。[10]

現行のHaiku 4.5も低価格帯の選択肢で、通常入力$1・出力$5/100万トークン。ただし本稿の中心は、最新GPT-6系列とClaudeの上位・中価格帯の再編である。Lunaの通常単価はHaiku 4.5の10分の1だが、それだけで全用途における性能の上下を断定はできない。[4]

4. 6モデルの料金表——同価格の相手を見つけよう

以下はAPIの従量料金。米ドル、100万トークンあたり。トークンは処理単位で、日本語の文字数と一対一ではない。OpenAIは入力272K以下のStandard、Claudeは通常料金。税・ツール利用料・キャッシュ作成料などを除く。[11][9][2][4]

モデル:GPT-6 Luna

  • 通常入力:$0.10

  • キャッシュ読込:$0.01

  • 出力:$0.50

モデル:GPT-6 Sol

  • 通常入力:$2.00

  • キャッシュ読込:$0.20

  • 出力:$10.00

モデル:Claude Sonnet 5

  • 通常入力:$2.00

  • キャッシュ読込:$0.20

  • 出力:$10.00

モデル:Claude Opus 5.5

  • 通常入力:$4.00

  • キャッシュ読込:$0.20

  • 出力:$20.00

モデル:GPT-6 Astra

  • 通常入力:$10.00

  • キャッシュ読込:$1.00

  • 出力:$50.00

モデル:Claude Fable 5.1

  • 通常入力:$10.00

  • キャッシュ読込:$0.25

  • 出力:$50.00

通常入力・出力の比は、Lunaを1とすると1:20:20:40:100:100。ただしキャッシュになると並びが変わる。FableはAstraの4分の1、OpusはSol・Sonnetと同額。長い共通資料を何度も読む仕事では、最初の列だけを見ても比較できない。

コンテキストはGPT-6の3モデルが105万、Claudeの比較3モデルが100万トークン。標準の最大出力はいずれも128Kだ。大きな資料を扱える点は共通するが、入れられる量と、その中から正しく要点を拾える能力は別。上限の5%差を、そのまま使い勝手の5%差には変換できない。[6][7][8][9][2][4]

「同じ仕事1,000件」ならいくら?

料金差の大きさをつかむため、1件につき入力10,000・課金対象の出力3,000トークン、1,000件、キャッシュなしで計算する。これは使用量を固定した筆者の試算で、各モデルが実際に同じ量を使うという予測ではない。

  • Luna:$2.50。入力$1+出力$1.50。

  • Sol/Sonnet 5:各$50。入力$20+出力$30。

  • Opus 5.5:$100。入力$40+出力$60。

  • Astra/Fable 5.1:各$250。入力$100+出力$150。

安いモデルが一度で合格するなら強い。一方、SolからOpusへの追加$50で、人の確認・修正が100分減るなら、時給$30の仮定では差額を回収できる。上位モデルの価値を判断するなら、請求額の横に「人が何分直したか」を置きたい。

AIの請求額と、人が確認・修正する時間。両方を足してコストを見る。

5. 精度と実費を並べると、値札の序列が崩れる

6モデルを同じ評価元で見る。下表はArtificial AnalysisのIntelligence Index v4.3.2、確認日の掲載値。すべてmax設定、FableとOpusはDefault Fallbackあり。拒否時に別モデルへ切り替える条件を含むため、純粋な単一モデル同士の完全統制実験ではない。[12][13][14][15][16][17]

モデル・max設定:Claude Opus 5.5・fallbackあり

  • Intelligence Index:58

  • 評価タスクあたり費用:$5.98

モデル・max設定:GPT-6 Astra

  • Intelligence Index:53

  • 評価タスクあたり費用:$3.26

モデル・max設定:Claude Fable 5.1・fallbackあり

  • Intelligence Index:53

  • 評価タスクあたり費用:$7.63

モデル・max設定:GPT-6 Sol

  • Intelligence Index:48

  • 評価タスクあたり費用:$1.06

モデル・max設定:Claude Sonnet 5

  • Intelligence Index:38

  • 評価タスクあたり費用:$5.09

モデル・max設定:GPT-6 Luna

  • Intelligence Index:37

  • 評価タスクあたり費用:$0.07

この指標は複数の評価をまとめたもので、58は58%正解という意味ではない。費用も評価群の加重平均で、自分のメール一件の相場ではない。同じmaxという呼び名でも、消費する計算量が同じとは限らない。[18]

それでも、注目すべき関係が三つある。

一つ目は、Opus 5.5が総合指標でAstraとFableを上回っていること。 単価の高いモデルが、どの指標でも上になるわけではない。Claudeを中心に使う人が、Fableを選ぶ前にOpusを試す根拠になる。

二つ目は、AstraとFableが同じ53でも、評価費用は$3.26対$7.63であること。 通常単価は同じなのに、実費では2倍以上の差がある。さらにAstraは、単価が低いOpusよりも評価費用が小さい。使うトークン量などの違いが、値札を逆転させる。

三つ目は、SolとSonnetの同価格対決。 この評価条件では、Solは高い指標を、かなり低い費用で出している。Sonnetを使い続けている人にとって、Solを試す理由は「新発売だから」より具体的だ。ただしSonnetの既存環境での安定性、日本語の好み、特定の開発案件への適性まで、この一表で消えるわけではない。

科学研究ではAstra、総合ではOpus? 得意分野を分けて読む

メーカー側の比較にも、順位が入れ替わる例がある。Anthropic掲載のTerminal-Bench-Science 0.1では、Astra 64.6、Opus 5.5 58.7、Fable 5.1 52.6。一方、同社掲載のTerminal-Bench 4.0では、Opus 66.4、Astra 57.9、Fable 55.8だ。科学研究とターミナル上の開発では、同じ並びにならない。[3]

これはAnthropicの掲載値で、前の第三者総合指標とは評価も実行条件も異なる。モデルごとの推論設定も完全一致ではない。したがって「科学なら必ずAstra」と断定する材料ではなく、総合点の上位だけを残すと、特定分野の有力候補を落とすことを示す例として読みたい。

また、古い記事のIntelligence Indexと今回の数字を、そのまま増減比較しない。評価セットの版が変われば数値も変わる。「以前61だったAstraが53に低下した」と、異なる版の数字だけで劣化を語るのは不適切だ。

総合点が同じでも、見つける誤りと必要な修正は同じとは限らない。

6. コスパを変えるのは、キャッシュ・推論・待ち時間

同じ資料の繰り返し読込は、Fable 5.1の見落とせない特徴だ。通常入力はAstraと同じ$10でも、キャッシュ読込は$0.25。仮に100万トークンぶんの読込だけを比較するなら$1対$0.25になる。ただし最初の作成、保持期限、再利用できなかった部分、出力は別料金。総額が必ず4分の1という意味ではない。[2][6]

OpenAIの3モデルは、入力が272Kを超えると、そのリクエスト全体の入力・キャッシュ料金が2倍、出力料金が1.5倍になる。100万近い資料を扱えることと、短い入力と同じ単価で扱えることを混同しない。[11]

そして、画面に表示される回答の長さだけでは消費量が分からない。OpenAIの推論トークンは、回答本文に見えなくても出力として課金される。前章で「高い単価のAstraが、低い単価のモデルより安く終わる」ことがあったのは、単価と使用量を別々に見る必要があるからだ。[19]

速く文字が出るモデルと、早く仕事が終わるモデル

文字の出力速度、最初の回答が見えるまでの時間、成果物が完成するまでの時間は別である。毎秒の生成が速くても、長く考え、何度も失敗して修正すれば、完了は遅くなる。逆に、少ない手順で終える高価格モデルが、待ち時間と確認作業を減らす場合もある。

チャットで一緒に推敲するなら、短い応答のテンポが大切だ。夜に調査を任せ、朝に成果物を読むなら、秒単位の応答より完成度と総額が効く。速度評価の数字を借りる前に、自分が待っているのは「最初の一文」か「使える完成品」かを決めたい。

APIの標準推論設定も揃っていない。ClaudeではSonnet 5とFable 5.1がhigh、Opus 5.5がmedium。いつもの初期設定で使った感想と、前章のmax評価を、同じ条件の話として重ねない。[4][9]

同じ資料を繰り返し読む仕事では、通常入力よりキャッシュの条件が効いてくる。

7. 月額プラン・提供条件まで含めて、誰が何を試すべきか

ここまでの金額はAPI料金だ。ChatGPTやClaudeの月額プラン、CodexやClaude Codeの利用枠とは別である。APIの単価が半分でも、月額料金や使える回数が同じ比率で変わるとは計算できない。加入先での対象モデル、上限、追加利用の扱いを確認して選ぶ。

また、モデル名を選べることと、ブラウザ操作・ファイル編集・連携サービスまで同じように使えることは別だ。モデルに加え、それを動かすアプリやツールが仕事の完成度を左右する。移行の手間もコストに含めると、ベンチマークで少し上というだけでは乗り換えない判断にも理由がある。

本記事の比較から導く、試す順番は次のとおり。公式の利用推奨ではなく、読者の目的に応じた提案である。

  • 日常の開発・文章・調査を一つのモデルで回したい人:SolとSonnet 5。 同価格なので、実際の完成度と修正時間を比べやすい。最新の第三者評価ではSolに試す価値がある。

  • Claudeで難しい成果物を作る人:Opus 5.5からFable 5.1へ。 Opusで合格するなら費用を抑えやすい。Fableには、追加費用に見合う具体的な改善があるかを求める。

  • 複雑な研究や長い自律作業を任せたい人:Astra・Opus・Fable。 上位の三者を同じ資料と完成条件で比べる。科学系評価でのAstraの強さも、候補を残す理由になる。

  • 大量の定型処理をサービスへ組み込みたい人:Lunaから。 抽出・分類など合否を判定しやすい仕事で、必要な品質に届くかを見る。単価差が大きいため、用途が合えば効果が大きい。

混ぜて使う手もある。前述の固定使用量なら、1,000件をLunaで処理し、うち100件だけSolで再処理すると$7.50。全件Solの$50より安い。ただし、Lunaが自分の誤りを必ず見つけるわけではない。形式チェック、既知の正解、抜き取り確認など、難しい案件を取りこぼさない仕組みが成立して初めて、この試算は役に立つ。

8. 今月の主役は「最強の名前」より、知能が届く範囲

9月初めのAstraとFable 5.1は、難しい仕事をどこまでAIに任せられるかを広げた。22日のSol・Luna・Opus 5.5は、それをどの予算帯で使えるかという問いを強くした。発売順を追うと、個別の新製品が一つの流れになる。

OpenAIの中では、Astraでしか任せにくかった仕事をSolでできるか、Solで回していた処理をLunaへ下ろせるか。Anthropicの中では、Fableを使っていた仕事をOpusで終えられるか、SonnetからOpusへの差額でどれほど手戻りを減らせるか。そして会社をまたげば、同価格のSol対Sonnet、Astra対Fableがある。

これから新モデルのニュースを読むときは、**「同じ値段で何が良くなったか」「同じ完成度をいくらで得られるか」「今まで高すぎた用途へ広がるか」**の三つを見てほしい。総合ランキングの一位だけを覚えるより、次の発表の意味まで読みやすくなる。

連休明けに試すなら、自分が最近苦労した仕事を数件用意し、候補を二つか三つに絞ればいい。材料と合格条件を揃え、料金だけでなく完成までの時間、重大な誤り、修正の量を残す。文章の好みと、事実の正しさも別々に採点する。

今回の面白さは、王者が一人増えたことではない。高いモデルを使う理由と、安いモデルで十分になる範囲が、同時に変わったことだ。 Astraを含むGPT-6の全体像と、Fable・Opus・Sonnetの関係を一緒に眺めて初めて、シルバーウィークのAIニュースはつながる。

本記事の画像はAI生成の概念表現。試算は記載条件に基づき、性能実測や利用枠の保証ではない。料金・提供条件・評価値は変更されるため、導入時には各出典を確認してほしい。

参考資料

  1. OpenAI, API Changelog — September 22, 2026。発売日、API、272K以下の標準単価。2026-09-23確認。

  2. Anthropic — Claude Fable 5.1 overview。2026-09-23確認。

  3. Anthropic, Introducing Claude Opus 5.5。2026-09-22発表、メーカー評価・設定・費用削減の説明。2026-09-23確認。

  4. Anthropic — Claude Sonnet 5 overview。2026-09-23確認。

  5. OpenAI — Model guidance: Using GPT-6。2026-09-23確認。

  6. OpenAI — GPT-6 Astra。2026-09-23確認。

  7. OpenAI, GPT-6 Sol。仕様・推論設定・長文料金条件。2026-09-23確認。

  8. OpenAI, GPT-6 Luna。仕様・用途・料金条件。2026-09-23確認。

  9. Anthropic, Claude Opus 5.5 overview。単価、キャッシュ、コンテキスト、標準最大出力。2026-09-23確認。

  10. Anthropic — Introducing Claude Fable 5.1 and Claude Mythos 5.1。2026-09-23確認。

  11. OpenAI, API Pricing。Standardの短文・長文、キャッシュ等。2026-09-23確認。

  12. Artificial Analysis — GPT-6 Astra (max)。2026-09-23確認。

  13. Artificial Analysis, GPT-6 Sol (max)。Index 48、タスク費用$1.06。2026-09-23確認。

  14. Artificial Analysis, GPT-6 Luna (max)。Index 37、タスク費用$0.07。2026-09-23確認。

  15. Artificial Analysis — Claude Fable 5.1 (max with fallback)。2026-09-23確認。

  16. Artificial Analysis, Claude Opus 5.5 — max, default fallback。Index 58、タスク費用$5.98。2026-09-23確認。

  17. Artificial Analysis — Claude Sonnet 5 (max)。2026-09-23確認。

  18. Artificial Analysis, Benchmarking methodology。評価方法と速度等の指標。2026-09-23確認。

  19. OpenAI, Reasoning models。推論トークンの課金とusage。2026-09-23確認。

元記事:ぽちょ研究所|シルバーウィーク、AIの勢力図が変わった──GPT-6 Astra・Sol・LunaとClaude Fable・Opus・Sonnetを徹底比較

いいなと思ったら応援しよう!

この記事は noteマネー にピックアップされました

noteマネーのバナー