
単価は2.5倍。それでも発売4日で乗り換えた。──GPT-6 Astraで本当に良くなった3つのことを、社長の実測で読む
2026年9月4日、GPT-6 Astraが一般提供されました。トークン単価は前のモデルの2.5倍。それでも私は4日後の9月8日、自社ツールの実装エンジンを切り替えました。理由は「賢くなったから」ではなく、3つの「やり切る力」が変わったからです。実測は所要14分、修正ラウンド0の一発合格。速くも安くもなる保証はありません。それでも、机の上の景色は変わりました。

なぜ今、モデルの「差」を見なければならないのか
「新しいモデルが出ました」という知らせは、経営者にとって雑音です。9月4日の発表資料にも、Terminal-BenchやOSWorldといった聞き慣れない指標が並びました。調べれば意味は分かりますが、来月の売上は動きません。
生成AI活用顧問として277社を支援してきて、受ける質問はいつも同じです。「で、うちの仕事は何が変わるんですか」。見るべき数字は1つ、完走率です。頼んだ仕事を途中で止まらずに最後まで持っていく割合。ここだけが社長の時間に直結します。
先日、ある製造業の経営者から夜中にメッセージが届きました(複数の支援先の話を1社のモデルケースとして再構成しています)。「AIに作らせた資料が8割のところで止まっている。結局、自分で仕上げて今から寝る」。時刻は午前1時を回っていました。
賢くないから困るのではなく、賢いのに途中で手を離すから困る。8割まで来たものを人が仕上げるのは、最初から自分で作るのと疲れが変わりません。
だから私は賢さの数字を飛ばして、完走率だけを見ます。GPT-6 Astraは、そこが動いた最初のモデルでした。

発売4日目に、自社の工房を切り替えてみた
自社に「LPデモ工房」という内製ツールがあります。企業のURLを1本入れると、その会社向けに架空ブランド化した提案用のデモLP(1枚のHTML)を作る仕組みです。商談の前に「御社ならこういう見せ方ができます」と実物を持っていくために作りました。口で説明する提案と、目の前で開くデモとでは、相手の前のめり具合が違います。
役割分担はこうです。まずClaudeが対象企業を分析し、実名を架空名に置き換えるリブランド表と、実装指示書を書きます。次にCodex(OpenAIのコーディングエージェント。中のモデルにGPT-6 Astraを指定)が単一のindex.htmlを実装します。最後にもう一度Claudeが静的検査を5項目行います。免責文が入っているか、実名が漏れていないか、未確定値の【要差し替え】がいくつ残っているか、セクション数は足りているか、ファイルサイズは妥当か。この5つです。
設計した当初から、私はこの工程に「修正ラウンドを最大1回」を組み込んでいました。1回では通らないことがある。そういう前提で作った仕組みです。検査で引っかかった項目を指示書に書き戻して、もう一度実装させる。この1往復を、最初から見込んでいました。
9月8日、一般提供から4日後の火曜日。私は実装エンジンをGPT-6 Astraに切り替えて、通しで1本流してみました。4日で決めたのは、勘が良かったからではなく、うちの工房が「同じ仕事を同じ手順で流す」形になっていたからです。比べる土台があると、判断は速くなります。
最初に転んだのは、モデルではなく道具でした。手元のCodex CLI(コマンドラインツール)が0.146.0のまま古く、Astraを指定した瞬間に「新しい版が必要です」というエラーで全滅しました。HTTP 400。画面に出たのは短い1行だけで、原因にたどり着くまで数分かかりました。0.153.4に更新したら、何事もなかったように動き出しました。
ここで学んだことを1行で書くと、「モデルを切り替える」は「道具を更新する」とセットだということです。新しいモデルは、たいてい新しい版のクライアントを要求します。社内で「新しいAIを試したのに動かなかった」という報告が上がってきたら、まず道具の版を疑ってください。中身の賢さではなく、入り口の鍵が合っていないだけ、という話が本当に多いのです。私はこの数分を、社内の誰かが同じところで転ぶ前に使えたと思うことにしています。version と書かれた数字を1つ確認するだけで済む話に、詳しい人を1時間つかまえる会社を、私は何社も見てきました。
そこから先は、あっけないほど静かでした。実装が走り出してからの14分間、私はいつものように途中経過を眺めながら「ここは直しが要るな」と頭の中でメモを取っていたのですが、検査にかけた瞬間にそのメモがまるごと不要になりました。
結果です。所要14分。生成物は41,939バイト。セクション10。免責文OK。未確定値の【要差し替え】は2箇所。実名の漏れ0。そして修正ラウンド0、つまり一発合格でした。
正直に書くと、最初は検査のほうを疑いました。通らないはずのものが通ったときは、たいてい検査が壊れています。検査の出力を項目ごとに見直して、ようやく信じました。免責文は入っていて、実名の漏れはなく、【要差し替え】の2箇所は、相手に確認しないと書けない種類の項目でした。
金額の話も正直に書きます。トークン単価は2.5倍になっています。それでも切り替えたのは、見込んでいた修正ラウンド1回分のほうが、私にとって高くつくからです。あの1往復には、指示書を書き直す私の時間と、待つ時間と、「今度は通るだろうか」と気にしている間の集中力が乗ります。単価の差はドルで測れますが、この3つは請求書に出てきません。
設計した人間としては、少し複雑な気分にもなりました。この工房には「修正ラウンドを最大1回」という枠が最初から入っています。1回では通らないという前提で、私自身が書いた枠です。その枠が、この日は一度も使われませんでした。前提のほうが古くなった、ということです。悔しさより先に浮かんだのは「次は何を前提から外せるだろう」という考えでした。修正ラウンドを見込んで決めていた検査の粒度も、待ち時間の見積もりも、商談の前日に流すという運用のタイミングも、全部が一段ずつ前へずれます。
出てきたデモLPは、相手の会社の色で、相手の言葉で書かれた1枚でした。開いたときの見た目は、これまで修正ラウンドを経て出てきたものと変わりません。違ったのは、私がその1枚を作るのに14分しか使っていない、という点だけです。
ただし、これは1回の実測です。n=1。回数を重ねて判断するのが筋で、この記事はその1回目の記録として書いています。同じ工房を10本流して一発合格が3本しかなければ、私はここに書いたことを訂正します。

良くなったこと①「最後までやり切る」
OpenAIの開発者向けドキュメントには、GPT-6 Astraは「GPT-5.6 Sol以前のモデルより、長いタスクの途中で一貫性を保つことが概ね得意」とあります。「主体性とやり切り(initiative and follow-through)」の節では、推奨されるふるまいは「行動に寄せ、ユーザーの意図したタスクを完了まで運ぶ」ことだとされています。
数字も同じ方向です(OpenAI発表値・自社評価・Astra vs Sol)。
・端末でのソフトウェア作業(Terminal-Bench 4.0): 57.7% vs 37.3%
・業務自動化(AutomationBench): 41.4 vs 18.1
・PC操作の完遂率(OSWorld 2.0): 72.6% vs 65.7%、1タスクあたりの所要時間は約47%短縮(おおよそ40分 vs 75分)
経営者の言葉に直せば、「止まらずに終わる仕事が増えた」「同じPC作業が75分から40分になった」。数学や推論の指標(FrontierMath Tier 4、ARC-AGI-3など・OpenAI発表値)も軒並み高いのですが、そちらは頭打ちに近い。現場で効くのは完走です。
面白いのは、完走が「勝手に走ること」を意味しない点です。OpenAIのデモでは、「個人のキャリアサイトを作って」という依頼に前のモデルが13分15秒かけて作り切りました。GPT-6 Astraは開始20秒で止まり、「どの職種へ移るのですか」と1つだけ質問してから作り始めています。
要る質問を1つして、あとは走る。優秀な社員の仕事の仕方と同じです。
Codexでも同じです。文脈が一杯になると、これまでは要約して古い部分を潰していました。今はノートを取って次へ持ち越します(notes across context windows・OpenAIの説明)。引き継ぎメモを残して席を立つのと同じです。

良くなったこと②「途中の変更を受け止める」
社長の仕事は、途中で条件が変わります。「対象を大企業から中小企業に変えて。予算は月10万円以内で」。会議室を出た3分後に、この話になります。
これまでのAIは、この変更に弱いところがありました。作り直させると前の成果が消え、続けさせると変更前の前提が残る。結局、人が見比べて手で直していました。
GPT-6 Astraには、作業中に追加の指示を送れる仕組み(mid-turn steering)が入りました。OpenAIの開発者向けドキュメントには「作業中に追加のユーザー指示(修正や要件変更)を送れる」とあり、一般的な指示追従も従来モデルより強くなったとされています。
長い資料の取りこぼしも減りました。長い文脈から情報を取り出す指標(MRCR 512K〜1M)で96.3% vs 73.8%(OpenAI発表値)。およそ4回に1回落としていたものが、27回に1回です。100ページの資料を渡して「3ページ目の条件も守って」と言える差になります。
会話の途中で推論の深さを上げ下げできる入力(configuration_update)も入りました。下書きは浅く、詰めだけ深く。同じ会話の中で切り替えられます。

良くなったこと③「待ち時間に、別の仕事を進める」
3つ目が、いちばん地味で、いちばん効きます。
非同期ツール呼び出し(async tool calling)という仕組みが入りました。OpenAIの開発者向けドキュメントによれば、「アプリ側がツールを実行している間に、推論を続ける・他のツールを呼ぶ・依頼のうち独立した部分に答える」ことができます。集計を待つ間に報告書の骨子を書き進める、という動き方です。ただし対応(ツール定義にasync: true)はアプリ側に要ります。
Codexでも、質問を非同期で投げるようになりました。部下が「これ確認お願いします」と置いて、答えを待たずに次へ取りかかるのと同じです。
価格は入力$10/出力$50(100万トークンあたり)。前のモデルは$4/$20でしたから、単価は2.5倍。長い文脈では$20/$75です。では、コストも2.5倍になるのか。2つの物差しが正反対の答えを出します。
OpenAIの説明(自社評価)は「より少ない出力トークンで、より強い結果を出す。単価は上がったが、作業単位の推定APIコストは下がった」。ソフトウェア開発の指標(DeepSWE v1.1)で約32%、データベース移行タスクで約38%下がったとしています。
一方、独立系のArtificial Analysisの集計は違います。総合知能指数では両者はほぼ同点。コーディングエージェント指数では、最大推論設定で出力トークンが約1/3(約3倍の効率)まで減りました。ところが同社の総合指数を回すコストでは、出力トークンの削減が約10%にとどまり、単価2.5倍が効いて作業単位で約75%高いという逆の結果です。
後退した項目もあります。業務文書の品質比較(GDPval-AA v2)で約80 Elo低下、銀行業務・科学コード・長文推論の一部で2〜3ポイント低下(いずれもArtificial Analysis)。一方、知らないことを答える率は92%から51%へ下がりました。
同じ問いに、2つの物差しが「約38%安い」と「約75%高い」を返す。どちらかが嘘なのではなく、測っている仕事が違うだけです。結論は1つ、自社の仕事で実測するしかありません。
制約もあります。サイバーセキュリティでOpenAIの準備態勢フレームワークの「Critical」水準に初めて達したため、攻撃系の高度な機能は限定提供です。
参考(一次情報)
・OpenAI 開発者向けドキュメント「Latest model」: https://developers.openai.com/api/docs/guides/latest-model
・OpenAI 発表ページ「GPT-6 Astra」: https://openai.com/index/gpt-6-astra/
・Artificial Analysis「Benchmarking GPT-6 Astra」: https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra
今日の30分でできる最初の一歩
ベンチマークを読み比べる前に、社長自身の手で1回だけ試してほしいテストがあります。今お使いのAIに自社の仕事を1つ依頼し、途中で条件を1つだけ変える。これで「変更を受け止められるか」が分かります。移動中なら音声入力でも通ります。
あなたは私の業務アシスタントです。これから1つ仕事を依頼します。
作業の途中で、私が条件を1つだけ変更します。変更後は、作り直す部分と
そのまま使える部分を自分で判断して、最後まで完成させてください。
【最初の依頼】
【ここに自社の仕事を1つ書く。例: 来月の販促キャンペーンの企画書を作る】
【完成の定義】
・A4で3枚以内
・数字の根拠を1つ以上入れる
・最後に「決めてほしいこと」を3つ挙げる
【途中変更】(作業が半分ほど進んだところで私が送ります)
【ここに変える条件を1つ書く。例: 対象を既存顧客から新規顧客に変える】
【完了報告の形式】次の表で自己申告してください。
| 項目 | 内容 |
| 変えた条件 | |
| 守った条件 | |
| 作り直した部分 | |
| 捨てた部分 | |表がずれていたら、そのモデルは変更を受け止め切れていません。合っていれば、その仕事は任せられます。
実践プロンプト集:乗り換えを「実測」に変える4本
ここからは、私が実際に社内と支援先で使っている4本を、そのまま貼れる形で置いておきます。どれも「完走させる」「途中で変える」「待ち時間を使う」「乗り換えを判定する」という、この記事の3つの力に対応しています。新しいモデルを入れても社内の使い方が前のままなら、上がった単価だけが残ります。道具の入れ替えと同時に、頼み方も入れ替えてください。
1本目は完走依頼書です。AIが途中で止まる原因の多くは、モデルの能力ではなく依頼の側にあります。「完成の定義」が書かれていない依頼は、どこで手を離しても間違いになりません。総務・営業事務の方が定型の集計や名簿整備を頼むときに、この雛形をそのまま埋めて使ってください。私はこれを、社員に仕事を振るときの紙と同じ扱いにしています。人に頼むなら口頭で足りることも、AIには書かないと伝わらない。逆に言えば、ここに書き出せない依頼は、人に振っても同じところで止まります。
あなたは私の実務担当者です。以下の依頼書のとおりに、最後まで仕上げてください。
# 依頼書
### 目的
【一文で書く。例: 展示会で集めた名刺120枚を、来週の営業会議で使える一覧にする】
### 完成の定義(3つとも満たせば完成)
1. 【チェックできる条件。例: 120件すべてに業種と規模の欄が埋まっている】
2. 【例: 優先度A/B/Cが付いていて、Aが20件以内】
3. 【例: 出典が不明な項目は「要確認」と明記されている】
### 触ってよい範囲
【例: 添付のCSVと、その加工結果のみ。元ファイルは書き換えない】
### 禁止事項
【例: 推測で会社名や役職を補わない。外部サイトへ問い合わせをしない】
### 途中で聞いてよい質問
1つまで。それ以外は仮置きして進め、仮置きした箇所に【要確認】と書く。
### 完了報告の形式
・所要時間
・満たした完成の定義(1/2/3のどれか)
・【要確認】の件数と一覧
・自分の判断で直した箇所(あれば)「質問は1つまで」を入れているのは、質問を封じるためではなく、絞らせるためです。1つに絞ると、AIは本当に致命的な不明点を選んできます。あのキャリアサイトのデモで、開始20秒に出た1問と同じ考え方です。
2本目は、途中で条件が変わったときの差し込み文です。営業部長が提案書の作成を頼んだあとで、商談の温度が変わって対象や予算が動いた──そういう場面で使います。大事なのは「変えるもの」と「変えないもの」を同時に伝えることと、完成済みの部分を残す・直す・捨てるの3つに仕分けることです。ここを言わずに「対象を中小企業に変えて」だけ送ると、AIは全部を作り直すか、逆に言われた1行だけ差し替えて他を放置します。どちらも、こちらが見比べて直す羽目になります。
作業中に失礼します。条件を変更します。いったん手を止めて、下の指示で続けてください。
【変える条件】
【例: 提案先を「従業員300名以上」から「従業員30〜100名」に変更】
【変えない条件】
【例: 納期・ページ数・料金表の形式はそのまま】
【完成済み部分の扱い】
・残す: 【例: 冒頭の課題整理】
・直す: 【例: 事例の3社を中小企業の事例に差し替え】
・捨てる: 【例: 大企業向けの導入体制の章】
【再確認して続行】
上の3分類をあなたの言葉で1行ずつ復唱してから、作業を再開してください。
復唱の内容が私の意図とずれている場合のみ、質問を1つだけしてください。復唱を1行ずつ挟むのは、人間の部下に対しても同じです。復唱がずれていたら、そこで止められます。作り上がってから気づくより、ずっと安く済みます。
3本目は、待ち時間を使う指示です。基幹システムの集計待ち、外部への問い合わせ待ち、印刷会社からの見積り待ち。経理や管理部門の仕事には「何かを待つ時間」が必ず挟まります。その間に、結果がなくても作れる部分を先に作らせます。非同期ツール呼び出しに対応したアプリなら自動でこう動きますが、対応していない環境でも、この指示文を人が挟めば同じ効果が出ます。仕組みが追いつくのを待たなくてよい、というのがこの1本の値打ちです。
あなたは私の実務担当者です。これから【例: 基幹システムの月次売上データの集計】を実行します。
結果が返るまでの待ち時間に、次の3つを先に作っておいてください。
結果を待たずに着手し、届いた時点で数値だけを差し込みます。
【先に作るもの】
1. 報告書の骨子(見出しだけ・5〜7項目)
2. 数値が届いたら確認するチェック項目
(例: 前年同月比の符号、欠測月の有無、合計の突合)
3. 会議で出そうな想定質問と、その答えの型(数値は空欄のままでよい)
【数値の差し込み方】
・空欄は【集計値】と書いておく
・届いた数値を入れたら、入れた箇所を一覧で報告する
・数値と骨子が矛盾したら、骨子を直して理由を1行添える
【待っている間に絶対にしないこと】
・数値を推測で埋める
・「おそらく増加傾向」など、根拠のない傾向を書く最後の禁止事項が要です。待ち時間に仕事をさせると、AIは空欄を埋めたくなります。埋めさせない指示を先に置いておけば、待ち時間は安全な作業時間に変わります。
4本目は、乗り換え判定のチェックリストと、実測を1行で残す形式です。上位モデルは、すべての仕事で得になるわけではありません。工程が多い、道具が深い、やり直しが多い、人の手直しが多い、文脈が長い。このどれかが効く仕事だけを上げて、あとは今のモデルのまま置いておきます。社内に「AIは高い」と「AIは安い」の両方の意見があるなら、たいていは違う仕事を見て話しています。この5項目を共通の物差しにすると、議論が仕事単位に降りてきます。
あなたは私の業務アセッサーです。下の仕事を5項目で採点し、
上位モデルを試すべきか判定してください。
【対象の仕事】
【例: 顧客からの問い合わせメールを分類して、担当者へ振り分ける】
【判定の5項目】各項目に該当すれば1点
1. 工程数: 3工程以上ある
2. 道具の深さ: 検索・ファイル操作・外部システムなど、道具を2種類以上使う
3. やり直し回数: 今のやり方で、平均1回以上やり直しが出ている
4. 人の手直し: 出てきたものに、人が毎回手を入れている
5. 文脈の長さ: 参照する資料が合計で1万字を超える
【判定】2点以上なら上位モデルで試す。1点以下は今のモデルのままでよい。
判定の根拠を、項目ごとに1行で書いてください。
【実測記録】試したら、この1行だけ残します。
2026-09-08 / LPデモ工房 / 14分 / 修正ラウンド0 / 一発合格
(日付 / 仕事名 / 所要分 / 修正ラウンド数 / 一発合格の可否)この1行を10本ためると、自社にとっての正解が出ます。ベンチマークの表を眺めるより、自分の仕事の1行が判断材料になります。
4本とも、特別な道具は要りません。今お使いのAIの入力欄に貼るだけです。効くのは文面そのものより、完成の定義と禁止事項を先に決めておくという順番です。
「修正ラウンド」が消えた1日
以前の1日の組み立ては、こうでした。依頼を出す。8割の出来で返ってくる。検査で引っかかる。指示書を直して、もう一度投げる。2回目が返るまで私は待っています。何もできない時間ではなく、「気になって他の仕事が薄くなる」時間です。モデルは単価の表を見て、安いほうを選んでいました。
今は、こうです。依頼を出す。14分後に検査を通ったものが返ってくる。修正ラウンドはありません。待つ間は別の仕事に手をつけています。モデルを選ぶときに見るのは単価の表ではなく、1本あたり何分かかって修正が何回入ったかという、自分の記録です。
……と書くと大げさですが、変わったのは結局、私が「気にしている時間」の長さです。工程表の上では14分と20分の差にしか見えません。実感としては、頭の一部をずっと工房に置いていたのを、丸ごと持ち帰れるようになった、という感じに近い。
もう1つ変わったのが、単価の見方です。入力$10/出力$50だけを見れば、確実に高くなりました。ただ、1本のLPに以前は2回投げていたものが1回で済んでいます。比べる単位を「1トークンあたり」から「1本あたり」へ変えるのが筋です。Artificial Analysisの集計が示すとおり、仕事によっては1本あたりでも高くつきます。だからこそ、自分の記録が要ります。

賢さより「完走率」を買う
乗り換えの判断は、全部か無かではありません。安定して通っている仕事は、私も前のモデルのまま動かしています。定型のメール分類、決まった形式への転記、短い要約。完走率がすでに高く、上げても得るものが少ない領域です。
上げる価値があるのは、次のどれかが効いている仕事です。工程が多い。道具が深い(検索やファイル操作や外部システムを跨ぐ)。やり直しが多い。人の手直しが多い。文脈が長い。1つでも当てはまるなら試す価値があり、2つ以上なら、まず間違いなく得をします。
試したら、記録を1行残してください。日付、仕事名、所要分、修正ラウンド数、一発合格の可否。10本たまれば、上位モデルが自社にとって高いのか安いのかが、他人の集計ではなく自分の数字で分かります。OpenAIの表にもArtificial Analysisの表にも、「御社の仕事」は載っていません。
賢さは、もう十分に足りています。私たちが買っているのは、最後まで運んでくれる確率です。
任せて出かける朝
9月8日の14分間、私は何度も画面を見に行きました。長年しみついた癖です。8割で止まる前提が、体に残っていました。
余談ですが、その日は結局、コーヒーを淹れ直す時間ができました。
これから増えるのは、たぶんこういう朝です。仕事を依頼し、完成の定義を渡し、「途中で1つだけ聞いていい」と言い添えて出かける。帰ってきたら終わっている。社員全員がその状態を持てたとき、会社の1日は静かに長くなります。
単価は2.5倍でした。それでも私は4日で乗り換えました。次に測るのは、10本流したときの一発合格の本数です。数字が出たら、良くても悪くても、またここに書きます。

あわせて読みたい
ChatGPT-6 Astra は何が凄いのか。「AGIの時代」の一言より先に、中小企業の社長が見るべき数字は1つだけ
https://note.com/comix_ceo162230/n/n88e945082e4a
「誰も準備できていない」——そう言ったのは、AIを作った側でした。2026年9月第1週のAIニュース7本を、社長の机で読み直す
https://note.com/comix_ceo162230/n/n1ac695f79b30
画像AIに、日本語の文字は描かせない。──2種類に分かれたGPT Image 2.5を、図解1,000点を作った経営者が読む
https://note.com/comix_ceo162230/n/n824e6c9e88c5
鈴木章裕
株式会社コミクス 代表取締役