
ChatGPT-6 Astra は何が凄いのか。「AGIの時代」の一言より先に、中小企業の社長が見るべき数字は1つだけ
「AGIの時代」という言葉が独り歩きしていますが、社長の机に届く変化はもっと地味です。今回の凄さは、頭が良くなったことより、AIに手が生えたこと。表計算を触り、フォームに入力し、画面をまたいで作業を進める速度が実用域に入りました。だから最初に見る数字は、難問の正答率ではなく1タスクにかかった時間です。その1つの数字を、3つの問いで読む。それだけで、入れるか見送るかは今日決められます。

なぜこのテーマか──「AGI」の一言が、社長の机の上で止まっている
米国時間の9月3日、OpenAIがGPT-6 Astraを発表しました。日本ではその日の未明から明け方にかけて情報が流れてきた形です。私が発表資料に目を通したのは朝で、出社してみたら顧問先からの質問が3件たまっていました。中身は、気味が悪いほど揃っていました。
「うちも入れるべきですか」「Claudeから乗り換えるべきですか」「これ、怖くないんですか」。
3件とも、聞きたいことは同じです。で、うちは何をすればいいのか。
ところがニュースで先に流れてくるのは、別の種類の話です。OpenAI社長のグレッグ・ブロックマン氏が「いまAGIの時代にいると感じるのは不合理ではない」という趣旨の発言をした、と報じられました。テキサス州のStargateにある10万台を超えるGPUで学習した、という話も続きます。壮大です。壮大なのですが、この2つは社長の机の上では1ミリも判断材料になりません。AGIかどうかを決めるのは、うちの会社ではないからです。

私が3件の質問に返したのは、ベンチマークの一覧表ではなく、たった1つの数字でした。OSWorld 2.0という、パソコン操作の実務をどれだけこなせるかを測る公開ベンチマークがあります。そこでの1タスクの所要時間が、Astraは約40分。前の世代のGPT-5.6 Solは約75分でした(いずれもOpenAIの発表値)。正答率も65.7%から72.6%へ上がっていますが、社長にとって効くのは所要時間が47%縮んだという事実のほうだと私は考えています。
この数字がなぜ他のどれより大事なのか。それを説明するために、去年からうかがっている現場の話を先にさせてください。
実体験──ベンチマークの一覧表を、会議室で3つの問いに書き換えた朝
以下は複数の支援先で起きたことを1社のモデルケースとして再構成しています。数字も一例として読んでください。
発表の翌朝、私は建材商社の会議室にいました。社員42名、AI担当は専務です。定例のはずが、専務は前日の夜に印刷したらしいベンチマークの一覧表をテーブルに広げて待っていました。付箋が何枚も貼ってあって、いちばん大きな字で「AGI」と書き込んである。第一声は、こうでした。「鈴木さん、これ、うちは何をすればいいんですか」。
一覧表には、数字が並んでいました。FrontierMathという数学の難問集で約98%(前世代は83%)。ARC-AGI-3という抽象推論のテストで99.9%(同7.8%)。BenchCADで95.9%。どれもOpenAIの発表値です。専務が付箋を貼っていたのも、この列でした。
私がその朝いちばんに見たのは、そのどれでもありません。OSWorldの約40分と、AutomationBenchという定型業務の指標で41.4%(前世代18.1%)という2つでした。正直に言えば、FrontierMathの98%は目に入ってすらいなかった。ここ1年、この会社で私が見てきたものが、その2つの数字の意味を先に教えてくれていたからです。
話は去年の秋にさかのぼります。この会社では、経理を長く担当されている方が、受発注フォームの入力を前の世代のパソコン操作AIに任せてみるパイロットをやっていました。仕入先ごとにWeb画面が違って、1件あたり十数分。月末は残業が常態化していました。
設計は最初から1つだけ決めていました。送信ボタンの手前で必ず止める。入力までは全部やらせて、最後の1クリックは人が押す。それだけは絶対に崩さない、と経理の方ご自身が言い切ってくださったので、私は安心して任せられました。
そして実際、その設計で助かりました。あるとき、同じ仕入先の同じ品番が2回入力されかけたことがあります。画面が似ていて、AIが1件目の完了を見落としたらしい。送信の手前で止まる設計にしていなかったら、その午後に取引先へ同じ発注が二度飛び、翌朝は謝罪の電話から始まり、経理の方はもう二度とこの手のものに触らないと決めたはずで、あの1行の設定が守ったのは業務ではなく人の意欲だったと思っています。
ただ、パイロットは3週間で止めました。事故が怖かったからではなく、単純に割に合わなかったからです。
1件の入力にAIが75分かかっていました。人がやれば十数分の作業です。しかもAIが作業している75分のあいだ、経理の方は画面を見張っていなければいけない。止まる設計にしてある以上、止まったときに押す人が必要だからです。結果として、人の時間は減らず、むしろ「見張り」という新しい仕事が増えました。彼女がこぼした一言が、この件の結論でした。「これ、私が横で座っている時間のほうが長いんです」。
なぜ75分もかかるのか。あとで画面の記録を一緒に見たら、理由は単純でした。仕入先ごとにサイトが違うので読み込みを待ち、確認のダイアログが出るたびに足が止まり、入力欄の位置が前回と少しずれているだけで探し直している。難しい判断で悩んでいたわけではなく、手がのろいだけでした。頭がもう1段賢くなっても、この75分は縮みません。縮むとしたら、手が速くなったときです。
だから私にとって、パソコン操作AIの評価軸は正答率ではなく、ずっと所要時間でした。1タスク75分は、見張る人を1人拘束する時間です。40分なら、その拘束が半分になる。公開ベンチマークのMind2Webでは前世代比1.9倍速という発表値も出ていて、方向は揃っています。これはあくまで発表値からの見立てですが、「見張り時間が半分になる」という言い方なら、経理の方にも専務にも同じ意味で伝わります。

会議室に戻ります。私は専務の一覧表を裏返して、白い面に3行だけ書きました。①社員の手を増やすか。②請求書を変えるか。③会社を危なくするか。そして、表に並んでいた数字を、この3行のどこかに振り分けてもらいました。
FrontierMathの98%も、ARC-AGI-3の99.9%も、どの行にも入りませんでした。専務が自分で「これ、うちの商売には関係ないですね」と言って線を引いたとき、部屋の空気が変わりました。数字が減った瞬間に、判断ができる形になったからです。
残ったのは、OSWorldの約40分と、AutomationBenchの41.4%と、料金の話と、後で触れる安全側の話だけでした。付箋だらけのA4が、3行になった。専務はその紙をそのまま持って帰って、翌週の役員会に出しました。
そのとき専務が最後にした質問が、いい質問でした。「じゃあ、うちは今月これを入れるんですか」。私の答えは、入れるかどうかより先に、去年止めたあのパイロットをもう一度だけ設計し直しませんか、というものでした。同じ業務、同じ止め方、変えるのは所要時間だけ。比べる相手が去年の自社の記録なら、他社の事例を集め回らなくても判断がつきます。うちの会社の去年が、いちばん条件の揃った比較対象です。
手法A──ベンチマークを「社長の机」に翻訳する3つの問い
あの朝に書いた3行を、そのまま使える形にしておきます。新しいモデルが出るたびに、この3つで読めば足ります。
①社員の手を増やすか。 見る数字は3つです。OSWorld 2.0(パソコン操作の実務・Astra 72.6%/約40分、前世代 65.7%/約75分)、AutomationBench(定型業務・41.4%/18.1%)、ScreenSpot-Pro(画面上のどこを押すかを正しく認識できるか・92.7%/76.9%)。いずれもOpenAIの発表値です。OpenAIが「手」の例として挙げたのは、フォーム入力、CRMの更新、カレンダー整理、Webリサーチ、メールや文書の下書き、そして既存テンプレートに沿った資料作成で、テンプレどおりの資料づくりは歴代でいちばん得意だと説明しています。
この3つは、そのまま現場の言葉に置き換わります。OSWorldの所要時間は「見張る人の拘束時間」。AutomationBenchは「請求書の転記や受発注入力のような、うちで毎日発生している作業がどれくらい通るか」。ScreenSpot-Proは「画面を押し間違えないか」。ちなみにAutomationBenchの41.4%は、裏を返せば6割は通らないという意味です。全部任せる数字ではなく、任せる業務を選ぶ数字として読みます。
②請求書を変えるか。 発表によれば、既存のサブスクリプションの利用枠内で使えて、超過分はクレジット購入。APIは入力100万トークンあたり10ドル、出力50ドル、モデル名はgpt-6-astra。速さを買うFast modeは料金2倍で約2〜2.5倍速です。同じ資料を繰り返し読ませるキャッシュ入力は100万トークンあたり1ドルで、一度に扱える文脈は約105万トークン(APIドキュメントの記載)。過去2年分の議事録をまとめて読ませる、という使い方が料金の上でも現実的になりました。ここで社長が決めるのは1つだけで、Fast modeを使ってよい業務を先に決めておくかどうか。締切が動かない月末処理だけは2倍料金を許す、といった線を引いておかないと、請求書が来てから驚くことになります。
③会社を危なくするか。 ここが今回いちばん見落とされている列です。OpenAIは自社のPreparedness Frameworkで、サイバー能力が初めて「Critical」水準に達したと公表しました。人の監督なしに未知の脆弱性を見つけて悪用しうる、という水準です。評価の過程で、まだ誰も知らなかったゼロデイ脆弱性を2件見つけたとも報告されています。攻撃的なサイバー作業は拒否し、防御側のパートナー(Daybreak)へ段階的に提供し、監視を追加し、不整合監視が未承認の行動を自動停止する(APIではタスクを止める)と説明されています。あわせて、難しい課題を与えたときに許可された範囲を超えてしまう割合が、内部評価で前世代の48%から0%になったとも公表されました。本番のガードレールを外した内部条件での比較なので、一般利用で誤動作がゼロという意味ではなく、あくまで「勝手なことをしない方向に鍛えた」という報告として読んでいます。
ここで大事なのは、この話が現場に届く形です。OpenAI自身が、追加の安全チェックは正当な作業を遅延・中断させることがある、と発表資料に明記しています。つまり、うちの社員が真っ当な作業をさせているのに、AIが途中で止まる日がある。これを事前に伝えていないと、現場は「壊れた」と判断して使うのをやめます。
FrontierMathとARC-AGI-3は、この3行のどこにも入りません。社長の机には来ない数字です。それから、Astraが全部で最強というわけでもありません。Humanity's Last Exam は57.2%で、Claude Fable 5.1 の65.0%が上。Artificial Analysis Intelligence Index v4.1.1 も61.2 対 65.7 で Fable 5.1 が上でした(いずれも公開ベンチマーク)。開発者向けのCodexも「これまでで最良のソフトウェアエンジニアリングモデル」として、要約で圧縮せずメモを保持し過去のやり取りを検索できる実験的な仕組みが入りましたが、これも社長の机の話ではなく、開発現場の話です。

手法B──触る前に決める3つ(60分で終わります)
3つの問いで読んだら、次は触る前に決めることです。順番に決めれば60分で終わります。
1つめ、Enterpriseの有効化を誰が判断するか。 発表によれば、Enterpriseでは提供開始の時点で既定オフになっていて、管理者が有効化しないと社員は使えません。これは親切な設計です。ただし放っておくと、情シス担当が「便利そうだから」で入れるか、逆に誰も判断しないまま3か月経つかのどちらかになります。決めるのは、有効化のボタンを押す人と、押す前に埋める1枚です。1枚に書くのは3行で足ります。どの部署のどの業務で使うか。止めるときは誰が判断するか。1か月後に何の数字を見て継続を決めるか。この3行を埋めずに有効化すると、全社に配ったあとで「誰が何に使っているのか分からない」状態になり、結局そこから止めるかどうかの議論が始まります。
2つめ、パソコン操作AIに渡す作業指示書。 ここがいちばん抜けます。指示書に必要なのは4ブロックです。開始条件(何が揃ったら始めてよいか)、触ってよい画面、止まる条件(送信・登録・削除・支払の手前)、報告形式(件数・所要時間・止まった箇所)。なお、どこまで見せるかという権限の線引きそのものは前回の記事で書いたので、ここでは繰り返しません。線引きが済んでいる前提で、その中の1つの業務をどう渡すかを書くのが指示書です。

3つめ、初週は全面切替しない。1週間パイロット。 対象は1業務、参加者は3名以内、測る数字は1つだけ。合格基準と撤退基準を数字で先に書いておきます。ここで効いてくるのが、さきほどの「安全チェックで止まる」話です。パイロット中に止まったら、それは故障ではなく仕様だと現場が知っていること。知らないと1回目の停止でパイロットごと終わります。
もう1点、日本の会社としての注意です。発表デモは米国の税務申告など米国の手続きが中心だったと報じられています。日本の申告や行政手続きの画面で同じように動くかどうかは、各社で確かめる必要が出てきます。パイロットの対象業務を選ぶときは、社内の画面から始めるのが無難です。
私自身の配置も書いておきます。考える役(司令塔)は Claude Fable 5.1 のまま動かしません。設計と判断はここでやると決めているからです。そのうえでAstraは「手」の役として、画面をまたぐ作業を任せられるかどうかを検討する枠に置いています。頭を入れ替える話ではなく、手を1本足すかどうかの話として見ています。
最初の一歩──社長自身が今日やる1つ
読んで終わりにしないために、今日やることを1つだけ決めます。発表記事を、自分の会社の机の言葉に翻訳させることです。
あの朝の建材商社の専務も、結局これを毎回やっています。新しいモデルが出るたびに記事を貼って、うちの業務3つを声で言って、3行の表にして出す。5分で終わります。音声入力で構いません。
あなたは、中小企業の社長の隣に座っている経営コンサルタントです。
これから貼る「新しいAIモデルの発表内容」を、うちの会社の机の言葉に翻訳してください。
【ここに発表記事・ニュース記事を貼る】
うちで、いま人手がかかっている業務は次の3つです。
【ここに話す:業務1】
【ここに話す:業務2】
【ここに話す:業務3】
出力は次の表だけにしてください。専門用語は使わず、役員会でそのまま読める日本語で書いてください。
| 問い | 発表値と出典 | うちの業務への影響 | 今月やること |
|---|---|---|---|
| 1. 社員の手を増やすか | | | |
| 2. 請求書(コスト)を変えるか | | | |
| 3. 会社を危なくするか | | | |
表の下に「今月は見送ってよい理由」を1行だけ書いてください。
根拠が発表資料にない項目は、空欄にせず「発表資料に記載なし」と書いてください。
推測で数字を埋めることは禁止します。出てきた表を見て、3行のどこにも入らない数字が多ければ、その発表はうちには関係がなかったということです。判断としては、それで十分です。
実践プロンプト集──現場に配る4本
社長が翻訳を済ませたら、あとは現場に渡す道具です。4本あります。上から順に使うと、棚卸し→指示書→パイロット→点検の1周がそのまま回ります。
1本目は棚卸しです。建材商社では、専務が部門長3人に業務リストを出させて、これで採点しました。どの業務から渡すかを人の勘で決めると、たいてい「いちばん面倒な業務」から始めて失敗します。
あなたは、業務改善のコンサルタントです。
これから貼る業務リストを、「パソコン操作AIに任せられるか」の観点で採点してください。
【ここに業務リストを貼る(1行1業務、10〜30件)】
採点の軸は3つです。
・画面数:その業務で開く画面やシステムの数(1〜2/3〜5/6以上)
・判断の有無:人の判断が要るか(不要/条件を決めれば不要/毎回必要)
・取り消し可否:間違えたときに戻せるか(すぐ戻せる/申請すれば戻せる/戻せない)
出力は表1つだけにしてください。
| 業務 | 画面数 | 判断の有無 | 取り消し可否 | 渡す順位 | 理由(30字以内) |
「渡す順位」は、画面数が多く・判断が不要で・戻せる業務ほど上位にしてください。
「戻せない」業務は順位に関係なく最下段にまとめ、理由の欄に「人が押す」と明記してください。2本目が作業指示書です。棚卸しで1位になった業務について、これを作ってから渡します。指示書がないままAIに仕事を渡すのは、新人にマニュアルなしで受発注をやらせるのと同じで、うまくいかなかったときに誰も原因を説明できません。
あなたは、パソコン操作AIに仕事を渡す前の作業指示書を作る担当者です。
社内でAIに見せてよい範囲はすでに決まっている前提で、次の業務の指示書を穴埋めで完成させてください。
対象業務:【ここに業務名を書く】
使う画面・システム:【ここに書く】
出力は次の4ブロックだけにしてください。各ブロックは箇条書きで3〜5行。
■ 開始条件(何が揃ったら始めてよいか。ファイル名・置き場所・担当者名まで具体的に)
■ 触ってよい画面(決定済みの範囲を、そのまま画面名で書き写す)
■ 止まる条件(送信・登録・削除・支払の手前で必ず止まる。止まったら誰に何を伝えるか)
■ 報告形式(終わったら何を残すか。件数・所要時間・止まった箇所・画面の記録の有無)
最後に、この指示書を現場でそのまま読み上げて渡せる「1分説明」を5行で書いてください。3本目はパイロット計画です。管理者が使います。1週間で終わらせて、続けるか撤退するかを数字で決める設計にしておくと、社内の議論が短くなります。
あなたは、社内のAI導入を管理する情報システム担当です。
新しいAIモデルを1週間だけ試すパイロット計画を作ってください。全面切替はしません。
対象業務:【ここに書く】
参加者:【ここに書く(3名以内)】
現在の所要時間:【1件あたり何分・1日何件】
出力は次の表だけにしてください。Day1からDay7まで7行。
| 日 | やること | 担当 | 合格基準(数字で) | 撤退基準(数字で) |
表の下に3行だけ書いてください。
・このパイロットで測る数字(1つだけ選ぶ)
・撤退したときに元へ戻す手順
・1週間後に社長へ報告する1行の文面(案)
安全側のチェックで作業が途中で止まる場合があります。それは故障ではなく仕様として扱い、
Day1のやることに「止まったときの連絡先を全員に伝える」を必ず入れてください。4本目は点検です。パイロット中、1日の終わりに5分だけやります。建材商社では経理の方が毎日これを回して、3日目に二重実行を1件見つけました。見つかったこと自体が、パイロットが機能している証拠です。
あなたは、AIの作業ログを点検する監督者です。
これから貼る操作ログを読み、危ない操作だけを拾い出してください。
【ここに操作ログを貼る】
出力は表1つだけにしてください。
| 時刻 | 操作の内容 | 分類 | 危険度(高/中/低) | 人がやること |
分類は次の3つだけです。
・危ない操作(削除・送信・外部への公開・支払・設定変更)
・二重実行(同じ登録や送信が2回以上)
・未完了(途中で止まったまま、報告のないもの)
該当がない分類は「該当なし」と1行書いてください。
危険度「高」が1件でもあれば、表の下に「今日中に人がやること」を3行で書いてください。
ログに書かれていない操作を推測して補うことは禁止します。変化──フォーム入力の午後が、確認の5分になるとしたら
ここからは、あの建材商社で今後どうなりそうかという見立てです。実測ではなく、発表値から引いた線として読んでください。
去年のパイロットでは、1件の受発注入力にAIが75分かかり、そのあいだ経理の方が画面の前に座っていました。人の作業時間は減らないどころか、見張りという仕事が増えた。だから止めました。
発表値どおりの所要時間になるなら、この75分が40分前後になります。40分でも「見張る」なら割に合いません。ただ、40分になると別の運用が現実味を帯びてきます。朝に3件まとめて投げて、昼前に止まっているところだけ確認する。1件ごとに横で見ているのではなく、止まった箇所だけを拾う運用です。
余談ですが、経理の方が最初に喜んだのは時間ではなく、月末に定時で帰れる日が1日でも増えることでした。
そうなると、経理の方の午後は「入力の午後」ではなく「確認の5分」に変わります。5分というのは、さきほどの点検プロンプトを1回回す時間です。もちろん、AutomationBenchの41.4%が示すとおり、6割は通りません。通らない業務は人がやる。それでいい。全部を渡そうとするから失敗するのであって、4割が通れば月末の山は確実に低くなります。
変わらないものも書いておきます。止まる場所は変わりません。送信・登録・削除・支払の手前で人が押す設計は、AIが速くなっても外しません。むしろ速くなるほど外せなくなります。間違いも同じ速さで進むからです。去年のパイロットで助かったのは、AIが遅かったからではなく、止める場所を先に決めてあったからでした。速さが変えるのは見張りの負担であって、責任の置き場所は動きません。

経営者へのメッセージ──決めるのは「どの手を、どこまで貸すか」
AGIかどうかは、社長が決める問いではありません。決めても、明日の受発注は1件も減りません。
社長が決めるのは、どの手をどこまで貸すか。それだけです。貸す業務を1つ選び、止まる場所を決め、1週間だけ試す。3つとも、今日中に決められます。
今回の発表で私が本当に大きいと思ったのは、Criticalという水準の話が出てきたことです。能力が上がると、危険も同じだけ上がる。それを開発した側が公表し、しかも「安全チェックが正当な作業を止めることがある」とまで書いた。これは、うちのような会社にとっては朗報です。止まる仕組みが最初から入っているなら、あとは止まったときに誰が押すかを決めるだけで済むからです。
逆に言えば、決めていない会社では、止まった瞬間に現場が黙って使うのをやめます。事故は起きません。ただ、何も変わらないまま1年が過ぎます。
うちのような規模の会社にとって、新しいモデルが出ることの意味は、選択肢が1つ増えることに尽きます。増えた選択肢を全部試す人手はありません。だから、選択肢が増えたときこそ、机の上の紙を3行に減らす作業がいります。減らせる社長のところには、次の発表が来ても慌てる理由がない。この差は、半年もすると業務の速さの差になって出てきます。
締め
発表の翌朝、あの会議室で専務が一覧表を裏返した瞬間のことを、私はしばらく覚えていると思います。付箋だらけのA4が、3行になった。数字が増えたときではなく、減ったときに人は判断できるようになる。……と書くと大げさですが、実際にあの部屋で起きたのはそれだけのことでした。
新しいモデルは、これからも数か月おきに出ます。そのたびに一覧表が配られ、AGIという言葉が飛び交います。そのたびに、うちの机の言葉に翻訳し直す。翻訳の型を1つ持っていれば、次の発表はもう怖くありません。

AIに手が生えた朝に、社長がやることは1つです。貸す手を1本だけ選んで、止まる場所を決めて、来週の月曜から1週間だけ試してみる。その1週間が終わったとき、机の上には数字が残ります。判断は、そこから始まります。
あわせて読みたい
Claude Fable 5.1 は何がすごいのか。発表翌日に司令塔を入れ替えた経営者が、公式資料と現場の声を全部読んで分かった9つの癖
https://note.com/comix_ceo162230/n/n028e71d6b99b
AIの新機能は、追いかけるほど遅れる。毎週の更新を「4つの箱」で仕分ける経営の型
https://note.com/comix_ceo162230/n/nb3cc206daaa7
調べ物はGemini、社内資料はNotebookLM、考える相棒はClaude。生成AIを"使い分けた"瞬間、残業が消えた。
https://note.com/comix_ceo162230/n/n9a53e5963c89
鈴木章裕
株式会社コミクス 代表取締役