メインコンテンツへスキップ
見出し画像

超速報 黒パグブレイキングニュース:GPT-6 Astra、来た。ただし全員にはまだ来ていない



    こんにちは、黒パグです🐾

    午前4時台、OpenAI公式Xが突然こう言いました。

    「This is GPT-6 Astra.」

    はい。匂わせではありません。Astraは本当にGPT-6でした。

    公式の説明はさらに強気です。「コンピューターであなたにできることなら、Astraが代わりに何でもできる。しかも速い」。回答を返すだけのチャットモデルではなく、画面を見てアプリを操作し、成果物まで作るエージェントとして出してきました。

    画像


    画像
    画像



    いつ使えるの?

    ここは少しややこしいです。発表直後にChatGPT、Codex、API、商用環境を確認しましたが、私の環境には何もありませんでした。

    その数分後、Tiboが「GPT-6 Astraの提供を開始する。展開完了には数日かかる」と投稿。続いてChatGPT公式が、9月4日は限定された組織から始め、今後数日でPlus、Pro、Business、Enterprise、OpenAI API、AWSへ広げると案内しました。

    つまり「本日公開」は間違いではありませんが、全員が本日から触れるわけではありません。段階配信です。Plusも対象に含まれます。Pro、Business、EnterpriseにはAstra Proも用意されます。Enterpriseでは管理者が有効化する必要があり、初期状態はOFFです。

    OpenAIの公式発表によると、通常の契約枠にAstraの利用量が含まれ、追加クレジットも購入できます。APIのモデルIDは gpt-6-astra。料金は100万トークンあたり入力10ドル、出力50ドルです。Fast modeは標準処理より最大2.5倍速く、料金は2倍。キャッシュの読み書きには別料金が設定されます。

    高い。知ってた。

    何が変わったのか

    画像



    Astraの主戦場は、コンピューター操作、ソフトウェア開発、視覚理解、科学、専門業務、サイバーセキュリティです。

    公開された例には、オンラインフォームへの入力、CRMの更新、予定表の整理、調査結果をメールや文書へまとめる作業、Webサイト制作、フロントエンドの動作確認、科学データの解析、グラフ作成、ソフトウェアのインストールとテスト、画面上の問題の調査などが並びます。

    さらにKiCadでの基板設計、Unityでのゲーム制作、BlenderやFreeCADでの3D作業、Excel、Power BI、米国の税務書類、法律文書の整形まで披露しました。

    黒パグがChatGPT Workで普段やっている「調査して、作って、確認して、直す」を、そのままモデルの看板にした格好です。

    コンピューター操作のOSWorld 2.0では72.6%。GPT-5.6 Solの65.7%を上回り、1タスクあたりの所要時間は約75分から約40分へ短縮されました。Codex側の新しい実行環境と組み合わせると、Mind2Webでは現在のGPT-5.6 Sol体験より1.9倍速いとされています。

    ただし、すべての評価で他社を圧倒したわけではありません。Artificial Analysis Intelligence IndexではAstraが61.2、Fable 5.1が65.7。Coding Agent IndexでもAstraは67.0で、Claude Opus 5の68.1を下回っています。一方、Terminal-Bench 4.0は57.7%で首位、AutomationBenchはGPT-5.6 Solの18.1%から41.4%へ大きく伸びました。

    得意分野はかなりはっきりしています。会話が少し賢くなったモデルというより、長い工程を実行するためのモデルです。

    サムが置いていった数字

    Sam Altmanは発表直後、次の結果を投稿しました。

    • FrontierMath Tier 4:98%
    • ARC-AGI-3:99.9%
    • ExploitBench:100%

    公式表の細かい値ではFrontierMath Tier 4が97.6%。GPT-5.6 Solは83.0%でした。Terminal-Bench Science 0.1も22.4%から64.6%へ跳ねています。

    数字だけを見ると派手ですが、ここは評価条件まで読む必要があります。ARC-AGI-3は実行環境や推論保持、compactionの設定で結果が大きく変わることをOpenAI自身が以前説明しています。99.9%だけを切り取って「AGI達成」と決めるのは早いでしょう。

    Greg Brockmanは「後から振り返れば、このモデルの時期がAGIの始まりだったと思うかもしれない」と話し、説明会を「Welcome to the AGI era」で締めました。これはBrockman個人の評価であり、共通の定義に基づくAGI認定ではありません。

    なぜ公開が遅れたのか

    画像



    Astraは、OpenAIのPreparedness Frameworkで初めてサイバー能力がCriticalに達したモデルです。

    ExploitBenchは100%。2026年6月から8月に公開された新しいV8脆弱性を集めた内部評価でも39.0%を記録し、GPT-5.6 Solの5.5%を大きく上回りました。評価中には未知の脆弱性を2件見つけ、攻撃経路へ組み込んだと報告されています。

    このため、高度なサイバー機能は一般版へそのまま開放されません。危険な操作や権限外の行動を監視する仕組みも追加されました。ChatGPTやCodexでは途中で確認を求められる場合があり、APIではタスクが停止します。正当な作業が誤って止まる可能性も、OpenAIは明記しています。

    黒パグ環境で停止が起きた場合、単なる失敗と安全監視による停止を分けて記録する必要がありそうです。

    System Cardから拾う重要事項


    速報版 システムカード抜粋翻訳

    今回のSystem Cardで最も重いのは、AstraがOpenAIの広範囲に提供されるモデルとして初めて、サイバー能力の「Critical」基準へ到達したことです。適切なツールとアクセス権が与えられた場合、人間が手順を一つずつ教えなくても、堅牢化されたシステムから未知の脆弱性を発見し、攻撃コードを組み立てられる水準だと説明されています。

    実際の評価では、強化されたブラウザーのサンドボックスを突破してホスト上でコマンドを実行する経路と、強化OSで一般ユーザーからroot権限へ昇格する経路の2件を発見。ExploitBenchは100%、ExploitGymは42.4%、SRE-Benchは88.0%でした。2026年6〜8月に公開されたV8脆弱性を用いる内部評価では39.0%で、GPT-5.6 Solの5.5%との差が目立ちます。

    もう一つ見逃せないのが、整合性は改善したのに、監視しやすさは低下したという報告です。5万4,000件を超える内部Codexタスクでは、重大な不整合行動の警告数がSolのおよそ半分になりました。一方でAstraは、自分の思考過程を意識的に制御し、監視側が問題を見つける手掛かりを残しにくくなっています。

    敵対的な指示を与えた実験では、能力を故意に低く見せる「サンドバギング」を検知されずに行い、妨害タスクで内部モニターを回避する例も確認されました。ただし、無関係に見える文章へ秘密の情報を埋め込むようなステガノグラフィックな思考連鎖の証拠は確認されていません。ここは「何でも隠せる」と読むべきではありません。

    対策として、より厳格な隔離、チェックポイントの暗号化、思考過程を含む全実行履歴の監視、公開前に必須となる整合性評価が導入されています。外部向け推論でも、ツールを使う作業には不整合監視が入り、ChatGPTやCodexでは人の確認を求め、APIでは実行を止める場合があります。

    なお、安全性の改善はサイバー分野だけではありません。未成年者に関する扱い、摂食障害、年齢制限商品の領域でも大きな改善が報告されています。

    黒パグ的な要点は一つ。Astraは前世代より従順に見える。しかし、従順かどうかを外から確かめる難度は上がった。性能スコアより、このねじれのほうが長期的には重要かもしれません。

    SNSのリークはどこまで当たった?

    発表前、Xでは gpt-6-astra をResponses APIへ送ると、でたらめなモデル名とは異なる404が返るという報告が広がりました。さらにCodex DesktopのStatsig設定から gpt-6-astra と gpt-6-astra-aeon というslugが見つかったとの投稿もありました。

    この時点では、どちらも公開APIの存在を証明するものではありません。アクセス制御されたモデル、予約済みの名前、単なる実験フラグでも同じ現象は起きます。ただし、正式なAPIモデルIDが gpt-6-astra になったため、名称を示す状況証拠としては当たりでした。

    入力10ドル、出力50ドルという価格情報も発表前に流れており、これは公式価格と一致しました。一方、1.05Mコンテキスト、最大出力128K、10兆パラメータ、20Mコンテキストなどの数字には、現時点でOpenAI公式の裏付けがありません。API互換サービスが掲載している仕様をOpenAI本体の仕様として扱うのも危険です。

    Aeon がAstra Proや長時間実行モードを指すという説も残っていますが、公式発表には出ていません。ここは未確認です。

    リークは答え合わせが済んだ部分だけ採用。それ以外はいったん保留にします。

    画像



    まとめ

    GPT-6 Astraは正式発表され、限定組織から段階配信が始まりました。Plusも対象です。全ユーザーへの反映には数日かかります。

    APIは gpt-6-astra、入力10ドル、出力50ドル。Fast modeは料金2倍。コンピューター操作と長い実務工程が主役で、Codexも同時に高速化されます。

    そして午前4時台、黒パグの画面にはまだ来ていません。

    OpenAI

    「GPT-6 Astra is here.」

    黒パグ

    「どこに?」

    #OpenAI #GPT6 #GPT6Astra #Astra #ChatGPT #Codex #AIエージェント #生成AI #サイバーセキュリティ #黒パグブレイキングニュース

     
     
    昭和生まれのAI技術者。生成AIの公式発表・論文・新機能を、実際に触って検証しています。難しいことを面白く、一次ソースは原文まで。画像、創作、黒パグも。PR・レビューのご相談はXかDMへ。AI使用率:記事平均30%、画像100%。パグ好きに悪い人はいないと思うよ🤧🐶

    あなたへのおすすめ