メインコンテンツへスキップ
見出し画像

OpenAI Codex の概要

    以下の記事が面白かったので、簡単にまとめました。

    ・Introducing Codex

    1. Codex

    本日 (2025年5月16日)、クラウドベースのソフトウェアエンジニアリングエージェント「Codex」のリサーチプレビュー版をリリースします。「Codex」は、複数のタスクを並行して処理できます。「Codex」は、「機能の開発」「コードベースに関する質問への回答」「バグ修正」「レビューのためのプルリクエストの提案」といったタスクを、ユーザーに代わって実行します。各タスクは、ユーザーのリポジトリがプリロードされた専用のクラウドサンドボックス環境で実行されます。

    「Codex」は、ソフトウェアエンジニアリング向けに最適化されたo3である「codex-1」を搭載しています。「codex-1」は、様々な環境における実際のコーディングタスクで強化学習を用いて学習しており、人間のスタイルやプルリクエストの好みを忠実に反映したコードを生成し、指示に正確に従い、合格するまでテストを反復的に実行できます。

    本日より、「ChatGPT Pro」「Enterprise」「Team」向けに「Codex」の提供を開始し、「Plus」「Edu」にも近日中にサポートを開始します。

    Codexのデモの動画。日本語字幕付き pic.twitter.com/NABF4rOWDk

    — d (@d_1d2d) May 16, 2025

    2. Codex のしくみ

    現在、ChatGPTのサイドバーから「Codex」にアクセスし、プロンプトを入力して「コード」をクリックすることで、新しいコーディングタスクを割り当てることができます。コードベースについてCodexに質問したい場合は、「確認を求める」をクリックしてください。各タスクは、コードベースがプリロードされた独立した環境で個別に処理されます。「Codex」は「ファイルの読み取り」と「編集」に加え、「テストハーネス」「リンター」「型チェッカー」などのコマンドの実行も可能です。タスクの完了には、複雑さに応じて通常1分から30分かかります。また、「Codex」の進行状況はリアルタイムで監視できます。

    「Codex」はタスクを完了すると、その変更を環境にコミットします。「Codex」は、ターミナルログとテスト出力を引用することで、アクションの検証可能な証拠を提供するため、タスク完了中の各ステップを追跡できます。その後、結果を確認したり、追加の修正を依頼したり、GitHubプルリクエストを送信したり、変更をローカル環境に直接統合したりできます。製品では、Codex環境を実際の開発環境に可能な限り近づけるように設定できます。

    画像

    「Codex」は、リポジトリ内に配置した「AGENTS.md」によって動作を制御できます。これは「README.md」に似たテキストファイルで、「Codex」に「コードベースのナビゲーション方法」「テストで実行するコマンド」「プロジェクトの標準プラクティスへの準拠方法」を指示できます。人間の開発者と同様に、「Codex」エージェントは、構成済みの開発環境、信頼性の高いテスト環境、そして明確なドキュメントが提供されている場合に最高の性能を発揮します。

    コーディング評価と社内ベンチマークにおいて、「codex-1」は「AGENTS.md」やカスタムスキャフォールディングがなくても優れた性能を示しています。

    画像

    3. 安全で信頼できるエージェントの構築

    OpenAIでは、反復的な展開戦略に沿って、「Codex」をリサーチプレビューとしてリリースします。「Codex」の設計においては、ユーザーが出力を検証できるようにセキュリティと透明性を重視しました。これは、AIモデルがより複雑なコーディングタスクを独立して処理し、安全性に関する考慮事項が進化するにつれて、ますます重要になる安全策です。ユーザーは、引用、ターミナルログ、テスト結果を通じて「Codex」の動作を確認できます。不明な点がある場合やテストに失敗した場合、「Codex」エージェントはこれらの問題を明示的に通知するため、ユーザーは情報に基づいた判断を下すことができます。ただし、統合および実行前に、エージェントが生成したすべてのコードをユーザーが手動で確認および検証することは依然として不可欠です。

    画像
    画像

    3-1. 人間の好みへの適合

    「codex-1」の学習における主な目標は、出力結果を人間のコーディングの好みや標準に近づけることでした。o3と比較して、「codex-1」は常によりクリーンなパッチを生成し、人間によるレビューや標準ワークフローへの統合をすぐに行えるようになります。

    3-2. 悪用防止

    マルウェア開発など、AI駆動型ソフトウェアエンジニアリングの悪意ある応用に対する保護は、ますます重要になっています。同時に、保護対策が、低レベルカーネルエンジニアリングなど、マルウェア開発にも使用される可能性のある技術を含む、正当かつ有益な応用を不当に妨げないようにすることも重要です。

    安全性と有用性のバランスをとるため、「Codex」は、悪意のあるソフトウェア開発を目的としたリクエストを識別し、正確に拒否する一方で、正当なタスクを明確に区別してサポートするように学習されています。また、ポリシーフレームワークを強化し、厳格な安全性評価を導入することで、これらの境界を効果的に強化しました。これらの評価を反映し、o3システムカードの補遺を公開しました。

    3-3. セキュアな実行

    「Codex」エージェントは、クラウド内の安全で隔離されたコンテナ内で完全に動作します。タスク実行中はインターネットアクセスが無効化され、エージェントのインタラクションはGitHubリポジトリから明示的に提供されたコードと、ユーザーがセットアップスクリプトで設定したプリインストール済みの依存関係のみに制限されます。エージェントは外部のWebサイト、API、その他のサービスにアクセスすることはできません。

    4. 初期のユースケース

    OpenAIの技術チームは、日常業務のツールキットの一部として「Codex」を使い始めています。OpenAIのエンジニアは、リファクタリング、名前変更、テスト作成など、スコープが明確に定められた反復的なタスクをオフロードするために「Codex」を最も頻繁に使用しています。これらのタスクは、集中力を途切れさせてしまう可能性があります。「新機能のスキャフォールディング」「コンポーネントの配線」「バグ修正」「ドキュメント作成」にも同様に有効です。チームは「Codex」を活用し、「オンコールの問題のトリアージ」「1日の業務開始時のタスク計画」「バックグラウンド作業のオフロード」といった新しい習慣を身につけつつあります。コンテキストスイッチを減らし、忘れられたToDoを可視化することで、「Codex」はエンジニアがより迅速にリリースし、最も重要なことに集中できるよう支援します。

    リリースに先立ち、少人数の外部テスターグループと協力し、多様なコードベース、開発プロセス、そしてチームにおけるCodexのパフォーマンスをより深く理解する取り組みを進めてきました。

    4-1. Cisco

    エンジニアリングチームが野心的なアイデアをより迅速に実現するために、「Codex」がどのように役立つかを検討しています。初期の設計パートナーとして、「Cisco」は自社の製品ポートフォリオ全体にわたる実際のユースケースでCodexを評価し、OpenAI チームにフィードバックを提供することで、Codexの将来像を形作ることに尽力しています。

    4-2. Temporal

    「Codex」を使用して機能開発の加速、問題のデバッグ、テストの作成と実行、大規模なコードベースのリファクタリングを行っています。また、複雑なタスクをバックグラウンドで実行することで、エンジニアの集中力を維持し、反復処理を高速化しています。

    4-3. Superhuman

    テストカバレッジの向上や統合エラーの修正といった、小規模ながらも反復的なタスクを高速化するために「Codex」を使用しています。さらに、コードレビューを除き、プロダクトマネージャーがエンジニアを介入させることなく軽量なコード変更を行えるようにすることで、より迅速なリリースを支援しています。

    4-4. Kodiak

    「Codex」を活用してデバッグツールの作成、テストカバレッジの向上、コードのリファクタリングを行い、自動運転技術である Kodiak Driver の開発を加速させています。Codex はまた、関連するコンテキストや過去の変更点を明らかにすることで、エンジニアがスタックの馴染みのない部分を理解するのに役立つ貴重な参照ツールにもなっています。

    初期のテスターからの知見に基づき、モデルの機能を効果的に探索するために、スコープを明確化したタスクを複数のエージェントに同時に割り当て、さまざまな種類のタスクやプロンプトを試用することを推奨しています。

    5. Codex CLI のアップデート

    先月、ターミナルで動作する軽量なオープンソースコーディングエージェント「Codex CLI」をリリースしました。o3やo4-miniなどのモデルのパワーをローカルワークフローに導入し、簡単に組み合わせてタスクをより迅速に完了できます。

    本日、「codex-1」の小型版もリリースしました。これは、「Codex CLI」専用に設計された「o4-mini」のバージョンです。この新しいモデルは、CLIでのワークフローの高速化をサポートし、低レイテンシのコード Q&A と編集に最適化されています。指示の追従性とスタイルに関する強みはそのままに、この新しいモデルは現在「Codex CLI」のデフォルトモデルとして、また API では「codex-mini-latest」として利用可能です。基盤となるスナップショットは、「Codex-mini」の継続的な改良に伴い、定期的に更新されます。

    また、開発者アカウントを「Codex CLI」に接続するのも非常に簡単になりました。APIトークンを手動で生成・設定する代わりに、ChatGPTアカウントでサインインし、使用するAPI組織を選択できるようになりました。 APIキーは自動的に生成・設定されます。ChatGPTを使用して「Codex CLI」にサインインした「Plus」「Pro」は、本日から30日間、それぞれ5ドルと50ドル分の無料APIクレジットを受け取ることができます。

    6. Codex の提供状況 ・ 価格 ・ 制限事項

    本日より、「Pro」「Enterprise」「Team」に「Codex」を展開いたします。「Plus」「Edu」 のサポートも近日中に開始いたします。今後数週間は、追加費用なしで「Codex」の機能を体験できます。その後、レート制限付きのアクセスと、オンデマンドで追加使用量を購入できる柔軟な価格設定オプションを導入いたします。

    「codex-mini-latest」を使用して開発を行う開発者は、このモデルを 「Responses API」で利用できます。

    ・入力 : $ 1.50 / 100万トークン
    ・出力 : $6 / 100万トークン
    ・プロンプトキャッシュ割引は 75%

    「Codex」はまだ開発初期段階です。リサーチプレビュー版であるため、フロントエンド作業用の画像入力や、エージェントの動作中に軌道修正する機能などは未対応です。また、リモートエージェントへの委任は対話型編集よりも時間がかかるため、慣れるまでに時間がかかる場合があります。時間の経過とともに、「Codex」エージェントとのインタラクションは、同僚との非同期コラボレーションに似たものになるでしょう。モデルの機能が進化するにつれて、エージェントはより複雑なタスクを長期間にわたって処理できるようになると予想されます。

    7. 今後の展望

    「Codex CLI」などのAIツールとの連携は急速に業界標準となり、開発者のコ​​ーディング作業のスピード向上に貢献しています。しかし、「Codex」がChatGPTに導入した非同期マルチエージェントワークフローは、エンジニアが高品質なコードを作成するための事実上の標準となると確信しています。

    最終的には、「リアルタイムペアリング」と「タスク委任」という2つのインタラクションモードが融合すると考えています。開発者は、IDEや日常的に使用するツールを介してAIエージェントと連携し、質問したり、提案を得たり、長時間のタスクをオフロードしたり、これらをすべて統合されたワークフローで実行できるようになります。

    今後は、よりインタラクティブで柔軟なエージェントワークフローを導入する予定です。開発者は、タスクの途中でガイダンスを提供したり、実装戦略について共同作業を行ったり、進捗状況をプロアクティブに把握したりできるようになるでしょう。また、既にご利用いただいているツールとのより緊密な連携も視野に入れています。現在、「Codex」はGitHubと連携しており、まもなく「Codex CLI」「ChatGPT Desktop」、さらには課題追跡ツールやCIシステムなどのツールからもタスクを割り当てられるようになります。

    次回



     
     

    npaka

     
     
    プログラマー。iPhone / Android / Unity / ROS / AI / AR / VR / RasPi / ロボット / ガジェット。年2冊ペースで技術書を執筆。アニソン / カラオケ / ギター / 猫 twitter : @npaka123

    あなたへのおすすめ