
OpenAI API と Agents SDK による Voice Agent の構築
「OpenAI API」と「Agents SDK」で「Voice Agent」を構築する手順についてまとめました。
1. Voice Agent
「OpenAI API」と「Agents SDK」を使用することで、顧客サポートや言語指導などのアプリケーション向けの強力でコンテキスト認識型の「Voice Agent」を作成することができます。
2. アーキテクチャの選択
OpenAIは、「Voice Agent」を構築するための2つの主要アーキテクチャを提供しています。
・Speech-to-Speech (マルチモーダル)
・Chained (Speech-to-Text → LLM → Text-to-Speech)
2-1. Speech-to-Speech (マルチモーダル)
オーディオ入力と出力を直接処理し、単一のマルチモーダルモデル「gpt-4o-realtime-preview」で音声をリアルタイムで処理します。このモデルは音声で考え、応答します。ユーザー入力の文字起こしに依存せず、感情と意図を聞き取り、ノイズを除去し、音声で直接応答します。このアプローチは、高度にインタラクティブで低レイテンシの会話型ユースケースに最適です。
このアーキテクチャの強みは次のとおりです。
・低遅延のインタラクション
インタラクティブで非構造化の会話に最適
・豊富なマルチモーダル理解(音声・テキスト同時)
言語指導とインタラクティブな学習体験に最適
・自然でスムーズな会話の流れ
会話による検索と発見に最適
・音声コンテキストの理解によるユーザー体験の向上
インタラクティブなカスタマー サービスに最適
2-2. Chained (Speech-to-Text → LLM → Text-to-Speech)
オーディオを順番に処理し、オーディオをテキストに変換し、LLMを使用してインテリジェントな応答を生成し、テキストをオーディオに変更します。「Voice Agent」の構築を初めて行う場合は、この予測可能なアーキテクチャをお勧めします。ユーザー入力とモデルの応答はどちらもテキスト形式であるため、文字起こしを使用して、アプリケーションで何が起こるかを制御できます。また、既存の LLMベースのアプリケーションを「Voice Agent」に変換する信頼性の高い方法でもあります。
次のようにモデルを連鎖させています。
gpt-4o-transcribe → gpt-4o → gpt-4o-mini-tts
このアーキテクチャの強みは次のとおりです。
・高度な制御と透明性
特定のユーザー目標に焦点を当てた構造化されたワークフローに最適
・堅牢なFunction Callingと構造化されたインタラクション
カスタマー サポートに最適
・信頼性が高く予測可能な対応
販売とインバウンドのトリアージに最適
・拡張会話コンテキストのサポート
文字起こしとスクリプト化された応答を含むシナリオに最適
3. Voice Agent の構築
3-1. Speech-to-Speech (マルチモーダル)
「Speech-to-Speech」の「Voice Agent」を構築するには、次のものが必要です。
・リアルタイムデータ転送用の接続を確立
・Realtime API を使用してリアルタイムセッションを作成
・リアルタイムオーディオ入出力機能を備えた OpenAI モデルを使用
開始するには、「Realtime API ガイド」と「Realtime API リファレンス」を参照してください。互換性のあるモデルには、「gpt-4o-realtime-preview」と「gpt-4o-mini-realtime-preview」が含まれます。
3-2. Chained (Speech-to-Text → LLM → Text-to-Speech)
完全な例については、「Agents SDK voice agents quickstart」を参照してください。
この例では、次の操作を行います。
・音声をテキストに変換するには、speech-to-textモデルを使用。
・通常はエージェントワークフローであるコードを実行して結果を生成。
・text-to-speechモデルを使用して、結果のテキストを音声に戻す。
4. OpenAI API と Agentシステム
Agentシステムの構築には、「Model」「Tool」「知識と記憶」「オーディオとスピーチ」「Guardrail」「オーケストレーション」といった複数の分野にわたるコンポーネントを組み合わせて構築します。OpenAI は、それぞれの分野に対して組み合わせ可能な基本要素を提供しています。
・Model
推論、意思決定、マルチモーダル認識が可能なコアインテリジェンス
o1、o3-mini、GPT-4.5、GPT-4o、GPT-4o-mini
・Tool
世界とのインターフェース
Function Calling、Web search、File search、Computer use
・知識とメモリ
外部および永続的な知識を保持。
Vector Store、File search、Embedding
・オーディオとスピーチ
音声を理解し、自然言語で応答
Audio API, Realtime API
・Guardrail
無関係、有害、望ましくない行動を防ぐしくみ
Moderation API
・オーケストレーション
Agentの開発、展開、監視、改善。
Agent SDK、トレース、評価、ファインチューニング
