メインコンテンツへスキップ
見出し画像

Azure AI Voice Live API 一般提供  音声エージェントを強化する

    ついにGAしました。マルチモデルでのエージェント利用がふえそう

    概要

    本日、Voice Live API の一般提供開始を発表します。
    このAPIは、生成AIモデルを活用し、リアルタイムの音声対音声の会話体験を統合されたAPIとして提供します。
    開発者は、Azure AI Foundry Agent Service で構築した任意のエージェントに簡単に音声機能を追加できるようになりました。

    Azure AI Foundry Agent Service は、エージェントに意思決定、ツール呼び出し、ワークフロー実行を可能にします。従来必要だった複数コンポーネントの統合を不要にし、Voice Live API は低遅延のエンドツーエンド音声ソリューションを提供します。

    新機能と改善点

    生成AIモデルとの統合

    • GPT-4o-Realtime を含む最新モデルをネイティブにサポート。

    • 開発者は GPT-Realtime、GPT-5、GPT-4.1、Phi などを選択可能。

    • モデルは完全にマネージドで、デプロイや容量計画は不要。

    料金プラン別サポートモデル

    画像

    140以上の言語に対応

    Voice Live API は、140以上の言語/ロケールでの音声入力に対応しました。
    サポートされるすべての言語は、設定で確認できます。

    多言語モデルを利用した自動多言語設定がデフォルトで有効になっています。

    画像
    日本語もサポートされてます!

    Custom Speech との統合

    開発者はユースケースごとに入力・出力を柔軟に制御する必要があります。
    2025年5月に提供開始された Custom Voice に加え、Voice Live API は Custom Speech ともシームレスに統合され、より高精度な音声認識を実現します。

    • フレーズリストを利用して音声入力の認識精度を向上

    • カスタム辞書を使って音声合成の発音を調整

    • これらはすべて 追加のモデル学習なしで実現可能

    👉 詳しくはVoice Live API での音声・音声モデルのカスタマイズ方法を参照してください。

    Natural HD voices の強化

    Azure AI Speech の Neural HD voices は、文脈を理解し、自然で表現力豊かな体験を提供するよう設計されています。
    音声エージェント用途に最適で、今回の V2 アップグレードにより、以下の機能が追加されました:

    • 自然なポーズ

    • フィラー(えー、あのーなど)

    • 話し方の切り替え時のシームレスな移行

    すべて Voice Live API で利用可能です。

    割り込み検知のための VAD 機能改善

    Voice Live API には、新たに セマンティック音声活動検出(VAD) が追加されました。
    会話中のポーズやフィラーを賢く認識し、発話の区切りをより正確に判定できます。

    • 英語(en-US)での多言語フィラーデータ評価では、従来比 約20%の精度向上を達成。

    • セマンティックVADを n-best パイプラインに統合し、有意味な発話とノイズ的なフィラーを区別可能。

    • マルチリンガルかつ雑音の多い環境でも、遅延追跡やセグメンテーション精度が向上。

    4K アバター対応

    Voice Live API は、ストリーミングアバターとの効率的な統合を可能にします。
    最新の更新により、高精細4Kビデオモデルがサポートされました。

    👉 詳細はアバター更新情報を参照してください。

    関数呼び出しと Foundry Agent Service との統合強化

    Voice Live API は、開発者が選択した生成AIモデルでの関数呼び出しをサポートします。
    今回のリリースで以下が改善されました:

    • 非同期関数呼び出しの強化

    • Azure AI Foundry Agent Service との統合改善(エージェントの作成・運用を容易に)

    👉 詳しくはAzure AI Foundry Agent Service を用いたリアルタイム音声エージェント作成ガイドを参照してください。

    開発者向けリソースと利用可能リージョンの拡大

    • 開発者リソースは C# と Python で提供(今後さらに追加予定)

    • Voice Live API は以下の新リージョンで利用可能になりました:

      • Australia East, East US, Japan East, UK South

    • 既存サポートリージョン:

      • Central India, East US 2, South East Asia, Sweden Central, West US 2

    👉 各リージョンごとのサポート機能はドキュメントを参照してください。

    画像

    Voice Live を採用するお客様事例

    医療分野:eClinicalWorks

    医療においては、患者体験が常に最優先です。
    eClinicalWorks のコンタクトセンターソリューション healow Genie は、Voice Live を導入し、医療の近代化をさらに一歩進めています。

    • 患者への予約案内

    • よくある質問への回答

    • 留守電応答

    これらを Voice Live API で自動化し、医療スタッフの負担を軽減。1日あたり数時間分の作業削減と、迅速な対応による患者満足度向上を実現しました。

    「患者からの電話に対し、Genie が質問を検知して、ほぼリアルタイムで自然な音声で回答できることを期待しています。すべての処理が Voice Live API 内で完結します。」
    — Sidd Shah, Strategy & Business Growth 副社長, healow

    また、患者が自分の電子カルテ(EHR)について問い合わせた場合も、Genie がデータを取得して回答可能です。

    「複数のインフラを跨ぐことは患者体験を損ないます。Azure AI Foundry Voice Live API は音声認識と音声合成を統合した単一基盤を提供し、統一的で高品質な体験を実現します。」
    — Bhawna Batra, エンジニアリング担当副社長, eClinicalWorks


    グローバルITサービス:Capgemini

    Capgemini は、グローバル規模のサービスデスク運用を刷新するために、クラウドインフラサービス(CIS)部門で Voice Live API を導入しました。

    • 第1フェーズ:45社50万人ユーザーを対象

    • 目的:サービスデスクを高速化・パーソナライズ・大規模対応

    Microsoft テクノロジー(Dynamics 365 Contact Center、Copilot Studio、Azure AI Foundry)を活用した「AI-Powered Service Desk」を立ち上げ、リアルタイム音声対話を実現。

    新プラットフォームにより:

    • よりアジャイルで会話的なAIサービス体験を提供

    • 定型業務を自動化し、エージェントの生産性を向上

    • Microsoft エコシステムとの深い統合により、運用効率を強化し顧客満足度を向上

    「Voice Live API の統合は画期的でした。低遅延かつ高品質な音声対話により、ユーザーエンゲージメントと満足度が大幅に改善しました。自然で応答性の高い体験を顧客に提供でき、非常に高い評価を得ています。」
    — Stephen Hilton, EVP 兼 COO, Capgemini CIS


    フィンテックプラットフォーム:Astra Tech

    アラブ首長国連邦(UAE)の急成長テクノロジー企業 Astra Tech (G42グループ) は、主力プラットフォーム botim に Voice Live API を導入しました。

    • botim は UAE のスマホユーザー10人中8人が利用

    • 通信アプリからフィンテックサービスへ進化中

      • デジタルウォレット

      • 国際送金

      • マイクロローン

    Astra Tech は、botim を よりシンプルで直感的かつ人間的に進化させることを目指しました。

    「音声は複雑さを取り除き、最も自然なインターフェースです。デジタルリテラシーが低い方や言語の壁がある方でも、音声なら直感的に利用できます。」
    — Frenando Ansari, プロダクトマネージャー, Astra Tech

    「Voice Live API はアプリ全体にわたる会話の“接着剤”です。標準化されたフレームワークを提供し、専門的なAI知識がなくても各製品チームが音声を組み込めます。」
    — Frenando Ansari

    「最も印象的なのは、Voice Live API の音声活動検出(VAD)とノイズ制御アルゴリズムです。」
    — Meng Wang, AI部門責任者, Astra Tech


    まとめ

    Voice Live API は、音声認識・生成AI・音声合成を統合したスケーラブルかつ効率的なソリューションです。
    従来の課題を解決し、開発を加速、優れたユーザー体験を提供します。

    • カスタマーサービス

    • 教育

    • 公共サービス

    など幅広い分野での活用が期待されます。

    音声主導の未来はすでに始まっています。今こそ共に築いていきましょう!

    リソース


     
     
    AIの進化に日々圧倒されてる@microsoft | AI Global Black Belt | Azure Quantum Ambassadors @MSFTQuantum | 全部個人的感想 |

    あなたへのおすすめ