メインコンテンツへスキップ
見出し画像

Azure Live Interpreter API の発表 ー リアルタイム自動翻訳をすぐに組み込める


    リアルタイムで多言語の会話が可能に。入力言語の設定は不要。
    パーソナルボイス、全言語カバレッジ、人間通訳レベルの低遅延を実現。

    本日、Azure Speech Translation の新機能として Live Interpreter を発表します。
    これはリアルタイムの多言語コミュニケーションを容易にする画期的な機能です。

    Live Interpreter は入力言語を事前に設定する必要がなく、話されている言語を自動的に識別し、低遅延で音声から音声への翻訳を行います。また、話者のスタイルやトーンを保った自然な声で翻訳を提供します。

    現在、76の入力言語と143のロケールに対応しており、Teams 会議、カスタマーサポートセンター、国際的な教室、グローバルイベントなど、日常的な場面で誰もが明確かつ包括的にコミュニケーションできるよう支援します。


    Live Interpreter API の主な特徴

    • 自動かつ継続的な言語識別 (LID):
      入力言語を設定する必要なし。セッション中に話者が言語を切り替えても自動的に検出・翻訳。

    • 完全な言語カバレッジ:
      Azure Speech Translation が提供する 76 の入力言語と 143 のロケールすべてをサポート。

    • 大幅な遅延改善:
      リアルタイムの音声翻訳において遅延を大幅に削減。自然な会話で人間の通訳レベルに匹敵。

    • スタイルとトーンを維持するパーソナルボイス:
      翻訳音声は元の話者に近い声で提供され、抑揚や話速も保持。エンタープライズ向けの同意管理機能も搭載。


    Live Interpreter API が実現するユースケース

    Live Interpreter API は、入力言語の設定なしで自然かつリアルタイムな多言語体験を提供します。話者が会話の途中で言語を切り替えても問題なく対応。
    自動・継続的な LID、全言語・ロケール対応、通訳レベルの低遅延、スタイルを保つパーソナルボイスにより、以下のような多彩なシナリオを実現可能です。

    • 多言語コンタクトセンター:
      グローバルな顧客に対し、言語メニューやセッション再起動なしで対応可能。
      オペレーターはリアルタイム翻訳を受け取り、通話中の言語切り替えにも対応。セッション言語リストはコンプライアンスや分析にも活用可能。

    • オンライン会議・イベント:
      参加者がそれぞれ希望する言語を選択できる包括的な会議を提供。
      Live Interpreter は低遅延かつパーソナルボイスで翻訳し、言語切り替えもシームレスに処理。

    • 多言語クラスルーム:
      学生はスマートヘッドフォンを通じて、講義を母語で聞くことが可能。
      翻訳は講師のトーンや話速を保ち、理解度を向上。

    • ソーシャルコマースのライブ配信:
      クリエイターはグローバルな視聴者に向けてリアルタイム翻訳を提供。
      話者の声のスタイルを維持し、ブランドの個性や市場ごとのエンゲージメントを保つことが可能。

    これらのシナリオは、従来は煩雑で非効率、あるいは不可能だったことを Live Interpreter により実現可能にします。

    利用開始の手順

    1. パーソナルボイスアクセスの申請

    Live Interpreter API を利用するには、まず パーソナルボイス (Personal Voice) へのアクセス権を申請します。
    その際、質問20 で「Personal Voice」を選択してください。

    2. リソース ID のリージョン設定

    使用するリソース ID は、以下の パブリックプレビュー対応リージョン のいずれかである必要があります。

    • West US 2

    • East US

    • Sweden Central

    • West Europe

    • Southeast Asia

    • Japan East

    3. アクセス承認後の利用

    パーソナルボイスへのアクセスが承認されると、以下のコードを用いて Live Interpreter を有効化できます。
    C# サンプルコード

    // Please replace the service region with your region
    var v2EndpointInString = String.Format("wss://{0}.stt.speech.microsoft.com/speech/universal/v2", "YourRegion");
    var v2EndpointUrl = new Uri(v2EndpointInString);
    
    // Creates an instance of a speech translation config with specified subscription key and service region.
    // Please replace the service subscription key with your subscription key
    var config = SpeechTranslationConfig.FromEndpoint(v2EndpointUrl, "YourSubscriptionKey");
    
    // Translation target language and enable personal voice
    config.AddTargetLanguage("fr");
    config.VoiceName("personal-voice");
    
    // You don't need to define any candidate languages to detect.
    var autoDetectSourceLanguageConfig = AutoDetectSourceLanguageConfig.FromOpenRange();



    今すぐ始める

    製品に多言語音声翻訳を実装するには、私たちの クイックスタートガイド をご利用ください。


     
     
    AIの進化に日々圧倒されてる@microsoft | AI Global Black Belt | Azure Quantum Ambassadors @MSFTQuantum | 全部個人的感想 |

    あなたへのおすすめ