メインコンテンツへスキップ
見出し画像

最新アバターアップデート: 4K対応と感情制御機能

    アバター接客がいよいよ、現実的に違和感なくなってくるかも
    縦にも横にもいけてモバイルでもつかるのはよき!

    📺 4K対応: 高解像度で広がる可能性

    従来の標準アバターは1080Pで提供され、Webやモバイルアプリケーションで効果的に動作していました。
    しかし、大型ディスプレイで利用する高解像度アバターを求めるお客様のために、新たに カスタムアバターの4Kオプション を導入しました。

    カスタムアバターの概要

    カスタムアバターは、独自のアセットと設定を用いてパーソナライズされたデジタルペルソナを作成できる仕組みです。外見や動作を完全にコントロールでき、セルフサービス型のワークフローを通じて簡単に生成・展開できます。
    詳細手順は過去のブログ [「セルフサービスでカスタムTTSアバターを作成する」](Create a Custom Text-to-Speech Avatar Through Self-Service) をご覧ください。

    4Kアバターの特長

    4Kアバターは、4K解像度の動画トレーニングデータを使用して作成され、1080pよりも精細なディテールが得られます。

    サンプル比較:

    • 4K動画の拡大表示サンプル

    • 1080p動画の拡大表示サンプル

    また、W2MやServiceNowといった企業が、大型スクリーンで4Kカスタムアバターソリューションを活用している事例も紹介されています。

    4Kアバターは横向き(ランドスケープ)と縦向き(ポートレート)の両方に対応。

    • ランドスケープ4K → 大画面やプレゼンテーションに最適

    • ポートレート4K → モバイル、縦型サイネージ、SNSに最適


    4Kカスタムアバターのトレーニング方法

    Azure AI Foundry のセルフサービストレーニングツールを使用します。

    1. Azureアカウントで Azure AI Foundry にログイン。

    2. Fine-tuning → AI Service fine-tuning タブで、
      「Fine-tune」ボタン → 「Custom Avatar」を選択。

    3. 新しいアバタータスクを作成 → タレント設定。
      データアップロード時に 2160p以上の動画 を使用することで4Kアバターをトレーニング可能。

    4. モデルトレーニング時に ランドスケープ/ポートレート の向きと 1080p/4K解像度 を選択可能。

    画像

    トレーニングのヒント

    • 4Kモデルには4K映像が必須。

    • ポートレートモデルには縦向き映像が必須。

    • 撮影時は、体の動きが常にフレーム中央に収まるよう注意。


    4Kビデオの合成方法

    • デフォルト: 3840x2160 で出力。

    • 必要に応じてアスペクト比を維持したまま解像度を調整可能。
      例: 出力を 1920x1080 に下げることでネットワーク帯域を削減可能。

    コード例:

    const videoFormat = new SpeechSDK.AvatarVideoFormat();
    videoFormat.width = 1920;
    videoFormat.height = 1080;

    詳細は以下をご参照ください:
    GitHub サンプルコード

    料金

    詳細は以下をご覧ください:
    Azure AI Speech Pricing | Microsoft Azure


    🎭 アバター感情制御: 声と表情の同期

    新機能として アバターの感情制御 が追加されました。
    ユーザーがアバターの感情を設定すると、音声と表情の両方 に反映されます。

    この機能は lisa-casual-standing アバターでバッチモードにて利用可能です。

    利用方法

    1. AI Foundry ポータル経由

      • Text to Speech avatar ツール → Lisa-casual-standing アバターを選択。

      • このアバターは感情制御に対応しており、テキストボックス上部に「Emotion」ドロップダウンが表示。

      • 声を切り替えると、対応する感情オプションが自動的に更新されます。

    2. SSML経由
      感情指定の例:

    <speak xmlns=\"http://www.w3.org/2001/10/synthesis\" xmlns:mstts=\"http://www.w3.org/2001/mstts\" xmlns:emo=\"http://www.w3.org/2009/10/emotionml\" version=\"1.0\" xml:lang=\"en-US\">
       <voice name=\"en-US-SaraNeural\">
           <mstts:express-as style=\"angry\">I'm angry because I care, and it hurts to see things fall apart like this.</mstts:express-as>
       </voice>
    </speak>

    サポートされる感情

    • Cheerful(陽気)

    • Shouting(叫ぶ)

    • Friendly(友好的)

    • Unfriendly(非友好的)

    • Hopeful(希望的)

    • Disgruntled(不満げ)

    • Funny(おどけた)

    • Surprised(驚いた)

    • Angry(怒り)

    • Excited(興奮)


    デモ・サンプル

    Lisa Casual Standing アバターの感情制御デモ動画では、音声トーンと表情の変化による外見の違いを確認できます。

    カスタムアバターの感情制御サポート

    今後、カスタムアバターへの感情制御対応 を段階的に提供予定です。
    ご興味がある場合はMicrosoft 担当者まで。

     
     
    AIの進化に日々圧倒されてる@microsoft | AI Global Black Belt | Azure Quantum Ambassadors @MSFTQuantum | 全部個人的感想 |

    あなたへのおすすめ