メインコンテンツへスキップ
見出し画像

NVIDIA NIM が NVIDIA Nemotron、Cosmos、Microsoft Trellis に対応:Azure AI Foundry で利用可能に

    なんでもAI Foundry に乗せる姿勢は好き

    私たちは、Azure AI Foundry のマネージドコンピュート上で新たに 7 つの強力な NVIDIA NIM™ モデル が利用可能になったことを発表できることを嬉しく思います。

    今回追加された最新モデル群は以下の通りです。

    • NVIDIA Nemotron Nano 9B v2

    • Llama 3.1 Nemotron Nano VL 8B

    • Llama 3.3 Nemotron Super 49B v1.5(近日公開)

    • Cosmos Reason1-7B

    • Cosmos Predict 2.5(近日公開)

    • Cosmos Transfer 2.5(近日公開)

    • Microsoft Trellis

    これらのモデルは、高度な命令追従、視覚言語理解、効率的な言語モデリングの分野において新たな地平を開くものであり、マルチモーダルでコンテキストを理解する知的アプリケーション開発を加速します。

    堅牢な推論力、柔軟な入力処理、エンタープライズレベルのデプロイオプションを組み合わせることで、ロボティクス、自動運転、リテール、デジタルツインなどの産業分野において、よりスマートで安全かつ適応的な体験を実現します。

    🧠 モデル一覧

    • NVIDIA Nemotron Nano 9B v2(9B・利用可能)
      多言語推論、エンタープライズAIエージェント、科学的推論、コーディング

    • Llama 3.3 Nemotron Super 49B v1.5(49B・近日公開)
      エンタープライズAIエージェント、科学的推論、コーディング

    • Llama 3.1 Nemotron Nano VL 8B(8B・利用可能)
      マルチモーダル視覚言語理解、ドキュメント理解、エッジAIエージェント

    • Cosmos Reason1-7B(7B・利用可能)
      ロボティクス、自動運転、動画解析AIエージェント

    • Cosmos Predict 2.5(2B・近日公開)
      世界状態の生成・予測

    • Cosmos Transfer 2.5(2B・近日公開)
      構造的条件付け、物理AI

    • Microsoft Trellis(-・利用可能)
      デジタルツイン、AR/VRリテール、3D資産生成

    🚀 NVIDIA Nemotron ファミリー紹介

    🟩 NVIDIA Nemotron Nano 9B v2:高効率推論のためのコンパクトLLM

    Nemotron Nano 9B v2 は、Mamba-Transformer ハイブリッドアーキテクチャで構築された高効率大規模言語モデルです。

    画像
    https://build.nvidia.com/nvidia/nvidia-nemotron-nano-9b-v2/modelcard

    特徴:

    • 高性能推論構造:Mamba-2とTransformerを組み合わせ、高スループットで強力な推論能力を実現。

    • 多言語・コード対応:15言語と43のプログラミング言語に対応。英語、日本語、ドイツ語、フランス語、スペイン語、イタリア語などをサポート。

    • 推論トークン制御:「思考トークン数」を指定可能(例:「1Kトークン」「3Kトークン」など)、速度・コスト・精度のバランスを制御。

    Nemotron Nano 9B v2 は、GRPO および DPO によるポストトレーニングを経て、指示追従性と適応力を強化しています。

    🟪 Llama 3.3 Nemotron Super 49B v1.5:大規模推論を可能に

    Llama 3.3 Nemotron Super 49B v1.5(近日公開)は、Meta Llama 3.3-70B-Instruct をベースにした派生モデルで、高度な推論、命令追従、ツール使用に最適化されています。

    特徴:

    • チャットボット、AIエージェント、RAG システムなどに最適

    • 単一の NVIDIA H100 GPU 上で効率的に稼働

    • MATH500(97.4%)、AIME 2024(87.5%) などのベンチマークで高得点


    🟦 Llama 3.1 Nemotron Nano VL 8B:マルチモーダル推論を小型で実現

    Llama 3.1 Nemotron Nano VL 8B は、画像+テキスト理解を組み合わせたコンパクトな視覚言語モデルです。
    ドキュメント理解やレポート生成、視覚的Q&Aなどに強みを持ち、低レイテンシかつ高効率を実現。

    主な評価結果:

    • DocVQA:91.2%

    • ChartQA:86.3%

    • AI2D:84.8%

    • OCRBenchV2 (English):60.1%

    💡 Nemotron が際立つ理由

    1. オープンソースAI技術

      • Open Weights:NVIDIA オープンモデルライセンスに基づく柔軟な展開

      • Open Data:Hugging Face 上で利用可能な許諾済みデータセット

      • Open Recipe:NAS、Minitron、NeMo などの技術レシピを公開

    2. 高精度 × 高効率

      • 推論、視覚、エージェントタスクで業界最高の性能と効率を発揮

    3. クラウド対応

      • Azure 上で NIM として安全かつスケーラブルに実行可能


    🌍 NVIDIA Cosmos ファミリー紹介

    NVIDIA Cosmos™ は、物理AIを推進する「ワールド・ファウンデーション・モデル(WFM)」の開発プラットフォームです。

    Cosmos Reason1-7B:物理AIの中核

    画像

    7Bパラメータのこのモデルは、画像・動画入力を処理し、物理的世界の理解と逐次的推論(Chain-of-Thought)を実現。

    💪 モデルの強み(Model Strengths)

    • 物理世界推論(Physical World Reasoning):
      既存の知識、物理法則、そして常識を活用し、複雑な状況を理解します。

    • Chain-of-Thought(CoT)推論:
      文脈を考慮した段階的な分析を行い、堅牢な意思決定をサポートします。

    • 柔軟な入力対応(Flexible Input):
      画像、動画(最大30秒・1080p)、テキスト入力に対応し、16kのコンテキストウィンドウを備えています。

    • コンパクトで展開容易(Compact & Deployable):
      7Bパラメータで構築され、エッジデバイスからクラウドまで効率的に動作します。

    • 実運用対応(Production-Ready):
      Hugging Face、GitHub、NVIDIA NIM で利用可能であり、業界標準APIと統合可能です。

    🏢 エンタープライズ向けユースケース

    Cosmos Reason1-7B は単なるモデルではなく、より安全で効率的、そしてつながりのある物理世界を企業が構築するための 知的かつ適応的なソリューションを実現する触媒 です。

    • 安全性と効率性の再定義:
      AIエージェントが数百万のライブストリームや録画映像を解析し、工場・都市・産業施設でのプロトコル遵守を即座に検証し、リスクを検知します。

    • ロボティクス革新の加速:
      高度な推論と計画機能により、ロボットが環境を理解し、論理的な判断を行い、複雑なタスク(自動運転から家庭支援ロボットまで)を実行可能にします。

    • データキュレーションとアノテーションの自動化:
      膨大で多様なデータセットの選定・ラベリング・評価を自動化し、高品質な学習データを生成して次世代AIの開発を促進します。

    • スマートな動画解析の実現:
      Chain-of-Thought 推論を活用し、イベントの要約、行動の検証、セキュリティ・コンプライアンス・運用効率に関する実用的な洞察を提供します。

    画像

    Cosmos Predict 2.5(近日公開)

    Cosmos Predict 2.5 は、テキスト・画像・動画から現実的で制御可能な仮想世界(ビデオワールド)を生成する次世代モデル。
    2億件以上の動画クリップで学習され、物理シミュレーション精度を強化。


    Cosmos Transfer 2.5(近日公開)

    Cosmos Transfer 2.5 は、セグメンテーション・深度・LiDARマップなどの構造データをフォトリアリスティックな合成データに変換し、物理AIの学習を支援。


    🎨 Microsoft Trellis(Microsoft Research)

    Microsoft Trellis は、Microsoft Research によって開発された最先端の 3Dアセット生成モデル です。テキストまたは画像プロンプトから、形状とテクスチャを含む高品質で多用途な3Dアセット を生成できるよう設計されています。

    このモデルは NVIDIA NIM マイクロサービス にシームレスに統合されており、アセット生成を大幅に高速化し、柔軟で本番環境対応の出力をクリエイターに提供します。

    • 高精度3Dモデルの迅速生成
      シンプルなテキストや画像プロンプトから高忠実度の3Dモデルを素早く生成。
      製造業、エネルギー、スマートインフラなど、デジタルツインの構築、予知保全、没入型トレーニング環境を加速します。

    • 幅広い業界での応用
      小売業でのバーチャル試着(AR)から、メディア業界での本番対応3Dアセット生成まで、Trellis はチームがスケール可能な形で美しい3Dコンテンツを作成することを支援します。

    • 生産時間の短縮と新たな体験の創出
      生成プロセスを効率化することで、制作時間を大幅に削減し、新たなレベルのインタラクティビティとパーソナライゼーションを実現します。

    💰 料金

    Azure Compute の利用料に加え、NVIDIA AI Enterprise ライセンス費用(1GPUあたり $1/時間)が必要です。

    • 従量課金制(Pay-as-you-go)

    • NIMサーチャージ:$1 / GPU時間

    • Azure Compute料金:構成に応じて適用


    ⚙️ Managed Compute の利点

    Azure AI Foundry Managed Compute では、LLMやSLM、Hugging Faceモデル、カスタムモデルをAzure上で完全ホスト運用可能です。

    主な特徴:

    • オープンソース/サードパーティモデルのデプロイ対応

    • GPU(A10, A100, H100)の柔軟な選択

    • 推論サーバー構成やスケーリングポリシーを詳細設定可能

    • Azure ML SDK, CLI, Prompt Flow, REST API と統合

    • エンタープライズ対応:VNet、プライベートエンドポイント、クォータ対応


    🧩 NVIDIA NIM マイクロサービス on Azure

    これらのモデルは、Azure AI Foundry 上で NVIDIA NIM™ マイクロサービス として利用可能です。NVIDIA NIM は NVIDIA AI Enterprise の一部であり、高性能AIモデルの推論を安全かつ信頼性高くデプロイするために設計された、使いやすいマイクロサービス群です。

    NIMマイクロサービスは、事前構築済みでコンテナ化されたAIエンドポイントとして提供され、
    デプロイ作業を簡素化し、あらゆる環境でのスケーリングを容易にします。
    これにより、開発者は クラウド環境でモデルを安全かつ効率的に実行 することができます。


    🔒 信頼できるAIの構築

    Azure AI Foundry は、Microsoft の Responsible AI 原則 および Secure Future Initiative に基づき、セキュリティ、プライバシー、公平性を保証します。


    🚀 Azure AI Foundry での始め方

    1. ai.azure.com にアクセス

    2. 「Hub プロジェクト」を作成または選択

    3. Model Catalog → Collections → NVIDIA を選択

    4. 使用したい NIM を選び「Deploy」

    5. デプロイ名・VMタイプを選択(必要に応じてクォータ申請)

    6. NVIDIA NeMo Agent Toolkit を利用してエージェントを統合・監視


    ⚖️ ライセンスについて

    利用者は NVIDIA AI Product Agreement の条件遵守が必要です。


    📚 さらに学ぶ

     
     
    AIの進化に日々圧倒されてる@microsoft | AI Global Black Belt | Azure Quantum Ambassadors @MSFTQuantum | 全部個人的感想 |

    あなたへのおすすめ