
Agentic AIの次、Physical AI
こんにちは。株式会社Algomaticの大野です。
2025年CESでのNVIDIAキーノートは、NVIDIA CEO Jensen Huang氏が、ビジョナリーに語るとてもおもしろいものでした。
一言でまとめると、「AIがコンピュータや産業を新しい基盤として再定義していく」というメッセージングを感じました。
より具体的には、既存のCPU中心の世界観からGPU+AIを核にしたソフトウェア設計へと大きくシフトが起きている、そしてそれはデジタルな情報空間に閉じず、リアルな物理世界にも染み出していく、という話です。
発表された主なトピック一覧
GeForce RTX Blackwell
Agentic AI
AI PCs
Physical AI
Autonomous Vehicles
Robotics
Project DIGITS
キーノート踏まえた考察を、こちらのnoteではシェアします。
※ 思考メモなぐり書き、ほぼそのままです。読みづらいところがあるかもしれません。正確な情報は、公式リリースをご参照ください。
■ 考察ハイライト
①「新たなコンピューティング基盤」としてのAI
②「クラウドのみならず、あらゆる端末」で動くAI
③「Agentic AI」の次となる「Physical AI」
💡 PIVOTさんにて、同様の内容を解説しております。よければこちらもご覧ください↓
「新たなコンピューティング基盤」としてのAI
CPUによる手続き的ロジック → GPU+AIモデルへのシフト

これまでのアプリケーション開発は、手書きの命令コード(if文やfor文など)をCPUで実行するのが当たり前でした。しかし、生成AIや大規模言語モデルが普及した今、「詳細なロジックを人間が書かなくても、AIモデルが学習・推論で高度な処理をこなす」方向へ大きくシフトしています。
従来は定義しきれなかった複雑なタスク(例:自然言語での高度な問い合わせ)を、AIモデルが“重み”として内在化し、柔軟に対話・対応するということです。それにより、これまでデジタル化できなかった領域もソフトウェア化することができます。
AIシフトを支えるキット、“NIMs・NeMo・Blueprints・Llama Neotron”

今回のキーノートでは、AI導入をより簡単にするためのソフトウェアスタックをそろえる方針も語られていました。具体的には、NIMs、NeMo、Blueprints、Llama Neotronといったソリューションを用意し、それぞれが連携してAIの導入ハードルを大きく下げようとしています。
たとえばNIMsは「画像認識」「音声認識」「文章生成」などの機能をまとめたコンテナを提供する仕組みで、従来ならエンジニアが個別にライブラリをダウンロードし、GPUの設定や推論エンジンを調整する必要があったところを、NIMsにより基本的なAI機能がすぐに使えるようになるのが特徴です。
NeMoは、AIを社内のビジネスプロセスに組み込むうえでのフレームワークで、「AIエージェントをどう管理し、どう評価するか」という点に着目しています。具体的には、AIに専門用語や業務手順を覚えさせる“オンボーディング”や、不適切発言や機密漏洩を防ぐ“ガードレール”の設定、あるいはパフォーマンス評価の仕組みなどを用意し、人事部が新入社員を扱うような感覚でAIを管理できる世界観を描いているわけです。「IT 部門が、AI エージェントの人事部になる」というような表現も印象的でした。
Blueprintsは、AIアプリケーションのテンプレートです。開発をゼロから始めるのではなく、テンプレートを組み合わせたり編集することでより楽にアプリケーションを構築できるといったものです。
つまり、GPUの性能向上だけでなく、実際のAI活用を一気通貫で支援するソフトウェアがセットで提供されることで、企業や開発者がAIを採用しやすくなるというわけです。従来であれば一つひとつのライブラリを導入して環境整備に時間を費やしていた部分を大幅に短縮し、しかも大規模モデルや社内向けエージェントを運用しやすいよう設計されているという点が、今回のキーノートで強調されたポイントだといえます。
スケーリングによる次のアップサイド:テストタイムスケーリング

AIモデルは、パラメータ数・データセットサイズ・計算資源など、大きくすればするほど“賢くなる”という、経験的に観測されている法則があります。これを「スケーリング則」と呼び、近年のLLM(大規模言語モデル)ブームを支える重要な考え方の一つです。
事前学習で大きな計算資源によるブレイクスルーが起きたところから、次にRLHFなどポストトレーニングでの進化、そして、最近のo1などを代表とするモデルが示唆しているのは、テストタイム(推論)でも、スケーリング則が成り立つということです。推論時に、複数ステップでの推論を行う、それによってより高いパフォーマンスを出すことができます。
推論(テスト)にも、膨大な計算資源が必要になってくるわけです。特性上、モデルの利用量に伴って推論時にかかる計算量もスケールするため、これまで以上に大きな計算資源が必要になる可能性があります。(事前学習では一箇所でリソースをかけて学習したモデルを皆でシェアできたわけだが)

新世代のGPUアーキテクチャ「Blackwell」では、前世代に比べて性能とコスト効率を大幅に進化しています。前世代比で最大4倍の性能/電力効率と3倍の性能/コスト比を実現しており、同じ電力枠・同じ予算でこれまでの数倍の計算処理が可能になります。同じ予算で3倍の規模のモデルを学習できたり、同じ消費電力で4倍のトークンを生成できるというわけです。
そのスケーリング則に伴い、急速に増える需要に応えるべく、土台側もまだまだ大きく進化していく、というメッセージングを感じました。
「クラウドのみならず、あらゆる端末」で動くAI

「AIモデルの学習・推論には、大規模なGPUクラスターが必要 → だからクラウドで回す」といういうのが、今のある種当たり前なわけですが、クラウドに依存すると、それによる課題や制限(ネットワーク遅延や月々のコストなど)もあります。
今回のリリースでは、あらゆる端末でAIが動くことができることを目指す、というメッセージングを感じました。
Project DIGITS:机の上に置けるAIスパコン

NVIDIAが発表した「Project DIGITS」は、デスクトップサイズで小型の“AIスーパーコンピュータ”を実現する構想です。
従来なら数百万円以上していたAI専用サーバーを、数十万円規模で個人や中小企業でも導入できる世界です。
これまでは大規模AIを回すにはクラウドの巨大GPUクラスターが不可欠でしたが、Project DIGITSならユーザーが手元で高性能な推論や開発を完結できます。マイクロソフトやAppleがパーソナルコンピュータを普及させた流れのような、これからは大規模AIを個人で所有・活用する時代が来るかもしれません。
WindowsでもGPU+AIを動かすのが、より簡単に
もう一つのトピックとして、WSL2(Windows Subsystem for Linux 2)との親和性の強化です。
WindowsユーザーがLinux向けのAIライブラリ(CUDAなど)をスムーズに使えることで、例えば、Windows上で大規模モデルを開発→クラウドでスケールアップといった流れがより簡単になります。
同様に、「AIはクラウドだけでなく、ノートPCやデスクトップ、さらにはエッジデバイスでも動かしていける」という意思を感じます。
Thor:より高度な自動運転可能に

前世代のOrinと比べて20倍の性能の「Thor」という新しいプロセッサが、発表されていました。
たとえば自動運転には、一部操作を支援するADAS(先進運転支援システム)から、ほぼ完全に人間の手を離れて走行するレベル4〜5まで、複数段階あります。ADASでは車線維持や追従走行のように、カメラやレーダー情報をある程度処理すれば足りるかもしれませんが、完全自動運転になると車体周囲360度の状況を常時把握し、歩行者や他の車両の動きを予測しながら瞬時に経路を決定しなければならないわけです。そのより高度な自動運転を実現するには、従来以上に高性能なコンピュータリソースが、リアルタイムのセンシングと推論のために求められます。そうした大規模な演算量に対応できる次世代チップを用意していく、という発表に見えました。
そして、それはもちろん車だけでなく、ロボットにも活用できるものです。
「Agentic AI」の次となる「Physical AI」

NVIDIAの基調講演で特に印象的だったのは、AIの進化が「Agentic AI」からさらに「Physical AI」へ移っていくという話です。
振り返れば、まずは画像や言葉、音声を理解する「認識AI(Perception AI)」が登場し、そこから画像・文章・音声を生成する「生成AI(Generative AI)」が一気に盛り上がりました。最近は“エージェンティックAI(Agentic AI)”と呼ばれる、認識し、推論し、計画し、行動まで行うAIが注目されていますが、NVIDIAは「ここから先は“Physical AI”の時代になる」と明確にメッセージを打ち出してきました。いわば、物理世界を扱うAIが重要だというわけです。
情報空間だけでなく、物理空間を理解・制御

大規模言語モデルは膨大なテキストを学習し、テキストを入力するとトークンを連続的に生成して文章を返してくれます。もし入力が文字情報ではなく、物理的な観測データだったらどうなるか。出力が文章ではなく“行動指令”のようなトークンだったらどうなるか。それが、NVIDIAが“Physical AI”と呼ぶ次の段階のAIです。
情報空間に閉じない、リアルな世界での進化です。Agentic AIがクラウドやAPIといった“情報空間”のツールを呼び出して行動するように、Physical AIはロボットアームや車載コンピュータといった“物理的なツール”を扱い、実世界を動かしていくとイメージできそうです。
しかし、限られている現実世界のデータ

ただ、リアル社会にはテキストほど大規模データが足りない、という課題があります。人間そっくりの動作を学習したロボットを作りたいと思っても、人間の視野や動作をセンシングしたデータは転がってはいないわけです。自動運転のためにあらゆる走行パターンを記録したいと思っても、実際にデータを集めることが大変なのです。
Cosmos:物理現象を理解する基盤モデル

そうしたデータ不足を克服するアプローチとして、NVIDIAは今回「Cosmos」という大規模なワールドモデルを紹介していました。これは、重力や慣性、摩擦といった物理法則、空間・幾何学の関係、原因と結果などを学習し、“物理現象をそれっぽく再現・生成できる”という特徴をもつファウンデーションモデルです。
Cosmosは2,000万時間分の動画データを学習し、単なるクリエイティブな生成にとどまらず“物理的につじつまの合う世界”を理解し、生成する能力を備えるとされています。ロボットや自動運転のリアルなシミュレーションデータを膨大に作ったり、さまざまな未来パターンを生成して最適な動作を探したりすることが可能になるというわけです。Cosmosを通じて、Omniverseの物理シミュレーションと組み合わせれば、人間が設定したシナリオだけでは不十分だったリアルらしいデータを、ほぼ無限に生み出すことができます。
「リアルなデータ」の生成による、増幅

このワールドモデルの意義は、大雑把に言えば“リアルな”データを生成し、現実世界で集めきるのは難しいデータ不足によるボトルネックを解消することにあるといえそうです。
テキストデータのような巨大コーパスを、物理世界でも手に入れるにはどうしたらいいか。それをシミュレータと生成AIの融合で解決するという流れは、まさにデジタル世界から物理世界へ、Agentic AIからPhysical AIへと踏み出すための大きなステップになるのかもしれないと、感じました。
Algomaticで、共に未来を作りませんか?
私たちAlgomaticは、AIの進化によって来るべき未来を作っているスタートアップです。技術革新のど真ん中で、次の時代を共に作りたい方、ぜひご連絡ください。
リサーチャー、エンジニア、デザイナーの方はもちろん、新たな事業を生み出したい事業家、BizDevの方もお待ちしております。
※ 参考:過去にも、下記note等でOpenAIやGoogleのリリースの解説・考察もしております。