メインコンテンツへスキップ

AIは「全部計算する」から「必要な計算だけする」へ? Semantic Routing Memoryという考え方

    <2026年7月22日以前のコンテンツ一覧はこちら>

    AIは全部計算する必要があるのか

     生成AIの性能競争というと、これまでは「どれだけ大きなモデルを動かせるか」「GPUを何枚並べられるか」「何TOPS、何FLOPS出せるか」といった話が中心でした。けれどもAIが社会のあらゆる場所へ入り始めると、別の問いが出てきます。そもそも、その計算は全部やる必要があるのでしょうか。

     今回考えたのは、AIコンピュータを「たくさん計算して、その中から結果を選ぶ機械」から、「仕事の意味を見て、必要な計算だけを最初から選ぶ機械」へ変えられないか、という仮説です。その中核として考えたのがSemantic Routing Memory、略してSRMです。

    SRMは「意味で引くルーティング表」

     SRMは、普通のデータベースのように知識を大量に保存するメモリではありません。イメージとしては、ネットワーク機器のルーティング表に近いものです。インターネットのルーターは、パケットが来るたびに世界中の経路をゼロから考え直しているわけではありません。あらかじめ用意された小さな表を見て、「次はどこへ送るか」を素早く決めます。

     AIでも同じように、「この仕事なら大きなモデルを起動する」「これは小さなモデルで十分」「この処理ではこのExpertだけ使う」「このTileは起動しない」といった判断を、計算装置のすぐ近くで素早く行えないか、と考えます。

     ここで大事なのが、単なるEmbedding検索とは違うことです。似ている文章を探すだけなら、ベクトル検索で十分です。しかしAIを実際に動かすとなると、「意味が似ている」だけでは足りません。そのモデルに処理能力があるのか、今その装置は空いているのか、利用者に実行権限があるのか、古い設定を参照していないか、といった条件も必要になります。

    意味から実行までを一気につなげない

     そこで、現実世界や利用者の要求から得た情報を、まずExecution Contextという形に整理します。そこには「何をしたいのか」という意味だけでなく、場所、時刻、動き、物理状態、そして大まかな計算資源の状況なども含まれます。ただし、すべてを一つのEmbeddingへ押し込むわけではありません。正確な時刻、権限、バージョン、安全条件のように厳密に扱うべき情報は、明示的な項目として分けておきます。

     そのExecution Contextを小さなSemantic Route Vectorへ縮め、SRMを引きます。SRMが返すのは「この物理経路を通れ」という完成済みの命令ではなく、「この種類の仕事なら、この条件で、この計算クラスを使うのが候補」というCandidate SRDです。

     さらに重要なのは、SRMが勝手に実行権限を与えないことです。Candidate SRDは別のPolicy / Authority Gateへ送られ、IAMやポリシーの正本を使って「この利用者が本当に実行してよいか」を確認します。認可されたものだけがAuthorized SRDとなり、下の計算層へ渡されます。

     それでも、実際の計算場所を最初から固定してしまうと困ります。GPUの混雑、キャッシュの有無、ネットワークの輻輳などは刻々と変わるからです。そのため各層では、Authorized SRDと、その瞬間のローカル状態を組み合わせて、最終的な実行先を決めます。これをLocal Rebindingと呼んでいます。

     つまり全体は、「意味を理解する」「実行候補を選ぶ」「権限を確認する」「今の混雑状況に合わせて実際の場所を決める」という役割分担になります。意味を毎回すべての層で解釈し直す必要はありませんし、逆に最初に決めた経路へ最後まで縛られる必要もありません。

    性能の物差しも変わる

     この考え方が面白いのは、性能の見方そのものが変わるところです。従来は「どれだけ多く計算できるか」が大きな指標でした。SRM的な世界では、それに加えて「同じ品質、同じ安全条件を満たしながら、どれだけ計算を起動せずに済んだか」が重要になります。不要なモデルを起動しない。不要なデータをメモリから運ばない。不要なTileへ電力を流さない。性能とは、実行した計算量だけでなく、避けられた計算量でも測れるようになります。

    すでに「部品」は見え始めている

     すでに、その断片に見える技術はいくつも存在します。NVIDIAのSwitchyardは要求に応じて使うモデルを切り替えます。DynamoはKVキャッシュや負荷を見て実行先を変えます。研究例のSparse by Commandでは、タスク信号からTile単位のマスクを作り、不要なDMAや演算自体を起動しない仕組みが示されています。Cisco側には、ネットワーク経路、テレメトリ、セキュリティ、ポリシー制御という別方向からの技術があります。

     ただし、これらを一つにまとめた「Semantic Routing Memory製品」が現在存在するわけではありません。今回の構想は、各所で別々に進んでいる技術を縦につないだとき、どんなコンピュータ像が見えてくるかを考えたものです。

     実際、世界49件の技術・研究事例を比較してみると、SRMにかなり近いと判定できるものはまだ少数でした。評価でも「意味情報がある」と「実行を制御できる」を別々に満たすだけでは近いとは判定せず、その意味情報が実際に計算先の選択を動かしているかまで確認するようにしています。現在の技術は、意味ルーティング、実行制御、ローカルメモリ、ネットワーク、権限管理といった部品が、それぞれ別々に成熟している段階だと見るのが自然です。

    速ければ安全、ではない

     そして、ここには安全上の大きな境界があります。AIがどれほど速く経路を選べても、「意味的に正しそうだから機械を動かしてよい」とはなりません。非常停止、安全インターロック、保護リレーのような物理安全は、決定論的なSafety GateとしてAIとは独立させます。銀行送金や基幹システム更新でも同じで、意味の近さと実行権限は別物です。

     もう一つ重要なのが「時間」です。意味情報がまだ新しいか、位置情報がまだ正しいか、移動方向が変わっていないか、GPUの混雑状態がまだ同じか、モデルやファームウェアが更新されていないか。それぞれ変化する速さが違います。そこでSRMでは、一つのTTLですべてを管理するのではなく、複数のFreshnessを別々に扱う必要があります。

    「大きな演算器」から「計算を切り替えるシステム」へ

     将来、本当にこの方向へ進むなら、AIコンピュータは単なる「巨大な演算器」ではなく、「意味と現在状態を見ながら、必要な計算資源を切り替える多段スイッチングシステム」に近づいていくかもしれません。

     そのとき競争の中心も、GPU単体の性能だけではなくなります。モデル、Expert、Tile、メモリ、GPU、ラック、ネットワーク、Toolまでを、一つのExecution Classでどこまで自然につなげられるか。そして、意味、権限、安全、最新状態を混同せずに扱えるか。そこが次のAI計算基盤の重要な設計論になるのではないか、というのが今回の仮説です。

     まだ理想アーキテクチャの段階です。ただ、「もっと速いGPUを作る」という一本道とは別に、「そもそも不要な計算を始めないコンピュータを作る」という方向からAIの未来を眺めると、かなり違った景色が見えてきます。


    <SCISPACE査読 まあ、新規性はあるらしいです>


    あなたへのおすすめ