
Arm AGI CPU の内部構成
XenoSpectrum から Arm の AGI CPU の内部構成についての記事が出たので、要約・考察をしました。
要約
この CPU の正体
名称は AGI だが、AI 演算器ではない。Neoverse V3 ベースの汎用サーバー CPU。行列演算は GPU / NPU に任せ、エージェントのスケジューリングやツール呼び出し、推論前後処理、メモリ/ I/O 管理を担う「AIを動かし続けるCPU」。
製造は TSMC N3P、70コア 入り計算チップレット 2枚 で構成。各チップレットが 500億超トランジスタ、合計1000億超。物理 140コア 中、最大 SKU は 136コア を有効化。残り 4コア は冗長か歩留まり用と推定されるが非公開。
内部アーキテクチャ
キャッシュ構成
各コアに 64KB I-cache + 64KB D-cache + 専用2MB L2。
136コア版で L2 合計 272MB。システムレベルキャッシュ (SLC) は全 SKU 共通で 128MB。つまりコア数に比例するのは L2 で、SLC は比例しない。フロアプラン
I/O ダイ分離ではなく、左右対称チップレットに DDR と PCIe を分散。メモリコントローラを上下、PCIe を外側、チップレット間リンクを中央寄りに配置。データの流れまで二分した設計。電源管理
コア列ごとに Cortex-M55、チップレットごとに Cortex-M7 で階層制御。300W の TDP 内で2枚を調整。
チップレット間と外向きの帯域が肝
チップレット間は UCIe-S準拠 16x x16マクロ、32Gbps/レーン。集計で送受信各 1Tbps(双方向2Tbps相当)、キャッシュ一貫性を保持。ただしパッケージ内専用、外部拡張用ではない。
外部向けは PCIe Gen6 / CXL 3.0 Type3 96レーン。送受信 各768GB/s + Gen4 6レーン。GPU / NPUへの給餌が詰まらないようにコア数と同じくらい I/O に面積を割いている。
メモリは 12ch 80bit DDR5。1DPC なら DDR5-8800 で理論 845GB/s、2DPC なら 6400 で 614GB/s。Hot Chips 資料で量産検証済みとされたのは DDR5-8000 まで。8800 はメモリの入手性次第で、製品上限と量産時のギャップが残る。
SKU は 3種類、同じ 300W で役割分担
300W は共通。136コア は並列数、64コア版 は 12ch を半分以下のコアで分けるため 1コア あたり帯域 13GB/s。DB や解析向けで、廉価版ではない。
ビジネス面の注意点
記事が強調しているのは、20億ドル需要は売上確定ではないこと。
Arm は FY27-28 通算で 20億ドル超の顧客需要と述べたが、6月末SEC資料では本格生産は 2026年末 予定。現在は初期品納入段階。
製造能力は 10億ドル分 しか確保済みではなく、残りは増強中。
「需要」は売上認識と同義ではなく、IP ライセンスと違い利益率・販売サイクルが変わる可能性があるとArm自身が認めている。
同じ 36kW ラックで x86比 2倍超 という性能も Arm推定値。30ブレードx2 ソケット = 8160コア という密度は計算上だが、300W 持続、100ns 未満のメモリ遅延、実アプリ性能は第三者検証待ち。
考察
なぜ2チップレットなのか
1000億超を1ダイで作るより、70コア の同型ダイを 2枚 束ねる方が歩留まりと電力管理が容易。AMD のチップレット戦略と似ていますが、Arm は I/O ダイを分けず各チップレットに DDR/PCIe を載せたのが特徴。これによりNUMA 的な偏りを減らしつつ、ラック密度を上げる狙い。
「AGI CPU」というネーミングのミスリード
コア自体は 10ワイド 投入 / 8ワイド 完了、アウトオブオーダー 384エントリ超、ALU 8基、分岐3系統、SVE2 で bfloat16/INT8 と、制御コードの分岐予測・プリフェッチ重視。GPU の前段で詰まりがちな「小さく不規則な仕事」を流す設計で、AI 時代のホストCPUの理想形ではあるが、演算性能で語るべきCPUではない。
投資家として見るべきリスク
SKU 設計は ソフトバンクG の Arm にとって重要。136コア は コア課金型クラウド向け、64コア はメモリ帯域課金型向けと市場を分けられる。TCO 最適化 128コア を挟んだのは歩留まり確保の意味も大きいでしょう。
供給と需要のズレが最大の注目点。記事が指摘する通り、20億ドル はあくまで引き合い。2026年末の量産が遅れれば、NVIDIA や x86勢 の次世代が出てくる。DDR5-8800 の認定が間に合わないと、謳う 845GB/s が出ない状態で出荷されるリスクもあります。
UCIe 1Tbps は十分か。1000億トランジスタの2ダイ間で 1Tbpsは、L2ミスが SLC に集中した時のボトルネックになり得ます。キャッシュ一貫性トラフィックをどう抑えるかが実効性能を左右します。
まとめ
この記事は「ラック全体で仕事量を稼ぐ CPU」への転換をよく示しています。単体ベンチマークより、36kW ラックに 8160 コア 詰めた時の、GPU 待ち時間をどれだけ減らせるかが勝負。2026年末の量産と、独立したベンチマークが出るまで、Arm の主張する 2倍超 という数字は割り引いて見るのが妥当です。