メインコンテンツへスキップ
見出し画像

Dojo 3再始動は「チップ開発の再開」ではなく「学習の勝ち筋を取りに行く再設計」

    画像

    2025年夏に「Dojoチーム解散」が報じられ、Dojoは終わったように見えました。ところが2026年1月、Dojo 3の再始動が改めて語られています。単なる方針転換に見えますが、ここにはAI開発の現場で起きている「ボトルネックの正体」を踏まえた必然があります。

    まず何が起きたのか(2025年夏→2026年1月)

    再始動を端的に示すのは、Dojo 3を再開するという趣旨の発言と、採用を促す呼びかけです。AI5設計が「良い状態」になったのでDojo 3に戻る、という文脈で語られています。

    一方で同時期に、AI5設計の進捗が「ほぼ完了」と語られつつ、半年前には「完了」とも言っていたという報道も出ています。開発工程の現実(テープアウト、試作、検証、量産立ち上げ)を考えると、言葉の揺れは起きやすい領域です。

    そして2025年夏には、Dojoチーム解散と外部パートナー依存を強める流れが報じられました。ここで重要なのは「Dojoという名前の箱」が消えたというより、「どのアーキテクチャに人と時間を張るか」を揃え直した点です。

    画像

    Dojoが狙っていたのは「計算」ではなく「移動」を減らすこと

    AIの学習は、ざっくり言うと巨大な行列計算の反復です。ここで多くの人が「速い演算器を積めば勝ち」と思いがちですが、現場で効いてくるのはしばしば別の要素です。

    データを動かすコストです。

    重み(パラメータ)を読む、活性(中間結果)を読む・書く、勾配を集めて更新する、並列学習のために別の計算機と同期する──この「移動」が増えると、演算器が速くても待たされます。料理で言えば、コンロが何十口あっても、食材が冷蔵庫から届かない、皿が運ばれない、厨房内の通路が詰まると全体は遅いままです。

    Dojoの設計思想は、この詰まりを減らすことに寄っています。特にTeslaが繰り返し強調しているのが「帯域ボトルネックを外す」という方向性です。

    画像

    Dojo 1世代目の要点(D1→Training Tile→ExaPod)

    今回の動きは今までの流れをくまないとわかりにくいので、少々時代をさかのぼります。
    まず、2021年のAI Dayで示されたDojoは、3段重ねのスケール設計でした。

    1) D1チップ:計算を分割する「ノード」を大量に並べる発想

    D1は7nmで、巨大なダイ(645mm²、500億トランジスタ級)という"力技"でもありますが、ポイントはサイズ自慢ではありません。

    D1内部には多数の「ノード(計算単位)」があり、上下左右に高帯域でつながる前提で設計されています。各方向に512GB/s級の帯域という説明もあり、要するに「チップの中を流れる道路」を太くして、隣へ隣へと繋げたときに詰まらないようにしています。

    この「ノードを格子状に並べて、隣接通信でスケールさせる」作りは、GPUクラスタの一般的な組み方(GPU同士をNVLinkやネットワークで繋ぎ、さらにラック間を繋ぐ)とは性格が違います。GPUは汎用性が高い代わりに、システム全体の"遠距離通信"が増えると設計の難易度が上がります。Dojoは最初から「近所で回す」比率を上げる寄せ方です。

    2) Training Tile:25ダイを1枚にまとめることで「近所」を拡張

    D1をただ基板に並べると、チップ間の配線がネックになります。そこでTeslaは25個のD1(5×5)を一体のモジュールとして統合し、Tileとして扱う設計を示しました。Tileあたり9PF級、オフタイル帯域36TB/s級という数字が語られています。

    ここで効いてくるのが実装技術です。ファンアウト系プロセスで「既に良品と分かったダイ(KGD)を集めて」1枚にし、隣接の帯域を落とさないようにする、という説明があります。要するに、基板の上にICを置くというより「チップ同士を近い距離のまま面として接続する」方向です。

    さらに電力と冷却も極端です。52Vで1万8千アンペア級、15kW級を捌くという話が出てきます。こうなると"計算機"というより"工場設備"です。

    Datacenter Dynamicsの記事は、2021年時点で「Tileの初号機が納品されテストされた」とまで書いています。実在するところまで行っていたのは事実で、単なる絵空事ではありません。

    https://www.datacenterdynamics.com/en/news/tesla-details-dojo-supercomputer-reveals-dojo-d1-chip-and-training-tile-module/

    3) ExaPod:Tileを"面"としてつなぐ発想をラックまで貫く

    ExaPodは「10キャビネットで1.1EF級(16bit)」というような説明が出ています。ここで見逃せないのは、ラックの壁を壊してでも帯域を保つという発想です。普通はラックはラックで完結し、ラック間はネットワークで繋ぐ設計に寄ります。Dojoは「面を拡張する」思想をデータセンターの筐体設計まで押し上げています。

    画像

    このあたりの絵と温度感が掴みやすいのはCadenceの解説です。

    8bit浮動小数点は「精度を捨てた」のではなく「帯域を買い戻した」

    Dojo周りで地味に本質なのが、数値表現(浮動小数点)の作り込みです。

    TeslaはCFloat8(8bit)やCFloat16(16bit)の"設定可能な"フォーマットを提案しています。狙いは明快で、重み・活性・勾配の保存と移動が増えすぎて帯域が詰まるので、必要な精度だけ残してビット数を削り、メモリと通信の圧を下げるという方向です。

    面白いのは「8bitの中で指数部と仮数部の割り当てを変える」「指数のバイアスを可変にする」という発想です。重みや勾配は値が小さくなりがち、活性はレンジが広い、という性質の違いに合わせて"同じ8bitでも別の帽子をかぶせる"わけです。

    つまり、AIの計算が結局は「演算器の速さ」よりも「数値を運ぶ回数とサイズ」に縛られる、という現実をよく表しています。

    画像

    https://cdn.motor1.com/pdf-files/535242876-tesla-dojo-technology.pdf

    ではなぜDojoは止まり、なぜDojo 3が戻るのか

    ここからは、公開情報からの推測です。

    1) ハードだけでは勝てない(ソフトと運用が同じ重さ)

    Dojoはハードの話題が派手ですが、実際に学習で勝つには、どのフレームワークをどこまで載せるか、どうコンパイルし、どう並列化するか、失敗したノードをどう切り離し、どう再試行するか、データ供給(前処理、ラベル生成、学習ジョブ投入)をどう回すか、が効いてきます。

    Cadence解説でもソフトスタックに触れつつ「成功基準はGPUクラスタを使いたくなくなること」という趣旨のエピソードが紹介されています。つまり敵は"GPU"というより"既存運用の慣性"です。

    2) 「Dojo 2を育てる」より「AI5/AI6/AI7へ収束させる」合理性

    TechCrunchは2025年の解散報道で、外部パートナー依存を強める流れや、AI6推論チップの話(Samsungとの製造など)にも触れています。ここから読めるのは、社内に複数のアーキテクチャが並立すると、人も検証環境も分散し、全てが遅くなるという問題です。

    2026年1月の「AI5が良い状態になったのでDojo 3に戻る」は、裏側に「設計が固まったら同じ設計資産を学習側にも展開しやすい」事情があると読めます。Dojo 3がD1直系かは不明ですが、少なくとも"学習のための専用ハード"と"車載やロボ向けの量産ハード"をどう収束させるかは、議論の中心にあるはずです。

    画像

    Dojo 3を見極める3つの観測ポイント

    「Dojo 3が復活したらすごい!」で終わるのは思考停止なので、もう少し掘り下げてみます。

    観測1:メモリ階層がどう変わるか

    D1世代は"帯域の面構成"が強烈でした。一方で最近の学習は、モデルサイズやデータ多様性の増加で、容量と帯域の両方が欲しくなります。Dojo 3がどこで容量を稼ぐのか(HBM的な方向か、別の近接メモリか、圧縮や8bit運用で逃げるか)が最重要です。

    観測2:ネットワークの単位が「タイル」からどう進化するか

    D1のTileは25ダイを面にしたところが肝でした。Dojo 3がAI7系だとするなら、タイルの概念が残るのか、それとも「ボードに多数載せて配線を減らす」という方向に寄るのか。ここは、設計思想そのものの判別点になります。

    観測3:データループ(自動ラベリングや学習投入)がどこまで統合されるか

    自動運転やロボは、学習データが静的ではありません。新しい失敗が出るたびに、データ収集、選別、ラベル付け、学習、評価が回ります。Dojoの価値は、ここを短くすることにあります。ハードが速いだけでは勝ちきれず、学習サイクルが短いチームが勝ちます。

    画像

    以前、アナログチップの話で「計算場所と記憶場所が離れていることが遅さと電力の源泉になる」というテーマを書きました。Dojoの"帯域を買い戻す"設計は、方向性としては同じ地平にあります。デジタルかアナログかは別として、勝負は常に「動かさない設計」です。

    また、Teslaを単なるEVメーカーとして見ない方が理解が進む、という視点も過去に書きました。Dojo 3はまさにその延長線上で、車やロボという"現実世界の入出力装置"を持つ企業が、学習インフラを内製する意味を問う出来事です。

    まとめ:Dojo 3は「最速の計算機」より「最短の学習ループ」を狙う

    Dojo 3のニュースは、表層だけ追うと「やるの? やめるの?」に見えます。ですが本質は、AI開発の現実が「演算性能」から「帯域」「運用」「設計収束」へ重心を移していることにあります。

    D1世代で示された思想(ノードを面で繋ぎ、データ移動を減らす)は、今でも強い。そこにAI5/AI6/AI7という量産系チップ設計と、学習側の要件をどう重ねるのか?このあたりが、今回のDojo 3が目指す方向性、もっと言えばEVにとどまらないTeslaのビジョンが見えてくるかもしれません。

    画像

    参考記事

    〇Tesla confirms that work on Dojo 3 has officially resumed(2026年1月19日)

    〇Elon Musk says Tesla 'almost done' with AI5 design, 6 months after saying it was 'finished'(2026年1月17日)

    〇Tesla shuts down Dojo, the AI training supercomputer that Musk said would be key to full self-driving(2025年8月7日)

    〇Tesla details Dojo supercomputer, reveals Dojo D1 chip and training tile module(2021年8月20日)

    https://www.datacenterdynamics.com/en/news/tesla-details-dojo-supercomputer-reveals-dojo-d1-chip-and-training-tile-module/

    〇NOT CHIPS: Tesla's Project Dojo(日付記載なし)

    〇Tesla Dojo Technology: A Guide to Tesla's Configurable Floating Point Formats & Arithmetic(日付記載なし)
    https://cdn.motor1.com/pdf-files/535242876-tesla-dojo-technology.pdf

    〇AIを変える「古くて新しい」技術:アナログチップの復権(2025年11月3日)

    〇Teslaは電気自動車メーカーではなくなっていく(2023年10月21日)


    あなたへのおすすめ