見出し画像

動画生成AIの世界TOP5は、4枠が中国だった――HiDreamの350億円調達から読む「生成ビジュアルAI戦争」2026

2026年7月、中国の生成AIスタートアップ「智象未来(HiDream.ai)」がシリーズCで15億元、日本円で約350億円を調達した。評価額は10億ドルを超え、ユニコーンの仲間入りをしている。

日本語圏では8月8日に36Kr Japanが報じたが、中国側の一次発表は7月23日から27日にかけてだった。そして本当に驚くべきなのは金額ではない。これが3カ月で3回目の調達であり、累計は21億元を超えているという事実の方である。

日本ではほとんど知られていない会社だ。しかし同社が戦っている場所を見ると、2026年の生成AI競争の構造がよく見える。

そこで本稿では、HiDreamを入口にして、2026年8月8日時点の画像生成AIと動画生成AIの世界勢力図を、第三者評価の実測値で整理する。

結論を先に書いておく。

画像生成AIの世界TOP5は5枠すべて米国勢。
動画生成AIの世界TOP5は、Googleを除く4枠が中国勢である。

そしてHiDreamを見るうえで本当に重要なのは、「一時世界3位になった会社」という事実ではない。

画像生成 → 動画生成 → 音声統合 → 編集 → AIエージェント → 世界モデル → フィジカルAI

という競争の流れに、中国の新興企業が本格的に入り始めたことだ。

※ランキング数値は2026年8月8日18時台(シンガポール時間)にArtificial Analysisを再確認したスナップショット。Arena型Eloは投票追加によって変動する。

この記事で分かること

  • HiDreamの15億元(約350億円)調達の本当の意味

  • 「画像生成AI世界3位」がいつ時点の数字なのか

  • 2026年8月8日時点の画像生成AI・動画生成AI世界TOP5

  • なぜ画像では米国勢、動画では中国勢が強いのか

  • HiDream、MiniMax、Seedance、Wan、Klingの技術的な違い

  • 生成ビジュアルAIが世界モデルとフィジカルAIへ接続する理由


目次

第1部 350億円のニュースを正しく読む

  1. HiDreamとは何者か

  2. 15億元の中身――誰が出したのか

  3. 「世界3位」はいつの話か

第2部 2026年8月8日の実測

  1. 画像生成AI・世界TOP5

  2. 画像生成AI・中国TOP5

  3. 動画生成AI・世界TOP5

  4. 動画生成AI・中国TOP5

  5. 画像編集という本当の主戦場

  6. 93ポイントと4ポイント

第3部 技術で何が起きているか

  1. UiT――VAEとテキストエンコーダーを外す

  2. 8Bと200B超――画像にもスケーリング則

  3. 「オープン」という言葉の中身

  4. 音声ネイティブ化という分水嶺

  5. 15秒、30秒、そして無限へ

第4部 プレイヤーの現在地

  1. OpenAI――画像で首位、Soraは終了

  2. Google――VeoからGemini Omniへ

  3. Reve――米国の小さな例外

  4. ByteDance――Seedanceは世界モデルへ向かう

  5. Alibaba――WanとHappyHorseの二本立て

  6. Kuaishou――可灵AIが会社になった日

  7. MiniMax――オープンウェイトの新しい形

  8. HiDreamの選択

第5部 その先にあるもの

  1. 生成AIとフィジカルAIの合流

  2. 著作権・真正性・ライセンス

  3. 日本企業にとっての含意

  4. 結論

付録

  • ランキングの読み方

  • 数字で見る2026年8月


第1章 HiDreamとは何者か

HiDream.aiを展開する智象未来は、中国・安徽省合肥市を拠点とする生成AI企業である。設立は2023年3月と新しい。

創業者兼CEOの梅濤(メイ・タオ)博士は、若い起業家ではない。マイクロソフトリサーチ・アジアの上級研究員を経て、2018年に京東集団(JD.com)へ移り、集団副総裁兼京東探索研究院副院長を務めた人物である。カナダ工学アカデミーの外国人会員であり、IEEE、IAPR、CAAIのフェローでもある。論文の被引用数は3万回を超える。

京東時代の仕事が、この会社の性格を決めている。10億枚規模の商品画像検索を秒単位で応答させ、京東アプリのトップ導線に載せた。物流倉庫「アジア一号」では24時間稼働するロボットアームの視覚方式を実装し、10万SKUを超えるピッキングを支えた。つまり彼は、デモから契約に耐える製品までの距離を実務で知っている。

同社の製品構成は、7月の公式リリースで「1+1+3」と説明されている。1つの基盤モデルHiDreamシリーズ、1つのToken Hubというモデル能力の出力窓口、そして商業マーケティング、映像制作、コンテンツ創作という3つの応用領域である。企業向けにはHiHarness、消費者向けの創作プラットフォームにはvivagoがある。同社の2026年7月時点の公表値では、100を超える国と地域で5,000万人を超えるプロユーザーと4万社超の法人顧客を持つという。4月時点の発表では創作プラットフォームvivagoが3,000万人のプロ個人ユーザーと百万人規模の有料ユーザーを抱えるとされていたので、公表ベースでは短期間で伸びていることになる。ただし数え方の範囲が両者で同一かどうかは公表資料から確認できない。

技術路線は一貫している。テキストと画像と動画を別々のモデルで扱う従来型ではなく、単一アーキテクチャですべてを処理する「ネイティブ全モーダル世界モデル」を掲げている。


第2章 15億元の中身――誰が出したのか

投資家の顔ぶれは、36Kr Japanの記事より実際には厚い。

共同主導は4社である。社保基金四川振興科創基金、工銀資本、弘頤資管、敦鴻資本。国家系の長期資本と金融資本が並んでいる。

追加参加には、厦門国貿資本、上影新視野基金、湖北長江産業投資集団、華策影視、航源資本、創雲海資本、華福投資、余杭金控股份、交銀資本、若松基金が名を連ねる。既存株主の合肥産投、東方富海、金浦投資、金華金投、中哲創、財鑫資本も追加出資した。合肥産投はこれで3回連続の出資になる。

ここで見落とせないのが華策影視(Huace Film & TV)の位置づけだ。同社は中国有数の映像コンテンツ企業で、報道では「提携先」として紹介されることが多いが、実際には今回のラウンドの出資者でもある。上影新視野基金も上海電影集団の系列である。

つまりこの調達は、純粋なベンチャー投資ではない。国家系資本、地方国資、そして映像産業資本が同時に入っている。HiDreamは上影股份と新型コンテンツ制作やAI大スクリーン製作標準の策定で協業し、華策影視とはエージェント協調創作やIPフルチェーン開発を計画しているという。以前から湖北長江電影集団とも協力関係がある。

映像会社は制作現場と高品質データを持ち、モデル会社は生成能力を持つ。両者が資本で結ばれたということだ。

同社の資本の歩みも簡単に触れておく。Pre-Aは敦鴻資本が主導し、2024年12月のA輪は合肥産投、華富嘉業、湖北長江電影集団が入った。安徽省の人工知能母基金のほか、過去には商湯科技、京東、科大訊飛の系列ファンドも株主に名を連ねている。本社を合肥高新区へ置いたのは2024年9月である。

また、C輪融資の進行と前後して、主体会社は「智象未来(合肥)科技股份有限公司」へ股份制改組を進めたと中国メディアが報じている。これは将来の資本市場入りを意識した動きと解釈されているが、2026年8月8日時点で具体的なIPO時期や取引所が正式発表されたわけではない。したがって「上場準備入り」と断定するより、「資本政策上の選択肢を広げた」と見るのが安全である。


第3章 「世界3位」はいつの話か

36Kr Japanの記事で最も目を引くのは「画像生成AIで世界3位」という表現だろう。ここは注意が必要だ。

智象未来が公式リリースに添付したランキングのスクリーンショットには、「2026年6月22日時点」という注記がある。つまり「世界3位」は6月22日の値である。

本稿の最終確認時点である2026年8月8日18時台にArtificial Analysisの文生図リーダーボードを見ると、HiDream-O1-Image-1.5はElo 1,225、11,292比較、総合12位に位置している。

6月22日の「世界3位」から見れば順位は下がった。しかし、これはHiDream自身の性能が下がったという意味ではない。この2カ月でReve 2.1、Seedream 5.0 Pro、Ideogram 4.0など新モデルが追加され、投票も積み上がった。Eloは相対評価であり、競争相手が増えれば順位も動く。

さらにArtificial Analysisには「Current models/All models」「Open weights」など複数の表示条件がある。したがってランキング記事では、順位だけでなくElo、比較数、確認日、カテゴリー、表示条件までセットで記す必要がある。

本稿では、8月8日の最終確認値を基準に全章の数字を統一した。

そのうえで言えば、2023年設立の中国スタートアップが、OpenAIやGoogleと同じ表の上位層に一度でも入ったこと自体は、十分に重要な事実である。


第4章 画像生成AI・世界TOP5

以下はすべてArtificial Analysisの文生図(Text to Image)アリーナ、2026年8月8日の全モデル表示による。同じプロンプトから作られた2枚の画像を、モデル名を伏せて人間が比較投票する仕組みである。

【1位】GPT Image 2(high)/OpenAI/Elo 1,368/12,369比較/2026年4月/1,000枚211ドル

【2位】Reve 2.1/Reve/Elo 1,324/13,636比較/2026年7月/1,000枚200ドル

【3位】Nano Banana 2(Gemini 3.1 Flash Image Preview)/Google/Elo 1,317/13,492比較/2026年2月/1,000枚67ドル

【4位】GPT Image 1.5(high)/OpenAI/Elo 1,311/11,743比較/2025年12月/1,000枚133ドル

【5位】MAI-Image-2.5/Microsoft AI/Elo 1,308/13,003比較/2026年6月/1,000枚48.1ドル

5枠すべてが米国企業である。しかも上位2枠をOpenAIが占めている。

6位はGoogle Nano Banana Pro、7位はNano Banana 2 Lite、8位はByteDance Seedream 5.0 Pro、9位はMicrosoft MAI-Image-2.5-Flash、10位はSpaceXAI grok-imagine-image-qualityである。

ここから3つのことが読める。第一に、首位のGPT Image 2は突出しており、2位との差は44ポイントある。2026年4月の公開から4カ月、首位を守り続けている。第二に、価格と品質は比例しない。3位のNano Banana 2は1位の3分の1以下の価格であり、5位のMAI-Image-2.5はさらに安い。第三に、上位10枠に中国モデルは1つしか入っていない。

つまり画像生成に関しては、「中国勢が世界TOP5を占拠」という表現は当てはまらない。当てはまるのは動画の方である。

出典:Artificial Analysis「Text to Image Leaderboard」(2026年8月8日確認)


第5章 画像生成AI・中国TOP5

同じ表から中国企業のモデルだけを抜き出すと、こうなる。

【中国1位】Seedream 5.0 Pro/ByteDance/Elo 1,275/世界8位/1,000枚90ドル

【中国2位】Qwen Image 2.0 Pro/Alibaba/Elo 1,225/世界11位/1,000枚75ドル

【中国3位】HiDream-O1-Image-1.5/HiDream/Elo 1,225/世界12位/1,000枚80ドル

【中国4位】Seedream 4.0/ByteDance Seed/Elo 1,222/世界14位/1,000枚30ドル

【中国5位】Wan2.6 Text to Image/Alibaba/Elo 1,207/世界26位/1,000枚30ドル

同一企業の旧モデルを畳み、1社1モデルで並べ直すと、ByteDance、Alibaba、HiDreamが上位3社で、次いでBaiduのERNIE Image(Elo 1,195)、TencentのHunyuanImage 3.0 Instruct(Elo 1,144)となる。

中国勢の首位であるSeedream 5.0 Proでも、世界1位のGPT Image 2とはElo 93ポイントの差がある。画像生成における中国勢の位置は、第一集団の一つ下だ。

ただし価格は明確に安い。中国上位5モデルの参考価格は1,000枚あたり30ドルから90ドル、米国上位5モデルは48.1ドルから211ドルである。大量生成を前提とする業務では、この差が判断を変える。


第6章 動画生成AI・世界TOP5

動画は評価軸が分岐する。音声の有無、テキストからか画像からか、生成か編集か。ここではArtificial Analysisの文生動画(Text to Video、音声あり)を基準にする。

【1位】Gemini Omni Flash/Google/Elo 1,244/11,889比較/2026年5月/1分6.00ドル

【2位】MiniMax H3/MiniMax/Elo 1,240/6,859比較/2026年7月/1分7.80ドル/オープンウェイト

【3位】Dreamina Seedance 2.0 720p/ByteDance Seed/Elo 1,224/18,559比較/2026年3月/1分9.07ドル

【4位】Wan2.7-260612/Alibaba/Elo 1,161/12,415比較/2026年6月/1分9.00ドル

【5位】HappyHorse-1.1/Alibaba-ATH/Elo 1,148/12,644比較/2026年6月/1分9.90ドル

5枠のうち4枠が中国である。

6位以下も、HappyHorse-1.0、Kling 3.0 1080p Pro、Wan 2.7、SkyReels V4と中国勢が続く。GoogleのVeo 3.1は11位まで下がる。上位10枠のうち、非中国はGoogleの1枠だけだ。

価格でも差がある。11位のVeo 3.1が1分24ドルなのに対し、上位の中国モデルは7.8ドルから9.9ドルである。

そしてこの表にOpenAI Soraは載っていない。OpenAI公式によれば、SoraのWeb/アプリ体験は2026年4月26日に終了し、APIも同年9月24日に終了予定だからである。

出典:Artificial Analysis「Text to Video Leaderboard – With Audio」(2026年8月8日確認)


第7章 動画生成AI・中国TOP5

中国企業のモデルだけを抜き出すと、次のようになる。

【中国1位】MiniMax H3/Elo 1,240/世界2位/オープンウェイト

【中国2位】Dreamina Seedance 2.0 720p/ByteDance Seed/Elo 1,224/世界3位

【中国3位】Wan2.7-260612/Alibaba/Elo 1,161/世界4位

【中国4位】HappyHorse-1.1/Alibaba-ATH/Elo 1,148/世界5位

【中国5位】HappyHorse-1.0/Alibaba-ATH/Elo 1,127/世界6位

アリババ系が3枠を占めるが、内訳は通義実験室系のWanとATH系のHappyHorseで、別チームである。同じ会社の中で別々の思想のモデルが走り、両方が世界上位に入っている。

1社1モデルで並べ直すと、MiniMax、ByteDance、Alibaba、Alibaba-ATH、そしてKuaishouのKling 3.0 1080p Pro(Elo 1,111)という順になる。

中国勢の首位であるMiniMax H3と、世界1位のGemini Omni Flashの差はElo 4ポイントである。95%信頼区間は重なっており、統計的には同着と言ってよい。


第8章 画像編集という本当の主戦場

企業の現場で必要とされるのは、白紙から一枚作る能力よりも、既存の商品写真やブランド素材を壊さずに編集する能力である。背景を差し替え、季節を変え、商品カラーを変え、文字を追加し、別言語版を作る。この作業を大量に回す。

Artificial Analysisはこの用途のために、画像編集専用のリーダーボードを別に持っている。順位は文生図とかなり違う。

【1位】Reve 2.1/Elo 1,261/3,585比較/1,000枚200ドル

【2位】GPT Image 2(high)/Elo 1,258/17,223比較/1,000枚211ドル

【3位】MAI-Image-2.5/Microsoft AI/Elo 1,254/10,237比較/1,000枚48.1ドル

【4位】GPT Image 1.5(high)/Elo 1,253/10,664比較/1,000枚133ドル

【5位】Nano Banana 2/Google/Elo 1,248/11,596比較/1,000枚67ドル

生成では2位だったReveが、編集では1位に立つ。レイアウトを先に組んでから描画するという同社の設計思想を考えると、納得のいく結果である。

オープンウェイト部門では、1位がTencentのHunyuanImage 3.0 Instruct(Elo 1,222)、2位がHiDream-O1-Image(Elo 1,199)、3位がFLUX.2[klein]9B(Elo 1,166)となる。中国勢が上位2枠を占める。

ここに実務上重要な数字がある。HiDream-O1-Imageの編集は総合19位だが、価格は1,000枚10ドルである。1位のReve 2.1は200ドル、2位のGPT Image 2は211ドル。品質差はElo 60ポイント前後、価格差は20倍だ。EC商品画像の背景差し替えを毎日数万枚流すなら、この比率が答えを変える。

もう一点、統計の話を書いておく。Artificial Analysisは順位とともに順位レンジを表示するが、編集の1位から4位はいずれもレンジが重なっている。統計的には有意差がない。「Reveが編集で世界1位」ではなく、「4モデルが同着」と書くのが正確である。

出典:Artificial Analysis「Image Editing Leaderboard」(2026年8月8日確認)


第9章 93ポイントと4ポイント

ここまでの数字を、2つに圧縮できる。

画像において、中国首位のSeedream 5.0 Proと世界首位のGPT Image 2の差はElo 93ポイント。動画において、中国首位のMiniMax H3と世界首位のGemini Omni Flashの差はElo 4ポイントである。

この2つが、2026年8月の米中の勢力図を最も端的に表している。

なぜこうなるのか。米国の強みは、LLM、クラウド、基礎研究、巨大なGPUクラスター、そして世界的なソフトウェア流通にある。中国の強みは、短動画、EC、モバイルコンテンツ、製造、そして巨大な消費者市場だ。

動画生成は中国の既存産業構造と相性が良い。Douyin、Kuaishou、Bilibili、小紅書という映像中心の巨大プラットフォームがあり、TaobaoやDouyin ECには商品動画とライブコマース素材の膨大な需要がある。動画広告、ライブコマース、短編ドラマ、デジタルヒューマンと、投資回収シナリオを描きやすい用途が並んでいる。

加えて、国内競争が熾烈である。ByteDance、Alibaba、Tencent、Kuaishou、Baidu、MiniMax、HiDreamが同時に走り、優秀な研究者が巨大ITとスタートアップの間を移動し、成功した技術をプラットフォームがすぐ製品化する。この循環速度が非常に速い。

米国の先端GPU規制という制約はある。だがそれは、国産アクセラレータ、推論最適化、モデル圧縮への投資を加速させる圧力にもなっている。


第10章 UiT――VAEとテキストエンコーダーを外す

HiDreamが注目される理由は、ランキング順位ではない。アーキテクチャを変えようとしている点にある。

従来の画像生成AIは、複数の部品を接続して作られてきた。テキストを理解する既製のエンコーダー、画像を圧縮・復元するVAE、ノイズから画像を生成する拡散トランスフォーマー、そして編集用の追加モジュール。それぞれが別々に事前学習されている。

この分業には代償がある。潜在空間への圧縮で高周波の視覚情報が失われ、視覚と言語が別々の空間で符号化されるため意味のずれが生じる。

HiDream-O1-Imageは、生のピクセル、テキストトークン、タスク条件を単一の共有トークン空間へ写像する。これを同社はPixel-level Unified Transformer、略してUiTと呼ぶ。技術報告書は2026年5月11日にarXivへ投稿されている。

ただし正確を期しておきたい。廃したのは外部VAEと分離型テキストエンコーダーの2つであって、外部モジュールを全廃したわけではない。編集や被写体維持のための参照画像を読み込む部分にはSigLip-2という視覚エンコーダーが使われ、8Bモデルのバックボーンはアリババの多モーダル理解モデルQwen3-VL-8B-Instructから初期化されている。

つまりHiDreamの「ネイティブ統一」は、ゼロから全部を自前で作ったという意味ではない。既存のオープンモデル資産の上に、ピクセル空間の拡散を接ぎ木した構造である。

この設計が成功すれば、生成と編集を別タスクとして扱う必要が薄くなる。作る、直す、人物を維持する、参照画像へ寄せる。これらを同じ文脈処理として扱えるからだ。実装面では、条件トークンとテキストトークンには因果マスクを、生成トークンには全結合注意を割り当てるハイブリッド設計を採っている。損失関数はフローマッチングにLPIPSと知覚DINO損失を組み合わせ、学習は512、1,024、2,048ピクセルと解像度を上げる3段階方式。事後学習はSFTのあとGRPOによる強化学習で、OCR精度、美的評価、指示追従、推論品質を報酬に合成している。


第11章 8Bと200B超――画像にもスケーリング則

技術報告書で特に注目すべきは、2つの規模を並べていることだ。軽量展開向けの8B版と、200Bパラメータ超のHiDream-O1-Image-Proである。

数字も出ている。GenEvalの総合スコアは8B版が0.90、Pro版が0.92。論文の比較表ではGPT Image 2が0.89、Seedream 4.0が0.84、Nano Banana 2.0が0.83である。中国語の長文描画を測るLongText-Bench-ZHでは、8B版0.978、Pro版0.980と報告されている。

もっとも、これらは企業自身が選んだベンチマークと条件による自己申告値だ。第三者のブラインド投票であるArtificial Analysisの順位とは、評価の目的が違う。混ぜて読んではいけない。

それでも、この報告が示す方向は重要である。LLMの世界では、モデルを大きくし、データを増やし、計算量を増やせば性能が上がるというスケーリング則が産業を変えた。画像生成でも同じことが起きるなら、競争の意味が変わる。巧妙な小型モデルを設計する競争から、GPUを何万枚確保できるか、データセンターをどれだけ建てられるか、高品質な画像・動画データをどれだけ持つかという資本集約型の競争へ近づくからだ。

なお、Hugging Faceで公開されているHiDream-O1-Imageのモデルカードでは、パラメータ数が9Bと表示されている。論文の「8B」は概数と考えるのが自然だ。ライセンスはMITである。

推論の重さも正直に開示されている。フル版は約50ステップ、そこから敵対的蒸留で28ステップ版のDevを作っている。理念ではなく、地味な工学の積み重ねで成り立っている。


第12章 「オープン」という言葉の中身

中国AIが世界で存在感を高めた背景には、オープンウェイト戦略がある。APIモデルは便利だが、提供企業の価格、規約、地域制限、サービス継続性に依存する。発売前の商品、未公開映画、社内デザイン、顧客写真、工場設備といったデータを外部APIへ送れない企業は多い。

だが2026年、この「オープン」という言葉自体が複雑になってきた。

HiDreamの公開モデルはMITライセンスで、制限は緩い部類である。一方で、序列は動いている。2026年5月にはHiDreamのオープン版が文生図のオープンウェイト1位だったが、8月8日のArtificial Analysis最終確認では、

【オープンウェイト1位】Ideogram 4.0(Quality)/Elo 1,211
【2位】HiDream-O1-Image-Dev-2604/Elo 1,198
【3位】Baidu ERNIE Image/Elo 1,195

となっている。

つまりHiDreamは総合では12位だが、オープンウェイトに限定すると世界2位である。企業のローカル運用や独自改変まで考えると、この順位は総合ランキング以上に重要だ。

より複雑なのがMiniMax H3の例だ。同社は7月31日にAPIを公開し、8月3日にHugging Faceへ重みを掲載した。動画編集部門で1位のモデルが自社サーバーで動かせるようになったのだから、画期的である。

しかし公開されたのは「H3-Base」、768pの映像とステレオ音声を生成する中核モデルだけだ。参照素材を生成指示へ変換する「H3-Context-IR」と、出力を2Kへ再構成する「H3-Regenerate-2K」はMiniMax側のサーバーに残っている。リーダーボードで評価された2K版と、ダウンロードできる版は同じ構成ではない。

ライセンスにも条件がある。MiniMax H3 Community License AgreementはNanonoble Pte. Ltd.名義で2026年8月2日付、準拠法は香港法である。

条文はまず「Applicable Territory」を「全世界から除外地域を引いたもの」と定義し、「Excluded Territories」をEU、英国、韓国、米国と明記している。この4地域では、重みを実行することも、改変も、配布も、そしてローカル実行で得た出力を使うことも許諾されていない。

商用利用は認められるが、商用製品・サービスの年間売上が2,000万ドルを超える場合は事前の書面承認が必要だ。商用UIには「MiniMax H3」の表示が求められ、H3の出力を使って小型モデルを蒸留することも禁じられている。

除外地域の組織は個別にライセンスを申請でき、MiniMaxはコンプライアンス体制を確認したうえで許諾すると説明している。またホスト型APIは全世界で利用可能である。同社の説明では、APIなら自社でコンテンツ審査や安全フィルターを制御できるが、ローカル実行の重みでは制御できないという理屈だ。

除外の理由についても同社は公開のQ&Aで説明している。動画生成モデルはテキストやコードのモデルよりも規制環境が複雑で急速に変化しており、EU、英国、韓国、米国では肖像生成、著作権、コンテンツ安全性をめぐる規制が整備途上にある、という趣旨である。EU AI Actの施行開始にも触れている。米国について同社のデベロッパーリレーションズ責任者は、ハリウッド各社との著作権訴訟が理由だと述べたと報じられている。

日本人読者にとって実務的に重要なのは、日本がこの除外地域に含まれていないことだ。日本国内でのローカル実行は、現行ライセンスの適用地域内にある。

これは意味が小さくない。オープンウェイトは「国境を越えて広がるもの」として語られてきたが、H3では地域を明示的に区切るライセンスが採用された。しかも今回は輸出規制ではなく、企業自身が訴訟リスクと規制不確実性を理由に地域を切り分けている。

米国が半導体で使った地理的な線引きを、中国企業がモデルのライセンス条項で使い始めた、という見方もできる。

MiniMax自身は発表で「オープンソース」という語を使っている。しかし地域制限、売上閾値、用途制限、一部コンポーネントの非公開を合わせて考えると、「オープンウェイト」と呼ぶ方が正確である。企業が採用を検討する際は、性能とライセンスを同じ重さで見る必要がある。


第13章 音声ネイティブ化という分水嶺

2026年の動画生成AIには、共通した変化が一つある。音声を後付けしなくなったことだ。

時系列で並べると、2月にKuaishouのKling 3.0 Omniが全モーダル入出力とネイティブ音声を実装し、3月にByteDanceのSeedance 2.0が音声と映像の統合生成を打ち出した。4月にはアリババのHappyHorse-1.0が映像と音声を同時生成し、多言語のリップシンクを載せた。5月にGoogleのGemini Omni Flashが音声付き動画を出力し、7月にMiniMax H3が同一推論でステレオ音声を生成した。

半年で、主要プレイヤー全員が同じ場所へ来ている。

これは技術的な流行ではなく、制作工程の圧縮である。従来は映像を生成し、別ソフトでナレーションを作り、効果音を足し、口の動きを合わせ、音楽を敷いていた。工程ごとにツールが違い、そのたびに人が挟まる。音声ネイティブ化は、これを1回の生成へ畳む。

Artificial Analysisが「音声あり」と「音声なし」で別々のリーダーボードを持っているのは、この変化を反映している。両者では順位が入れ替わる。企業がモデルを選ぶときは、この区別を必ず確認したい。「動画AIの世界2位」という表現は、音声の有無を書かなければ意味が半分しか伝わらない。

そして音声ネイティブ化は、次の論点も連れてくる。声の権利である。実在人物の声を映像とともに生成できるなら、肖像権と音声の権利が同時に問題になる。Googleが「自分の声を入れることはできるが、他人の声を書き換えることはできない」という制限をGemini Omniに設けたのは、この論点への先回りだ。


第14章 15秒、30秒、そして無限へ

2026年7月31日は、動画生成AIにとって節目の日だった。MiniMaxがH3を出し、ByteDanceがSeedance 2.5の提供を始めた。同じ日である。

現在の動画モデルが数秒から十数秒しか出せないのは、計算量とメモリの制約が大きい。フレーム数が増えるほど注意機構の計算は増え、一貫性の維持も難しくなる。

そこで解法が3つに分かれた。

モデル自体の尺を伸ばす方向がByteDanceである。Seedance 2.5は1回の生成で30秒の音声付き動画を出し、複数回の延長にも対応する。延長機能で継ぎ足す方向がMiniMaxで、H3は最長15秒に加えてExtend機能を持つ。そしてエージェントで工程を分割する方向がHiDreamのvivago R1だ。

HiDreamの選択が興味深いのは、単一モデルの尺を伸ばす競争を回避している点である。企画を理解し、ストーリーラインを構想し、絵コンテを作り、素材を生成し、カットを繋ぐ。これは人間の制作工程そのものだ。

どの解法が勝つかはまだ分からない。ただし実務から見ると判断基準ははっきりしている。「30秒の連続ショットが必要な仕事」と「3分の完成尺が必要な仕事」は別物だからだ。前者はモデルの問題であり、後者はワークフローの問題である。


第15章 OpenAI――画像で首位、Soraは終了

OpenAIは画像生成で首位を維持している。GPT Image 2は2026年4月公開で、8月8日時点でもElo 1,369で1位にいる。2位との差は44ポイントあり、公開から4カ月にわたって首位を守り続けている。強みは画質単体ではなく、会話の中で編集を重ねられる体験にある。背景だけ変える、人物はそのままに服を変える、前の画像と同じキャラクターで次の場面を作る。業務利用では、この反復編集能力が決定的だ。

一方、独立した動画製品「Sora」は終了した。

2026年3月24日、OpenAIはXでSoraアプリの終了を告知した。スタンドアロンアプリの公開から約6カ月後である。Webとアプリの提供は4月26日に停止し、APIも9月24日に終了予定だ。ウォール・ストリート・ジャーナルは、サム・アルトマンCEOが社内に対し動画モデルを使う製品を全て畳むと伝えたと報じている。

Sora終了の背景については、採算、著作権・ディープフェイク、事業上の優先順位など複数の分析が報じられている。ただしOpenAI公式の終了案内は、終了日とデータ移行などを説明しているだけで、単一の理由を公式見解として示してはいない。本稿でも終了理由は断定しない。

Sora製品の終了は、生成ビジュアルAIの構造をよく示している。動画生成は計算コストが極めて重く、品質競争と価格競争を同時にやると体力が削られる。しかもモデルロックインが弱い。ユーザーは複数サービスを併用し、同じプロンプトを入れて良い方を選ぶ。ブランドが効きにくいのだ。加えて著作権と肖像の問題が、消費者向け動画アプリでは避けられない。

少なくとも独立した消費者向け動画生成サービスは、大手にとっても採算・安全性・権利処理を同時に成立させる難易度が高い。なお、Sora製品の終了をもってOpenAIが動画研究そのものから撤退したと断定することはできない。だからこそ、広告、EC、短編ドラマ、ライブコマースという明確な回収経路を持つ中国勢がここで強い理由も、はっきりする。


第16章 Google――VeoからGemini Omniへ

Googleは動画生成で首位にいる。ただし主戦力は2026年にVeoではなくなった。

5月19日のGoogle I/O 2026で、GoogleはGemini Omniという新しいモデル群を発表した。DeepMindの説明は「あらゆる入力からあらゆるものを作る。まず動画から」というものだ。

第一弾のGemini Omni Flashは、テキスト、画像、音声、動画のどの組み合わせでも入力として受け取り、音声付き動画を出力する。会話しながらの編集ができ、変更を指示していない部分は保持される。同日からGeminiアプリ、Google Flow、YouTube Shorts、YouTube Createへ展開された。生成長は10秒に制限されているが、Googleはこれを技術的限界ではなく計算資源の配分による運用判断だと説明している。

DeepMindのサイト上、Veoは「特化モデル」に分類され、OmniはNano Banana、Gemini Audioと並ぶコアGeminiファミリーに置かれた。つまりGoogleは、動画専用モデルの系統から全モーダル統合モデルの系統へ主軸を移した。方向としては、HiDreamが掲げる「ネイティブ全モーダル」と同じである。違うのは規模と配布力だ。

Googleの強みは、検索、YouTube、Android、Workspace、Cloudを含む巨大なエコシステムにある。文章から画像、動画、音声、編集、配信までを自社スタック内部で完結できる。HiDreamが対抗しなければならないのは、画像モデルとしてのGoogleではなく、この統合環境である。

なお、Gemini Omniの生成物にはSynthIDの不可視ウォーターマークが入る。真正性の問題に、製品側で先に手が打たれている。


第17章 Reve――米国の小さな例外

2026年の画像生成で象徴的なのがReveの存在だ。

ReveはPalo Alto発の新興AI企業で、設立は2023年。Reve 2.0を6月3日、Reve 2.1を7月9日に出し、8月8日のArtificial Analysisで文生図2位、画像編集1位に立っている。ただし画像編集は1位から4位の95%信頼区間が大きく重なっており、「単独で明確な1位」とまでは言い切れない。

設計思想が独特だ。プロンプトを直接ピクセルへ変換するのではなく、まず領域、物体、テキスト要素からなる構造化された編集可能なレイアウトを組み、そのうえでネイティブ4Kへ描画する。同社はこれを「触れる画像」と表現する。文字や看板、パッケージ、メニューといった環境内タイポグラフィに強いのは、構図と位置と余白がレンダリング前に決まっているからだ。

新興企業でも巨大ITと同じランキングの最上位へ入れること自体が重要である。

Reveが示しているのは、画像生成市場では巨大な配布チャネルがなくても上位に来られるということである。クリエイター市場ではブランドより結果が重視され、乗り換えコストが低い。一枚生成して良ければ使い、悪ければ次のモデルへ移る。

HiDreamの急浮上も、まさにこの市場特性を利用している。米国にReve、中国にHiDream。同じ現象が両側で起きている。


第18章 ByteDance――Seedanceは世界モデルへ向かう

ByteDanceを「TikTokの会社」とだけ捉えると、その強さを見誤る。動画がなぜ面白いのか、何秒で離脱するのか、どんなカメラワークが注目されるのか、音楽と映像がどう同期するのか。こうした知識を事業として蓄積してきた組織である。

Seedance 2.0の技術報告書は2026年4月15日にarXivへ投稿された。中国での公開は同年2月上旬、生成長は4秒から15秒、ネイティブ出力解像度は480pと720p。参照入力は動画3点、画像9点、音声3点までを扱う。

そして2026年、次世代のSeedance 2.5が登場した。最初の公表は6月23日、北京で開かれた火山引擎(Volcano Engine)のFORCE原動力大会である。7月31日に即夢(Jimeng)と豆包Proで段階的な提供が始まった。1回の生成で30秒、参照素材は画像30枚、動画10本、音声10本の合計50点まで。タイムスタンプ指定の編集、グリーンスクリーン、カメラ視点変更、領域単位の編集、白モデル参照といった、制作工程へ踏み込んだ機能が加わっている。

ただし解像度と価格はByteDanceが公式値を出しておらず、APIもBytePlus ModelArkで近日提供の段階だ。ByteDance Seed自身も、複雑な動きの物理的妥当性と多数の被写体が相互作用する場面の安定性には改善余地があると認めている。

注目したいのは用途の書き方である。公式発表はSeedance 2.5の適用先を映画や広告に限定していない。産業製造、具身知能、自動運転を明示し、ロボットの知覚と操作を学習させる合成動画データ、産業シミュレーション、工程訓練、そして極端気象や複雑な交通といった自動運転のロングテール場面の生成を挙げている。

火山引擎の譚待(タン・ダイ)総裁は「動画生成は世界モデルへ至る経路の一つだ」と述べ、Seedance系列モデルの呼び出しの半数近くが海外市場からであることも明かしている。同じ大会では、豆包系モデルの1日あたり利用量が180兆トークンを超えたことも公表された。

なお同日、ByteDanceは音声専用モデルSeed-Audio 1.0も公開している。映像と音声を同じ推論で出す方向と、音声を専用モデルで詰める方向が、同じ会社の中で並走している。


第19章 Alibaba――WanとHappyHorseの二本立て

アリババの動画モデルはWanだけではない。2026年時点で、同社は性格の異なる2本のラインを並走させている。

一つはWan。通義実験室系で、部分的にオープンで価格が安く、編集しやすい実務型である。アリババの強みはECとクラウドにあり、TaobaoやTmallの数千万点の商品に対して商品画像から動画を作り、モデル着用動画を作り、各国語の広告を作るという大量生成の需要がある。この市場では一回の最高画質より、コストとスループットが効く。Wanのオープン化は、Alibaba CloudのGPU需要を増やす戦略とも整合している。

もう一つがHappyHorse(快楽小馬)だ。こちらは登場の仕方そのものが2026年の動画AIで最も奇妙な事件だった。

2026年4月7日、Artificial Analysisのビデオアリーナに「HappyHorse-1.0」という名前のモデルが現れた。所属不明、企業名なし、説明なし。そして数日のうちに、文生動画と画像生成動画の両部門で1位に立った。当時の首位候補だったSeedance 2.0とKling 3.0を上回ったのである。

4月10日、開発者が新設したXアカウントで正体を明かした。アリババのATH(Alibaba Token Hub)AIイノベーションユニットのプロジェクトであり、まだ開発中だという内容だった。CNBCの取材にアリババが本物だと認め、同日アリババ株は上昇している。組織としては、国内EC部門である淘天集団のFuture Life Labに源流を持ち、独立ユニットへ再編されたと伝えられている。Qwenを持つアリババクラウドのAI部門とは別系統だ。

6月21日から22日にかけて公開されたHappyHorse 1.1では、音声同期、リップシンク、複数参照の一貫性が改善された。

この事件が示すのは2つのことである。第一に、ブラインド評価は本当にブランドを剥がす。無名の名前でも、出力が良ければ1位になる。第二に、中国大手のAI開発は一枚岩ではない。同じ会社の中で複数チームが競争し、外から見ると別会社のように振る舞う。HiDreamのような新興企業が入り込む余地があるのは、この構造ゆえでもある。


第20章 Kuaishou――可灵AIが会社になった日

Klingは中国の動画生成AIを世界へ知らしめた初期の代表格である。最新のKling 3.0系列は2026年2月公開で、テキスト、画像、音声、動画の全モーダル入出力に対応し、最長15秒の動画を生成する。多言語、方言、アクセントを含む音声もネイティブに扱う。

そして2026年、可灵AIは「モデル」から「会社」になった。

事業数値の伸びが際立つ。快手の2026年第1四半期決算によれば、可灵AIの四半期売上は6.5億元超、前年同期比300%超の成長である。2026年3月時点の年間経常収益は5億ドル近くで、1年で約4倍になった。売上の約4分の3は海外だ。利用者は6月時点で全世界1億人を突破し、224の国と地域をカバー、企業顧客は約5万社に達している。

7月2日、快手(01024.HK)は可灵AI関連資産を北京可灵股份有限公司へ分離し、増資契約を結んだと香港取引所に開示した。ロイターとCNBCの報道によれば、確定した増資は190億元超、約28億ドル。投資前評価額は1,050億元、約150億ドルで、追加投資家を含む上限は204.5億元、約30億ドルである。投資後の評価額は約180億ドル、日本円で約2兆9,000億円になる。

出資者の顔ぶれが興味深い。アリババ、テンセント、百度が並び、中信証券や中国工商銀行も加わる。テンセントの出資額は2億ドルと報じられている。

ここが面白いところだ。テンセントは自社で混元を持ち、アリババはWanとHappyHorseを走らせ、百度もERNIE系の画像モデルを持つ。動画生成という同じ土俵で戦っている3社が、4社目に同時に金を入れている。中国のAI投資では、囲い込みより「主要な打ち手にはとりあえず席を取る」という動きが目立つ。

この増資で快手の持分は100%から約68%へ希薄化する。分社は形式ではなく、実質的な独立へ向かっている。香港市場での上場は2027年初を目指すと報じられている。

ただし利益は出ていない。公告開示によれば、2025年の売上は約11億元に対し純損失は約19億元、2024年の純損失は約5億元だった。約150億ドルという投資前評価額は、現在の利益ではなく、成長率と将来の市場規模に賭けた数字である。

つまり動画生成AIは、もはや大手の一機能ではない。単独で資金調達し、単独で上場を目指す産業になった。


第21章 MiniMax――オープンウェイトの新しい形

MiniMax H3は、動画モデル「Hailuo(海螺)」系列の第3世代で、Hailuo 3.0とも呼ばれる。WAIC 2026の7月17日に予告され、7月31日に一般公開された。香港上場のMiniMax株(0100.HK)は発表当日、一時13%上昇している。

仕様は明確だ。テキスト、画像、動画、音声を一つのコンテキストとして受け取り、4〜15秒、24fps、最大2Kの動画を生成する。音声は32kHzステレオで、映像と同じ推論の中で同時に生成される。台詞、効果音、環境音、音楽まで一度に出る。対応言語は11。価格は2K動画で1秒あたり0.13ドル、1分あたり7.8ドルで、同社は「2Kでの秒単価は主流モデルの3分の1未満」と説明している。

公式モデルカードによれば、テキストと視覚の条件付けを担うH3-EncoderはQwen3-VL-32Bの全事前学習済み重みを使い、その50層目のhidden stateをH3-Omni-Transformerへ渡す。Transformer本体は33Bパラメータ規模のdense single-stream構成で、映像と音声のlatentを同時に予測する。視覚VAEは空間16倍、時間4倍の圧縮率を持つ。

公開チェックポイントは2種類ある。FL2VAは画像を0枚から2枚まで受け取り、0枚ならテキストから動画、1枚なら先頭または末尾フレーム指定、2枚なら先頭と末尾の指定になる。Ref2VAは画像9点、動画3本、音声3本まで、ただしファイル総数12点までを受け取る。Hugging Faceのリポジトリ全体は498GBあり、MiniMaxの参照構成はGPU4枚を使う。手元で動かすには相応の設備が要る。

成績も強い。8月8日のArtificial Analysis「Text to Video(音声あり)」ではElo 1,240で世界2位であり、オープンウェイトでは首位である。1位のGemini Omni Flashとは4ポイント差で、95%信頼区間も重なる。

なお動画の評価はText-to-Video、Image-to-Video、Video Editing、そして音声あり/なしで別々のEloプールを持つため、「動画総合○位」という一つの数字にまとめるべきではない。

ここで一つ、注目したい構図がある。エンコーダーがQwen3-VL-32Bだということは、MiniMaxの動画モデルがアリババのオープンモデルの上に立っているということだ。HiDream-O1-Imageの8B版がQwen3-VL-8B-Instructから初期化されているのと同じである。中国の生成モデル群は、互いのオープンモデルを土台にして積み上がっている。この相互依存は、単独企業の順位表からは見えない。


第22章 HiDreamの選択

ここまでの数字を並べると、HiDreamの規模感が相対化できる。

可灵AIは約28億ドルを確保し、投資後評価額は約180億ドル。Reveの評価額も報道ベースで数十億ドル規模である。それに対しHiDreamは3カ月累計21億元超、評価額10億ドル超。桁が違う。

だからこそ、同社の戦略選択が理解できる。正面から動画モデルの品質と価格で殴り合えば、ByteDanceとAlibabaとKuaishouに体力で負ける。画像モデル単体でもOpenAIとGoogleに勝つのは難しい。

そこでHiDreamが選んだのは、アーキテクチャの賭けと、ワークフローの押さえである。

アーキテクチャの賭けがUiTだ。既存のモジュール接続型を否定し、ピクセルとテキストを同じトークン空間へ入れる。これが正しければ、後発でも一気に前に出られる。

ワークフローの押さえがvivago R1である。2026年7月18日、WAIC 2026の中国信息通信研究院主催の分科会で発表された。同社はこれを「世界初の無限時長コンテンツ創作マルチモーダルエージェント」と説明している。同時に、自社開発のエージェントOS「HD-AgentOS」も公開された。資源層、システム層、能力層の3層構造で、エージェントの実行基盤、運用とリスク管理と監視、そしてモデルとツールと知識の領域スキル化を担う。

vivago R1の特徴は「長・長・稳」の3語に集約されている。長い尺、長い思考、安定した生成だ。現行の主要AI動画製品が15秒から30秒の短いカットしか出せないのに対し、任意の長さの動画を連続生成・編集できるとする。短編ドラマ、専題番組、ブランドPVといった長尺用途を想定している。同社は「有効に使える生成の成功率85%」という数字も出しているが、これは自社発表であり第三者検証はない。

単発生成の価格は、競争が進めば下がる。しかし制作工程全体を握れば、より大きな価値を取れる。そして映像会社との資本提携が、その工程を実地で検証する場になる。

うまく組み立てられた戦略だと思う。ただし、どれもまだ検証されていない賭けである点は変わらない。


第23章 生成AIとフィジカルAIの合流

HiDreamが掲げる「ネイティブ全モーダル世界モデル」という言葉は大きい。世界モデルとは、世界の状態と変化を内部表現として学び、物体がどう動くか、人がどう行動するか、カメラを動かすと何が見えるか、行動すると環境がどう変わるかを予測するモデルである。

画像生成は一瞬の世界を作り、動画生成は時間方向の世界を作る。インタラクティブな世界モデルは、ユーザーの行動に応じて未来を生成する。ここまで来るとゲームエンジンに近づき、さらにロボットがその世界モデルを使えばフィジカルAIへつながる。

HiDream自身も、すでに「映像制作の会社」だけにとどまっていない。2026年4月の資金調達時点で、2つの提携を公表している。

一つはNoitom Robotics(諾亦騰)との協業だ。具身知能の学習データには「Vision Gap」という固有の問題がある。光学式や慣性式のモーションキャプチャ装置、触覚センサーを人体に装着すると、その装具自体が体の形状や遮蔽関係を歪め、収録される映像が実際の作業風景と食い違ってしまう。そこへ世界モデルによる動画生成を組み合わせ、実世界データと生成データを混ぜた新しいデータ生産方式を作ろうとしている。両社は動画生成と動作予測を協調させる世界モデルでも協業するという。

もう一つはBioMap(百図生科)との協業で、仮想細胞など微視的な世界モデルの構築を狙う。BioMapは2,680億パラメータの生命科学基盤モデルxTrimoを持つ企業だ。HiDreamは全モーダル生成技術と画像データの強みを持ち込み、創薬やバイオ製造向けの仮想実験を目指すとしている。

この2つは重要である。HiDreamが「世界モデル」という言葉を、映画や広告の長尺動画だけのマーケティング用語として使っているわけではない。ロボットが学習する物理世界と、生命科学がシミュレーションする微視的世界の両方へ広げようとしている。Token Hubは、その両方を一つの呼び出し基盤へ束ねるという構想だ。

この方向で重要なのがNVIDIA Cosmosだ。ロボットや自動運転AIを現実世界だけで学習させるのは高コストで危険だから、AIが生成した世界で訓練する。工場、倉庫、道路、家庭、店舗を仮想的に生成し、大量の経験を与える。

そして興味深いことに、Cosmosはすでに世界モデルの枠を超えて、画像・動画生成のランキングそのものに現れている。文生図のオープンウェイト部門でCosmos3-Super-Text2Imageが上位に入り、画像から動画の部門でもCosmos3-Super-Image2Video系がオープンウェイトの上位に並ぶ。ロボットの学習用に作られたモデルが、クリエイター向け画像生成の評価軸でも通用しているわけだ。

逆方向からも合流は起きている。第18章で見たとおり、ByteDanceはSeedance 2.5の用途として、ロボットの知覚と操作の学習データ、産業シミュレーション、自動運転のロングテール場面生成を公式に挙げた。これは将来予測ではなく、すでに企業の製品ロードマップに書かれている事実である。

ここで求められる品質は、見た目の美しさではない。物体が突然消えないこと、重力が一貫すること、衝突が正しいこと、人間の関節が自然に動くこと。生成ビジュアルAIの競争は、やがて「物理法則をどこまで学習できるか」という競争になる。


第24章 著作権・真正性・ライセンス

画像・動画AIの性能が上がるほど、社会的リスクも大きくなる。写真を見れば信じられるという時代は終わりつつある。生成画像は偽ニュースにも詐欺広告にもなりすましにも使える。動画ではさらに深刻で、人物の声と映像を同時生成できれば、実在人物が話していない内容を話しているように見せられる。

対策の実装は始まっている。GoogleはGemini Omniの全出力にSynthIDの不可視ウォーターマークを入れ、NVIDIAはSIGGRAPH 2026で合成動画検出のNIMを公開した。C2PAのような来歴情報、電子署名、プラットフォーム上の表示、企業内の承認フローも整備されつつある。

一方で、オープンウェイトモデルにはこの手立てが効きにくい。ローカルで動くモデルの出力に、提供者が事後的に印を付けることはできないからだ。オープン化の利点と真正性の要請は、正面から衝突する。

訴訟も始まっている。MiniMaxのHailuo AIに対しては、ディズニー、ユニバーサル、ワーナー・ブラザース・ディスカバリーが著作権侵害訴訟を起こしており、2026年5月に連邦地裁が却下申立てを退けて審理入りしたと報じられている。OpenAIのSoraは著作権やディープフェイクをめぐる批判の強い領域でもあった。ただし、OpenAI公式が終了理由を単一の要因として説明しているわけではないため、本稿では因果関係を断定しない。

同時に、権利を処理する側の動きもある。ByteDanceはSeedanceの商用展開にあたり、映像IPと組むAI著作権商業化プラットフォームを立ち上げたと報じられている。学習と生成の対価を、事後の訴訟ではなく事前の契約で処理しようという発想である。

つまり2026年の生成ビジュアルAIにおいて、著作権は「いずれ論点になる」ものではない。すでに事業判断を左右している。生成能力と真正性技術と権利処理は、セットで進めなければならない。


第25章 日本企業にとっての含意

日本企業が注意すべきなのは、どのAIが1位かではない。制作コストの構造が変わることである。

これまで商品広告を作るには、撮影場所、カメラマン、モデル、照明、スタジオ、編集者が必要だった。今後は商品写真一枚から、東京版、上海版、ニューヨーク版、夏版、冬版、男性向け、女性向け、日本語版、英語版、中国語版を生成できる。広告素材の限界費用が急速にゼロへ近づく。

これは広告代理店だけの話ではない。メーカー、商社、EC事業者が自社で大量のコンテンツを作れるようになる。必要なのは「生成AIを使うかどうか」の議論ではなく、制作工程をAI前提で再設計することだ。

越境ECではさらに直接的な効果がある。日本語の商品説明、商品写真、ブランドガイドを入力すると、中国語コピー、小紅書向け画像、Douyin向け縦動画、Taobao商品画像、ライブコマース台本までが自動生成される。生成AIはコンテンツ制作ツールではなく、ローカライズエンジンになる。

コンテンツ産業についても考えたい。日本にはアニメ、漫画、ゲーム、キャラクターという世界有数のIP資産がある。生成AI時代にこれは大きな武器になるが、AI基盤モデルを海外企業に依存したままだと、価値の大部分をプラットフォーム側に取られる可能性がある。公式キャラクターの顔を崩さない、権利のあるデータだけで学習する、生成履歴を管理する、ファン生成物と公式生成物を区別する。こうした基盤をどう作るかという議論が必要になる。

導入時の評価方法にも触れておく。ランキング表を眺めるだけでは不十分だ。自社の実務から20から50個の代表タスクを作り、同一条件で複数モデルを比較する。ECなら、白背景の商品写真、人物着用、季節背景、日本語文字入りバナー、中国語版、15秒商品動画、縦型SNS動画といった具合である。評価は画質だけでなく、指示遵守、商品再現性、文字精度、生成時間、再編集の回数、一枚あたりのコスト、権利条件まで記録したい。

最後に「人間が完成させるまでの総コスト」で比較する。生成価格が安くても修正に30分かかれば高い。逆にAPI価格が高くても一発で完成すれば安い。AI時代のROIは、モデル単価ではなく業務工程全体で測る必要がある。


第26章 結論

HiDreamの15億元調達を「中国でまたAIユニコーンが一社生まれた」というニュースで終わらせると、本質を見失う。重要なのは、その背後で生成AIの競争軸が変わっていることだ。

2023年の中心はLLMだった。2024年にマルチモーダル化が進み、2025年に画像と動画の品質が急速に上がった。2026年には、画像、動画、音声、編集、エージェントを統合する競争へ入っている。そして次に来るのが世界モデルである。

HiDreamのUiTはその流れの一つの回答だ。MiniMax H3は音声と動画の統合を進め、その重みを公開した。ByteDance Seedanceは巨大な動画エコシステムと結びつきながら、ロボティクスと自動運転へ用途を広げている。Alibabaは2系統の動画モデルを並走させ、Kuaishouは可灵AIを独立企業へ切り出した。GoogleはGemini、Veo、YouTubeを結びつけ、OpenAIは画像で首位を守る一方、独立したSora製品を終了した。NVIDIAはCosmosを通じて、生成世界をフィジカルAIの訓練基盤へ変えようとしている。

ここまで見ると、画像生成AIランキングの本当の意味が分かる。競争しているのは「誰が一番きれいな画像を作れるか」ではない。誰が、テキストから世界を作り、世界を編集し、時間を進め、物理を理解し、その中でAIエージェントやロボットを動かせるのか。その入口が画像生成AIである。

日本から見ると、HiDreamは突然現れたように見える。しかし中国国内では、ByteDance、Alibaba、Kuaishou、MiniMax、Tencent、HiDreamが画像、動画、音声、エージェントを巡って激しく競争してきた。その競争が世界ランキングへ表面化し始めただけだ。

「中国AIは米国AIを追いかけている」という単純な理解は、もう古い。領域ごとに米中の優位は入れ替わる。画像では93ポイント差をつけられ、動画では4ポイント差で並んでいる。

そして2026年後半から2027年にかけて見るべきなのは、HiDreamが画像生成ランキングで何位になるかではない。HiDreamが、画像生成企業から「世界を生成するAI企業」へ変身できるかどうかである。そこに、この350億円の本当の意味がある。


付録1 ランキングの読み方

本稿を書きながら、実務的に重要な発見が一つあった。同じArtificial Analysisの同じ日の表示を見ても、参照の仕方によって順位が変わるのである。

理由は表示フィルターだ。リーダーボードの上部には、全モデルを並べるか後継が出た旧モデルを畳むかの切り替え、オープンウェイトや一次開発モデルへの絞り込み、そして未ランクモデルを含めるかどうかの選択がある。

具体例を挙げる。全モデルを並べた表示では、8月8日の最終確認ではHiDream-O1-Image-1.5はElo 1,225で12位だった。ランキングは新モデル追加と投票蓄積で変動するため、「世界○位」を恒久的な肩書きとして扱わない方がよい。

時間軸でも動く。HiDream-O1-Image-1.5は6月22日の企業資料では3位だったが、8月8日にはElo 1,224で14位だった。これはモデルが突然劣化したのではなく、新モデルの追加と投票の蓄積で相対順位が変化した結果である。ランキング記事では、順位を固定的な肩書きとして扱わない方がよい。

オープンウェイト部門も同様に動く。8月8日の最終確認ではIdeogram 4.0(Quality)が1位、HiDream-O1-Image-Dev-2604が2位、ERNIE Imageが3位だった。HiDream-O1-Image-Dev-2604は、前者の数え方なら3位、後者なら2位である。

対策は単純だ。順位だけを書かない。Eloの値を書き、投票数を書き、日付を書き、どの表示条件で見たかを書く。本稿ではこの4点をできるだけ揃えた。それでも完全ではない。Eloは毎日動くからだ。

読者にお願いしたいのは、記事の順位を最終確定値として読まないことである。リンクからArtificial Analysisを開き、自分の必要な条件でフィルターをかけ、そのうえで自社のプロンプトを実際に流してほしい。順位表は入口であって、結論ではない。

これは企業がAIを導入するときの姿勢そのものでもある。ベンダー資料に載っている「世界1位」が、どの条件での1位なのかを聞く。それだけで判断の質は大きく変わる。


付録2 数字で見る2026年8月

すべて2026年8月8日時点の確認値、または各社の直近公式発表である。

【画像・世界1位】GPT Image 2(high)/OpenAI/Elo 1,368

【画像・中国1位】Seedream 5.0 Pro/ByteDance/Elo 1,276/世界8位

【画像・HiDream】HiDream-O1-Image-1.5/Elo 1,224/全モデル表示で総合14位(旧モデルを畳む表示では12位)

【画像編集・世界1位】Reve 2.1/Elo 1,261(1位から4位は統計的に同着)

【画像編集・オープン1位】HunyuanImage 3.0 Instruct/Tencent/Elo 1,222

【動画・世界1位】Gemini Omni Flash/Google/Elo 1,244

【動画・中国1位】MiniMax H3/Elo 1,240/世界2位/オープンウェイト

【動画・オープンウェイト首位(Text-to-Video・音声あり)】MiniMax H3/Elo 1,240

【動画編集・世界1位】MiniMax H3/Elo 1,130前後/公開モデルとして初

【動画・中国勢】音声付き文生動画の上位10枠のうち9枠

【HiDream調達】シリーズC 15億元/3カ月累計21億元超/評価額10億ドル超

【可灵AI】確定約28億ドル・上限約30億ドル/投資前約150億ドル・投資後約180億ドル/快手持分100%から約68%へ

【可灵AI事業】2026年Q1売上6.5億元超/前年同期比300%超/3月時点ARR約5億ドル

【Sora】Web・アプリ終了2026年4月26日/API終了予定2026年9月24日

【Seedance 2.5】単発最大30秒/参照は画像30枚・動画10本・音声10本/解像度と価格は未公表

【MiniMax H3】最長15秒・最大2K・24fps/32kHzステレオ・11言語/2K版は1秒0.13ドル/公開版は768pのH3-Base

【vivago R1】無限時長/有効成功率85%(自社発表)/2026年7月18日発表

数字は変わる。だから日付を書く。生成AIを扱う記事で唯一守るべき作法は、それだけかもしれない。


最終版注記

本稿のArtificial Analysis数値は、2026年8月8日に各リーダーボードを開いて確認したスナップショットである。Arena型のEloは投票の追加で継続的に変動するため、公開後に数ポイント、あるいは順位そのものが動く可能性がある。

「HiDreamは世界3位」という表現は、2026年6月22日時点の企業資料に基づく歴史的なスナップショットとして残し、現在の順位とは分けて記述した。

MiniMax H3については、Hugging Face上の公式モデルカードとライセンス本文を確認した。公開されているH3-Baseは768pを生成し、2KはH3-Regenerate-2Kを組み合わせる。H3-Context-IRとH3-Regenerate-2Kは初期のオープンウェイト公開には含まれない。

SoraについてはOpenAI公式ヘルプに基づき、Web/アプリは2026年4月26日終了、APIは9月24日終了予定とした。「OpenAIが動画研究そのものから撤退した」とは断定していない。

企業の自己申告と第三者のブラインド評価は、本文でも意図的に混ぜていない。HiDreamが公開するGenEvalやLongText-Benchの数値は技術特性を理解する材料であって、Artificial Analysisの人間選好評価とは目的が違う。


主要リンク・参考資料

最終確認に使用したランキング

公式・一次資料

最終再検証で使用した一次・第三者資料

第三者評価

Artificial Analysis Text to Image Leaderboard https://artificialanalysis.ai/image/leaderboard/text-to-image

Artificial Analysis Image Editing Leaderboard https://artificialanalysis.ai/image/leaderboard/editing

Artificial Analysis Text to Video Leaderboard https://artificialanalysis.ai/video/leaderboard/text-to-video

Artificial Analysis Image to Video Leaderboard https://artificialanalysis.ai/video/leaderboard/image-to-video

Artificial Analysis Video Editing Leaderboard https://artificialanalysis.ai/video/leaderboard/video-editing

HiDream

HiDream公式 https://hidream.ai/

HiDream-O1-Image 技術報告書(arXiv、2026年5月11日投稿) https://arxiv.org/abs/2605.11061

HiDream-O1-Image モデルカード(Hugging Face・MITライセンス) https://huggingface.co/HiDream-ai/HiDream-O1-Image

HiDream-O1-Image GitHub https://github.com/HiDream-ai/HiDream-O1-Image

智象未来 シリーズC 公式リリース(Media OutReach配信、2026年7月27日) https://www.biz-innovator.com/2026/07/27/智象未來-hidream-ai-完成-15-億元人民幣-c-輪融資/

上海証券報・中国証券網による15億元C輪融資報道(新浪財経転載) https://finance.sina.com.cn/roll/2026-07-23/doc-iniiviic2003863.shtml

動画生成

ByteDance Seed「Introducing Seedance 2.5」(2026年7月31日) https://seed.bytedance.com/en/blog/one-take-creation-flexible-referencing-introducing-seedance-2-5

Seedance 2.0 技術報告書(arXiv、2026年4月15日投稿) https://arxiv.org/abs/2604.14148

MiniMax「Open General Intelligence: MiniMax H3 Is Now Open Source」(2026年7月31日) https://www.minimax.io/news/minimax-h3-open-source

MiniMax H3 モデルカード(Hugging Face) https://huggingface.co/MiniMaxAI/MiniMax-H3

MiniMax-H3 公式リポジトリ(GitHub) https://github.com/MiniMax-AI/MiniMax-H3

事業・報道

CNBC:アリババがHappyHorseの開発元と認める(2026年4月10日) https://www.cnbc.com/2026/04/10/alibaba-happyhorse-ai-video-model-benchmark-reveal.html

CNBC:可灵AIへの約28億ドル増資(2026年7月3日) https://www.cnbc.com/2026/07/03/kuaishou-shares-fall-after-securing-tencent-funding-for-kling-ai.html

TechCrunch:Soraアプリ終了(2026年3月24日) https://techcrunch.com/2026/03/24/openais-sora-was-the-creepiest-app-on-your-phone-now-its-shutting-down/

OpenAI「What to know about the Sora discontinuation」 https://help.openai.com/en/articles/20001152-what-to-know-about-the-sora-discontinuation

関連企業

OpenAI https://openai.com/

Google DeepMind https://deepmind.google/

MiniMax https://www.minimax.io/

Alibaba Cloud https://www.alibabacloud.com/

Kuaishou https://www.kuaishou.com/

NVIDIA Cosmos https://www.nvidia.com/en-us/ai/cosmos/


ハッシュタグ

#HiDream #智象未来 #画像生成AI #動画生成AI #生成AI #中国AI #MiniMax #MiniMaxH3 #Seedance #ByteDance #Wan #HappyHorse #Alibaba #Kling #Kuaishou #OpenAI #GPTImage #Google #GeminiOmni #NanoBanana #Reve #NVIDIA #Cosmos #vivago #HiHarness #マルチモーダルAI #世界モデル #フィジカルAI #AIエージェント #映像生成AI #オープンウェイト #ArtificialAnalysis #梅濤 #合肥 #越境EC #広告AI #コンテンツ産業

いいなと思ったら応援しよう!

この記事は noteマネー にピックアップされました

noteマネーのバナー