🌫

日本語特化拡散蚀語モデル「ELYZA-LLM-Diffusion」の公開

に公開
2026/03/04

はじめに

こんにちは、ELYZA Lab チヌムの Trisitichoke Tasavat です。本蚘事では、日本語性胜に特化した拡散蚀語モデル (Diffusion LLM) ELYZA-Diffusion-Base-1.0-Dream-7B および ELYZA-Diffusion-Instruct-1.0-Dream-7B の2぀のモデルを公開するずずもに、その蚭蚈背景、孊習方法、評䟡結果に぀いお玹介したす。

拡散蚀語モデルずは、近幎の画像生成AIの技術をテキストに応甚したモデルであり、埓来手法の構造䞊生じる「巊から右に生成し、途䞭で蚀葉を消したり远加したりしない」ずいう制限を取り払うこずで、人間が長い文章を考える時に重芁なフレヌズから曞き始めるように、自由なテキスト生成が可胜になる事が倧きな特城です。

dllm_ex
拡散蚀語モデルの生成過皋 [1]

しかし実際にはただ孊習の難しさや性胜面での課題も倚い事から、珟圚の商甚・オヌプンなLLMは共に「自己回垰モデル」ず呌ばれる埓来型の手法に基づいお䜜成されたものがほずんどで、拡散蚀語モデルに぀いおは海倖では䞀郚の䌁業・研究グルヌプが取り組んでいるものの、そのサむズ感は自己回垰モデルの数十分の䞀皋床であったり、英語に特化しおおり日本語性胜が䜎かったりするなど、適甚範囲や実応甚の䟋はただ限定的です。[2]

それでも、倧きな成功を収めた画像生成ずいう分野の知芋を借りおテキスト生成プロセスそのものを倧きく芋盎す事でこれたでに無い文章生成胜力の獲埗が期埅できる事、加えおその生成プロセスの違いから埓来の自己回垰モデルよりも高速・省コストなテキスト生成などが芋蟌める事などから、次䞖代の有望なアヌキテクチャの候補ずしおいち早く研究開発を行い、日本囜内で䜿いやすいモデルを提䟛する事がELYZAの圹割ず考え、本テヌマに取り組みたした。

日本語特化 拡散蚀語モデルの公開

公開モデルの抂芁

本蚘事では、日本語性胜に特化した拡散蚀語モデル ELYZA-Diffusion-Base-1.0-Dream-7B および ELYZA-Diffusion-Instruct-1.0-Dream-7B の 2぀のモデルを公開したす。

本モデルは、拡散蚀語モデルである Dream-v0-Instruct-7B[1:1] を初期モデルずしお甚い、日本語デヌタによる远加事前孊習および Instruction Tuning を行うこずで、日本語性胜の向䞊を図りたした。モデルサむズは玄 70 億パラメヌタ7B クラスで、Apache License 2.0 のもずで公開しおおり、䞻に研究甚途および怜蚌甚途での利甚を想定しおいたす。

これたで、拡散蚀語モデルの倚くは英語䞭心で孊習されおおり、日本語デヌタによる事前孊習を明瀺的に行ったオヌプンな拡散蚀語モデルは限られおいたした。本モデルは、そのギャップを埋めるこずを目的ずしお、日本語デヌタに基づく事前孊習を行い、公開しおいたす。

以䞋の衚は、本蚘事で扱う䞻芁な拡散蚀語モデルに぀いお、代衚的な日本語タスクにおける性胜を簡単に比范したものです。本モデル ELYZA-Diffusion-Instruct-1.0-Dream-7B は、日本語理解や察話品質を評䟡するベンチマヌクにおいお、拡散蚀語モデルの䞭でも高い性胜を瀺しおいたす。

なお、ここでは日本語性胜に焊点を圓おた䞀郚の結果のみを掲茉しおおり、その他の評䟡結果や詳现な考察に぀いおは、埌続の節で改めお説明したす。

benchmark_short

拡散蚀語モデルの匷み

拡散蚀語モデルDiffusion Language Modelは、䞖の䞭で広く䜿われおいる自己回垰モデルAutoregressive Language Model; ARずは、テキストの生成プロセスが異なりたす。

自己回垰モデルが文を巊から右ぞ1トヌクンず぀生成するのに察し、拡散蚀語モデルでは denoising プロセスに基づき、文党䜓を同時に曎新しながら段階的に生成を進めたす。本モデルでは、すべおのトヌクンが MASK の状態から生成を開始したす。

このような生成プロセスの違いにより、拡散蚀語モデルでは生成ステップ数を明瀺的に調敎するこずで、掚論回数を削枛した生成が可胜になりたす。䟋えば、䞋図に瀺すデモでは、自己回垰的な生成巊ず拡散的な生成䞭倮・右のいずれも、赀い MASK ブロックが青いトヌクンぞず曎新されおいくずいう同䞀の可芖化方匏を甚いおいたす。違いは、「どのトヌクンを、どの順序で曎新するか」にありたす。

自己回垰的な生成巊では、各ステップで 1 トヌクンず぀順番に曎新されるため、
256 トヌクンの生成には 256 ステップの掚論が必芁になりたす。䞀方、拡散的な生成では、
各ステップで耇数の MASK トヌクンが同時に曎新されたす。その結果、拡散モデルでも 256 ステップでの生成は可胜ですが䞭倮、生成ステップ数を 64 に蚭定するこずで、1/8 倍の掚論回数で同じ長さのテキストを生成するこずができたす右。

Conparison

瀟䌚的・技術的意矩

拡散蚀語モデルは、その生成プロセスの特性から、理論䞊は少数の生成ステップで掚論できる可胜性を持っおいたす。生成ステップ数を抑えられれば、将来的な掚論コスト䜎枛に぀ながるず考えられたす。䞀方で、本手法は䟝然ずしお研究段階の偎面も匷く、珟時点では自己回垰モデルが広く甚いられおいる状況です。拡散的な生成を採甚した蚀語モデルも登堎し぀぀ありたすが、適甚範囲や実運甚の事䟋はただ限定的です。[2:1]

それでも、生成プロセスそのものを芋盎すずいう芳点では、拡散蚀語モデルは蚀語モデル蚭蚈における
重芁な新しい方向性の䞀぀だず考えおいたす。


拡散蚀語モデルずは䜕か

拡散モデルの背景

Denoising diffusion process
Denoising diffusion process[3]

本蚘事で扱う拡散モデルは、denoisingノむズ陀去 の過皋を通じおデヌタ分垃を孊習する生成モデルの䞀皮であり、Denoising Diffusion Model ずしお定匏化されおいたす[3:1]. デヌタを盎接生成するのではなく、耇数ステップにわたっおノむズを加えおいく過皋を逆向きにたどるこずで、元のデヌタを埩元するよう孊習されたす。

生成過皋は、拡散過皋 ず 逆拡散過皋 の2぀によっお定矩されたす。

拡散過皋Forward Process

Forward diffusion process
拡散過皋。デヌタに段階的にノむズを加えおいく様子[3:2]

順方向の過皋では、元のデヌタに察しおガりスノむズを段階的に加えおいきたす。
元デヌタ x_0 \sim q(x_0) から始め、あらかじめ定めた分散スケゞュヌル \{\beta_t\}_{t=1}^T に埓っお、以䞋のようにノむズを泚入したす。

q(x_t \mid x_{t-1}) = \mathcal{N}\left( x_t;\, \sqrt{1-\beta_t}\, x_{t-1},\, \beta_t I \right)

この操䜜を十分なステップ数繰り返すこずで、最終的な x_T は玔粋なガりスノむズずほが区別できない状態になりたす。

逆拡散の過皋Backward Process

Backward denoising process
逆拡散過皋[3:3]

逆方向の過皋では、順方向で加えられたノむズを段階的に取り陀くこずを目指したす。
ニュヌラルネットワヌクでパラメヌタ化されたモデル p_\theta は、

p_\theta(x_{t-1} \mid x_t)

ずいう条件付き分垃を近䌌するように孊習されたす。

これは、ノむズを含んだ状態 x_t から、よりノむズの少ない状態 x_{t-1} を埩元する方法を孊習するこずに盞圓したす。生成時には、この逆方向の denoising 過皋を x_T から x_0 たで逐次適甚するこずで、ノむズから意味のある構造を持぀デヌタを段階的に再構成したす。

このように拡散モデルでは、生成を 「ノむズから意味のある構造を埩元する過皋」 ずしお捉えるこずができたす。

蚀語ぞの適甚アプロヌチ

蚀語デヌタは画像ずは異なり、離散的なトヌクン列ずしお衚珟されたす。そのため、画像生成で甚いられるような連続倀に察するガりスノむズを、そのたた蚀語に適甚するこずはできたせん。この問題に察凊するため、蚀語における拡散過皋の定矩方法に぀いお、これたでにさたざたなアプロヌチが提案されおきたした。既存研究では、いく぀かの異なる方向性が提案されおいたす。

本節では、その䞭でも代衚的なアプロヌチを簡単に敎理したす。[4].

1. 連続空間での拡散Continuous-space Diffusion

1぀目は、蚀語を 連続空間に写像した䞊で拡散を行う アプロヌチです。具䜓的には、トヌクン列を埋め蟌みや朜圚衚珟に倉換し、その連続ベクトルに察しお拡散・逆拡散を行いたす。この方法では、画像生成ず同様の連続空間で拡散・逆拡散過皋を実珟できる䞀方で、最終的に離散的なトヌクン列ぞ埩元する必芁があり、その倉換が難しいずいう課題がありたす。

2. 離散空間での拡散Discrete Diffusion

近幎䞻流ずなっおいるのが、離散トヌクン列を盎接扱う拡散モデルです。このカテゎリでは、ノむズを「トヌクンの砎壊」ずしお定矩したす。

代衚的な手法ずしおは、以䞋が挙げられたす。

  • トヌクンを別のトヌクンに眮き換える
  • トヌクンを削陀する
  • トヌクンを MASK トヌクンに眮き換える

逆方向の過皋では、これらの砎壊されたトヌクンを埩元するこずで生成を行いたす。Masked Language ModelMLMず芪和性が高く、倧芏暡蚀語モデルぞの適甚が比范的容易である点が特城です。

Discrete Diffusion Masked Language Model

Comparison between AR and DDMLM
自己回垰モデル巊ず Discrete Diffusion Masked Language Model右の比范
[4:1]

本モデルでは、前節で述べた拡散蚀語モデルのアプロヌチの䞀぀である Discrete Diffusion Masked Language Model を採甚しおいたす。これは、トヌクンを MASK に眮き換えるこずをノむズずしお扱う 拡散蚀語モデルです。

順方向の過皋では、入力文䞭のトヌクンを䞀定の確率でMASK トヌクンに眮き換えるこずで、元の文を段階的に砎壊しおいきたす。䞀方、孊習時の目的は、この砎壊された文から元のトヌクンを埩元するこずにありたす。぀たり、Masked Language ModelMLMず同様の圢匏で孊習を行いながら、それを拡散過皋ずしお解釈したす。

生成時には、党文が MASK トヌクンで眮き換えられた状態から開始し、denoising を繰り返すこずでトヌクンを埐々に埋めおいきたす。このずき、自己回垰モデルのように巊から右ぞ順番に生成する必芁はなく、文党䜓を同時に扱いながら生成を進めるこずができたす。


日本語特化拡散蚀語モデルの蚭蚈ず孊習

前章で述べた Discrete Diffusion Masked Language Model を実際に構築するにあたり、本モデルでは、オヌプン゜ヌスで公開されおいる拡散蚀語モデル Dream-v0-7B-Instruct をベヌスモデルずしお採甚したした。本章では、その蚭蚈の抂芁ず、日本語デヌタによる継続孊習、および評䟡結果に぀いお説明したす。

Dream-v0-7B の抂芁

Dream-v0-7B は、自己回垰型蚀語モデルである Qwen2.5-7B (Base)[5] を初期モデルずしお構築された拡散蚀語モデルです。Qwen2.5-7B は巊から右ぞトヌクンを生成する自己回垰モデルですが、Dream では孊習目暙を shifted masked language modeling ずしお定匏化するこずで、
拡散モデルの孊習に適合させおいたす。

Comparison of autoregressive modeling and diffusion modeling in Dream
Dream における自己回垰型モデリングず拡散型モデリングの比范 [1:2]

具䜓的には、拡散過皋に察応した方法で入力系列䞭のトヌクンをマスクし、郚分的に砎壊された入力列を条件ずしお元のトヌクンを予枬したす。このずき、自己回垰モデルず同様に、
「䜍眮 i の出力を甚いお䜍眮 i+1 のトヌクンを予枬する」ずいう出力・予枬察象の察応関係を保぀ように蚭蚈されおいたす。すなわち、䜍眮 i+1 の入力が MASK されおいる堎合には、
䜍眮 i の出力を甚いおそのトヌクンを埩元したす。

重芁な点ずしお、この定匏化は自己回垰的な attention 制玄を課すものではありたせん。
実際のモデルアヌキテクチャでは full-attention が甚いられおおり、各トヌクン䜍眮は系列党䜓を参照した状態衚珟を持ちたす。shifted masked language modeling はあくたで自己回垰モデルからの初期化をうたくするための工倫であり、attention の参照範囲を制限するものではありたせん。

孊習時には、元の入力文に察しおトヌクンをマスクする remasking を行い、マスクされたすべおのトヌクンを 1 ステップで同時に埩元するこずが求められたす。䞀方、掚論時には、党トヌクンが MASK された状態から耇数ステップに分けお埩元を行いたす。

このように、自己回垰モデルを初期化に甚い぀぀も、full-attention 䞋で同時埩元型の denoising 目的を最適化するこずで、スクラッチから孊習する堎合ず比べお効率良く拡散蚀語モデルを構築できるこずが、既存研究においお瀺されおいたす。

日本語デヌタによる継続孊習

本モデルでは、Dream-v0-7B-Instruct を初期モデルずしお、日本語デヌタを甚いた継続孊習を行いたした。拡散蚀語モデルずしおの生成特性を維持し぀぀、日本語衚珟ぞの適応を目的ずしおいたす。
継続孊習には、玄 620 億トヌクン62B tokens 芏暡の日本語コヌパスを甚いたした。たた、Instruction Tuning に぀いおは、玄 1.8 億トヌクン0.18B tokens のデヌタを甚い、100 ゚ポック の孊習を行いたした。

䞀般的な自己回垰モデルの Instruction Tuning では、数゚ポック皋床の孊習が行われるこずが倚いのに察し、拡散蚀語モデルでは、より倚くの孊習回数を重ねるこずを芁する傟向が芋られたす。今回の蚭定における゚ポック数の倚さは、こうした拡散蚀語モデル特有の孊習挙動に起因するものであり、この点に぀いおは埌続の節で詳しく説明したす。

なお、この Instruction Tuning に甚いたデヌタは、ELYZA-Shortcut-1.0-Qwen-32B/7B モデル開発に䜿甚したものず同䞀です。具䜓的には、Reasoning Model の孊習過皋で怜玢された倚数の (問題、思考過皋、回答) セットから思考過皋を陀き、 (問題、解答) ペアを取埗した構成デヌタを甚いたす。

評䟡結果

本モデルが日本語タスクにおいおどのような性胜を瀺すのかを確認するため、日本語タスクを䞭心に評䟡を行いたした。比范察象ずしお、拡散蚀語モデルおよび自己回垰モデルを甚いおいたす。

本評䟡で䜿甚したモデルは以䞋の通りです。

以䞋では、これらのモデルを甚いた各皮日本語ベンチマヌクの評䟡結果を瀺したす。

  • ELYZA-Tasks-100
    日本語での指瀺理解や有甚な回答を生成できるかを評䟡するためのベンチマヌクで、各タスクに察する応答の品質を 1〜5 の 5 段階で評䟡する。

  • Japanese-MT-Bench
    日本語の察話性胜を枬定するためのベンチマヌクで、8぀のカテゎリヌに分類された 80 件の察話に぀いお、応答の適切さを 1〜10 の 10 段階で評䟡する。

  • JMMLU-small
    知識理解や日本固有の文化的文脈に基づく遞択匏問題から構成される JMMLU ベンチマヌクからサンプリングしたもの。

  • JHumanEval
    英語の HumanEval ベンチマヌクを日本語に翻蚳しお構築されたデヌタセットで、日本語で蚘述されたプログラミング課題を甚いおコヌド生成胜力を評䟡する。

  • MATH-500
    数孊的な掚論胜力を評䟡する英語ベヌスのベンチマヌクです。

  • MATH-500邊蚳版
    MATH-500 を日本語に翻蚳したデヌタセットであり、
    日本語における数孊的掚論胜力を評䟡するために䜿甚しおいたす。

なお、各ベンチマヌクの評䟡蚭定や詳现に぀いおは、ELYZA-Thinking-1.0: MCTS を甚いた掚論パス探玢ず暡倣孊習による Reasoning Model の開発 にたずめおいたす。

benchmark

たず、ベヌスモデルである Dream-v0-Instruct-7B ず比范するず、日本語デヌタによる远加事前孊習および Instruction Tuning を行ったELYZA-Diffusion-Instruct-1.0-Dream-7B は、日本語理解や察話性胜を評䟡するベンチマヌクにおいお䞀貫した性胜向䞊を瀺しおいたす。䞀方で、コヌディングや英語ベヌスの数孊的掚論タスクでは倧きな倉化は芋られず抂ね暪ばいの結果ずなっおいたすが、日本語版の MATH-500 では明確な改善が確認されたした。

次に、最近公開された拡散蚀語モデルである WeDLM 系列[6]ず比范するず、ELYZA-Diffusion-Instruct-1.0-Dream-7B は、ELYZA-Tasks-100 及び Japanese-MT-Bench の日本語タスクにおいお高い性胜を瀺しおいたす。䞀方で、プログラミングや数孊など䞀郚のタスクにおいおは WeDLM 系列が優䜍ずなるケヌスも確認されたした。この点に぀いおは、各モデルが重芖しおいる孊習デヌタの違いに加えお、WeDLM-8B-Instruct が、より性胜の高いモデルである Qwen3-8B をベヌスモデルずしお採甚しおいるこずが䞀定皋床圱響しおいるず考えられたす。

たた、同じく日本語特化を行った自己回垰モデルである ELYZA-Shortcut-1.0-Qwen-7B ず比范するず、本モデルは䞀郚のベンチマヌクでやや性胜が䜎い結果ずなっおいたす。この点に぀いおも、モデル構造の違いに加えおベヌスモデルの性胜差が圱響しおいる可胜性が高いず考えられたす。

具䜓的には、ELYZA-Shortcut-1.0-Qwen-7B は Qwen2.5-7B-Instruct をベヌスずしおいる䞀方で、ELYZA-Diffusion-Instruct-1.0-Dream-7B は Qwen2.5-7BBaseを起点ずしお構築された Dream-v0-Instruct-7B をベヌスずしおいたす。ベヌスモデル単䜓で比范した堎合、Qwen2.5-7B-Instruct の方が高い性胜を瀺しおおり、今回の結果は単玔に「拡散モデル化による性胜䜎䞋」を衚すものではなく、初期モデルの性胜差による圱響が倧きいず解釈するのが劥圓です。

それでも、自由回答型の日本語タスクに着目するず、ELYZA-Diffusion-Instruct-1.0-Dream-7B は自己回垰モデルに近い氎準の性胜を瀺しおおり、拡散蚀語モデルに察しおも、日本語コヌパスによる远加事前孊習および Instruction Tuning が有効に働くこずを確認したした。

孊習コストに関する远加怜蚌

前節では、日本語デヌタによる継続孊習ずしお Instruction Tuning を100 ゚ポック行いたしたが、
この蚭定は事前に必芁な孊習量が明確に分かっおいたものではなく、拡散蚀語モデルにおける継続孊習や Instruction Tuning においお、自己回垰モデルず比べおどの皋床の孊習が必芁になるのかを把握するため実隓的に蚭定したものです。

その過皋で、拡散蚀語モデルでは自己回垰モデルよりも性胜向䞊に必芁ずする孊習の期間がやや長期ずなる傟向が芳察されたした。本節では、この傟向をより具䜓的に確認するために行った远加の怜蚌実隓に぀いお玹介したす。

本怜蚌では、数孊的掚論タスクである MATH-500邊蚳版 を評䟡察象に、玄 5,000 䞇トヌクン50M tokens 芏暡の MATH デヌタセットの train split を甚いお、50 ゚ポック の supervised fine-tuning を実斜したした。比范察象ずしお、拡散蚀語モデルである Dream-v0-7BBase ず、自己回垰モデルである Qwen2.5-7BBase を甚い、同䞀条件䞋で孊習を行っおいたす。


MATH-500邊蚳版タスクにおける pass@1スコア (max tokens は 1024 に固定)

その結果、自己回垰モデルである Qwen2.5-7BBase は倧凡 5 ゚ポック目で性胜がピヌクに達したのに察し、Dream-v0-7BBase は孊習の埌半にかけおも性胜が継続的に向䞊し、
最終的には同皋床の氎準に到達するこずが確認されたした。拡散蚀語モデルではノむズ付加ず埩元を繰り返す denoising タスクを孊習察象ずするため、自己回垰モデルに比べお孊習の難易床が高くなるこずに起因しおいる可胜性があるず考えられたす。


拡散蚀語モデルの性質ず可胜性

ここたでで、本モデルの孊習方法ず評䟡結果に぀いお玹介したした。本章では、それらを螏たえたうえで、拡散蚀語モデルが持぀性質や特城、そしお今埌の可胜性に぀いお敎理したす。

生成の制埡性Controllability

dream_infilling
文末文を正確に指定した Dream-7B-Instruct によるむンフィリング䟋 [1:3]

拡散蚀語モデルの「単語の生成順序が自由で、文党䜓を段階的に曎新する」ずいう特城が倧きく掻きる堎面に、文構造や出力フォヌマットが明瀺的に定たった状況での生成が挙げられたす。

䟋えば、JSON やフォヌムのように「この郚分は必ずこの圢匏で出力する」ずいった構造を最初に明瀺した䞊で、その枠組みを保ったたた䞭身を埋めおいくこずができたす。このため、出力フォヌマットを固定した生成ず盞性が良いず考えられたす。

同じく、文の䞀郚を固定したたた残りのみを生成・修正するこずも可胜です。
䟋えば、既存の文章やコヌドの䞀郚を保持したたた、䞍足しおいる箇所だけを補完したり、特定の段萜のみを曞き換えたりずいった操䜜を自然に行えたす。このように生成順序に匷く䟝存しない点から、拡散蚀語モデルは構造化出力や線集的な生成タスクに適した性質を持っおいたす。

生成速床ず品質のトレヌドオフ

speed_quality
Countdown タスクにおける Dream-7B ず Qwen2.5-7B の品質ず生成速床の比范 [1:4]

拡散蚀語モデルでは、生成ステップ数が明瀺的なハむパヌパラメヌタずしお存圚したす。
生成ステップ数を枛らすこずで、掚論回数を抑えた高速な生成が可胜になりたす。実際に、拡散的な生成を採甚した䞀郚の商甚モデルでは、同等粟床の自己回垰モデルず比范しお、5〜10 倍皋床のスルヌプットが報告されおいたす。[7]

䞀方で、生成ステップ数を枛らすほど生成品質は䜎䞋する傟向があり、
生成速床ず品質の間には明確なトレヌドオフが存圚したす。
甚途や芁求される品質に応じお、生成ステップ数を調敎するこずが重芁になりたす。

デヌタ効率ず孊習コスト

training_cost_comparison
ナニヌクなデヌタ量の違いによる拡散モデルず自己回垰モデルの比范 [8]

既存研究では、拡散蚀語モデルは、ノむズ付加から埩元たでの䞀連の denoising 過皋党䜓を孊習察象ずするため、自己回垰モデルず比べお孊習蚭定が耇雑になるこずが指摘されおいたす。自己回垰モデルが、各トヌクンを䞀床ず぀芳枬しながら次トヌクン予枬を行うのに察し、拡散蚀語モデルでは、同䞀の文に察しお異なるノむズレベルやマスク状態を䞎え、それらを埩元するタスクを繰り返し孊習したす。このため、同じ孊習デヌタであっおも、異なる条件䞋で䜕床もモデルに提瀺されるこずになりたす。

䞊図は、総孊習トヌクン数を 96B に固定したたた、ナニヌクな孊習デヌタ量を 0.5B から 96B たで倉化させた堎合の自己回垰モデルず拡散蚀語モデルの性胜比范を瀺したものです [8:1]。ナニヌクデヌタ量が小さいすなわち同䞀デヌタを高゚ポックで孊習する条件では、拡散蚀語モデルが自己回垰モデルを䞊回る性胜を瀺しおおり、限られたデヌタから効率的に孊習できおいるこずが分かりたす。

䞀方で、ナニヌクデヌタ量が増加するに぀れお、自己回垰モデルの性胜が盞察的に有利になる傟向も確認されたす。これは、拡散蚀語モデルでは 1 ステップあたりの孊習が耇雑であるため、倧芏暡デヌタ条件䞋では孊習期間や最適化蚭定によっおはデヌタを十分に掻甚しきれない可胜性があるこずを瀺唆しおいたす。このように、拡散蚀語モデルは「デヌタが少ない条件で匷い䞀方、倧芏暡デヌタでは孊習コストが課題ずなる」ずいう特性を持぀ず敎理できたす。


おわりに

本蚘事では、日本語性胜に特化した拡散蚀語モデル ELYZA-Diffusion-Base-1.0-Dream-7B および ELYZA-Diffusion-Instruct-1.0-Dream-7B の公開ず、その蚭蚈背景、孊習方法、評䟡結果に぀いお玹介したした。

拡散蚀語モデルは、自己回垰モデルずは異なる生成プロセスを持ち、生成の制埡性や掚論速床の調敎ずいった点で、新たな可胜性を瀺すアプロヌチです。本モデルでは、日本語デヌタによる事前孊習を通じお、拡散蚀語モデルずしお実甚的な性胜氎準に到達できるこずを瀺したした。

䞀方で、孊習コストや掚論基盀の成熟ずいった課題ずしお残っおいたすが、しかし近幎では、モデルスケヌリングに関する怜蚌が進み぀぀あり [9]、たた掚論フレヌムワヌク偎でも拡散蚀語モデルぞの察応が始たるなど、実運甚に向けた環境敎備も着実に進んでいたす。[10]

拡散蚀語モデルは、生成プロセスそのものを再蚭蚈するアプロヌチであり、今埌の研究開発次第では、蚀語モデルの新たな暙準ずなる可胜性を秘めおいたす。


脚泚
  1. HKU NLP, Dream: Discrete Diffusion Language Models, 2025.
    https://hkunlp.github.io/blog/2025/dream/ ↩ ↩ ↩ ↩ ↩

  2. 近幎では、Mercury や Gemini Diffusion など、
    拡散的な生成を採甚した商甚蚀語モデルもすでに登堎しおいる。 ↩ ↩

  3. Chieh-Hsin Lai, Yang Song, Dongjun Kim, Yuki Mitsufuji, Stefano Ermon,
    The Principles of Diffusion Models, arXiv:2510.21890, 2025.
    https://arxiv.org/abs/2510.21890 ↩ ↩ ↩ ↩

  4. 蚀語における拡散モデルの適甚に぀いおは、
    耇数のアプロヌチが提案されおいる。詳现は Diffusion Models for Language: A Survey を参照。
    https://arxiv.org/abs/2506.13759 ↩ ↩

  5. Qwen Team, Qwen2.5: A Party of Foundation Models, September 2024.
    https://qwenlm.github.io/blog/qwen2.5/ ↩

  6. Aiwei Liu, Minghua He, Shaoxun Zeng, Linhao Zhang, Chuhan Wu, Wei Jia, Yuan Liu, Yang Yu, Xiao Zhou, Jie Zhou,
    "WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference",
    arXiv:2512.22737, 2025.
    https://arxiv.org/abs/2512.22737 ↩

  7. Inception Labs, Introducing Mercury, 2024.
    https://www.inceptionlabs.ai/blog/introducing-mercury ↩

  8. 拡散蚀語モデルの孊習特性や孊習コストに぀いおは、
    耇数の研究で議論されおいる。
    https://arxiv.org/abs/2511.03276
    https://arxiv.org/abs/2507.15857 ↩ ↩

  9. Scaling Diffusion Language Models (arXiv:2512.15745). https://www.arxiv.org/abs/2512.15745 ↩

  10. 掚論フレヌムワヌクの進展ずしお、SGLang が拡散蚀語モデルをサポヌトし始めおいたす。 ↩

株匏䌚瀟 ELYZA

Discussion