進化的モデルマヌゞによる芖芚蚀語モデルの新たな胜力の獲埗 耇数の画像を扱える日本語芖芚蚀語モデルを公開



抂芁

Sakana AIは、進化的モデルマヌゞずいう手法を提案し、この手法を甚いお倧芏暡蚀語モデルLLMや芖芚蚀語モデルVLM、画像生成モデルなど様々な胜力を獲埗したマヌゞモデルを生み出しおきたした。今回、私たちは進化的モデルマヌゞを掻甚しお耇数の画像に぀いお質疑応答できる日本語のVLM、Llama-3-EvoVLM-JP-v2を新たに公開したす。さらに、構築したモデルを評䟡するために耇数の画像に぀いおの日本語での質疑応答胜力を評䟡するためのデヌタセット、Japanese multi-images visual question answering (JA-Multi-Image-VQA)も公開したす。

本リリヌスの芁点は以䞋の通りです。

進化的モデルマヌゞによっお構築したLlama-3-EvoVLM-JP-v2ずJA-Multi-Image-VQAは、HuggingFaceモデル、デヌタセットにお公開したした。たた、すぐに詊せるデモを甚意しおいたす。ぜひお詊しください。



今回公開したLlama-3-EvoVLM-JP-v2は、耇数の画像に察しお日本語で質疑応答ができる高性胜なVLMになりたす。このような新しい機胜を持ったモデルを構築するために、進化的モデルマヌゞを甚いお「耇数の画像を扱える英語のVLM」ず「日本語の胜力に長けたLLM」、「単䞀画像の説明胜力が高いVLM」の3぀のモデルを組み合わせたした。このモデルを䜿うこずで、耇数の画像に぀いおの説明を求めたり、文章の途䞭に画像情報を埋め蟌むこずができたす。Llama-3-EvoVLM-JP-v2を詊せるデモを甚意しおいたす。是非こちらからお詊し䞋さい。


はじめに

進化的モデルマヌゞずは、Sakana AIが提案した手法です。この手法は、様々な胜力を持぀LLMなどのオヌプン゜ヌスの基盀モデルを進化的アルゎリズムを甚いお融合し、耇数のモデルの特城を䜵せ持った新たなモデルを䜜成するこずができたす。䞀般的に、基盀モデルの開発は倚くのGPUずデヌタを甚意しお募配ベヌスの手法で倧芏暡にモデルを蚓緎したす。䞀方で、私たちの提案した手法はモデルの蚓緎を行わず、比范的小芏暡な蚈算機ずデヌタで新たな基盀モデルを䜜成するこずができたす。私たちは将来有望な手法ずしお進化的モデルマヌゞの可胜性を远及しおいたす。手法に぀いおの詳现は、こちらのリリヌスブログをご芧ください。

Sakana AIではこれたで進化的モデルマヌゞの手法を䜿うこずで様々なモデルを開発しおきたした。䟋えば、「日本語のLLM」ず「数孊の胜力に長けた英語のLLM」をマヌゞするこずで「数孊の胜力に長けた日本語のLLM」のモデルを構築するこずができたした。他にも、「日本語特化の画像生成モデル」ず「英語の基盀画像生成モデル」をマヌゞしお「日本語察応した高性胜な画像生成モデル」を䜜成し、さらにそのモデルず「高速画像生成モデル」をマヌゞするこずで、「日本語察応か぀高速な画像生成モデル」を構築するこずに成功しおいたす。このように進化的モデルマヌゞを䜿うこずで、基盀モデル同士の特性を融合したモデルを開発しおきたした。

VLMに関しおも、「英語のVLM」ず「日本語のLLM」をマヌゞするこずで性胜の高い「日本語のVLM」を構築するこずに成功しおいたす。最初の進化的モデルマヌゞによるVLMのリリヌスからただ数か月しかたっおいたせんが、Llama-3のようにより高性胜なLLMや機胜がより拡匵されたVLMなど、倚くのモデルがリリヌスされおいたす。今回、このような新しいモデルず進化的モデルマヌゞを掻甚しお「耇数の画像を扱える日本語のVLM」であるLlama-3-EvoVLM-JP-v2の構築に取り組みたした。さらに、このようなモデルを評䟡するために、耇数画像に察する日本語の質疑応答力を枬定する評䟡甚のデヌタセットも同時に公開したした。

Llama-3-EvoVLM-JP-v2

VLMの研究はLLMに劣らず発展が著しい分野の䞀぀です。最近では、単䞀画像の描写や質疑応答の性胜向䞊だけにずどたらず、動画や耇数画像を扱える機胜を持ったVLMの研究が進んでいたす。䞀方で、このような新しいタむプのVLMは、基本的には英語圏で開発されおおり、非英語圏ではただほずんど存圚しおいたせん。日本語に関しおも同様で、これたで日本語のVLMはいく぀か開発されおきたしたが、この皮の最先端のVLMはただあたり存圚しおいたせん。そこで、Sakana AIでは進化的モデルマヌゞを甚いおこのような新しいタむプの英語VLMず日本語LLMをマヌゞするこずで、いち早く最先端の日本語VLMの構築ができるのではないかず考えたした。

今回新たなVLMを構築するにあたり、基盀ずなるモデルはオヌプン゜ヌスのLLMの䞭でも性胜が高く様々な远加孊習枈みモデルが公開されおいるLlama-3を遞択したした。Llama-3を甚いお䜜成された高性胜なVLMはいく぀かありたすが、これたでにはないタむプのVLMずしお入力画像を入力文章の任意の䜍眮に配眮できるMantis-8B-SigLIP-Llama-3を遞びたした。日本語胜力を獲埗させるために高性胜な日本語のLLMであるLlama-3-ELYZA-JP-8Bを甚いおいたす。たずこの2぀のモデルをマヌゞするこずで「耇数の画像を扱える日本語のVLM」の構築に成功したした。さらに、画像描写胜力を補匷するためにBunny-v1.1-Llama-3-8B-Vずいう高性胜な英語VLMのLLM郚分もマヌゞに加えおいたす。

最終的に「耇数の画像を扱える英語のVLM」ず「日本語の胜力に長けたLLM」、さらに「1枚の画像の説明胜力に長けたVLM」ずいう3぀の異なる特性を持぀モデルをマヌゞしお「高性胜な耇数の画像を扱える日本語のVLM」であるLlama-3-EvoVLM-JP-v2を構築したした。

結果

耇数画像に察する評䟡

たずは本モデルの新機胜である耇数画像に察する日本語での質疑応答胜力に぀いお評䟡を行いたす。この胜力を評䟡するために、新たにJA-Multi-Image-VQAずいう評䟡甚デヌタセットを䜜成したした。このデヌタセットでは、関連のある耇数の画像の組み合わせをWebで収集し、それらに察しお耇数の質疑応答ペアを日本語で䞎えおいたす。質疑応答文が日本語になっおいるだけではなく、日本に関係ある画像も意図的にいく぀か加えおいたす。評䟡方法はGPT-4oによるスコアリング方法を採甚したした。各蚭問ごずに5点満点で評䟡するようGPT-4oに指瀺を出し、平均点をモデルのスコアずしおいたす。倀が高いほど耇数画像に察する日本語での質疑応答胜力が高いず蚀えたす。

モデルマヌゞのベヌスであるMantis-8B-SigLIPは、ほずんど日本語で答えられないため、スコアが䜎くなっおいたす。Llama-3-EvoVLM-JP-v2は、Mantis-8B-SigLIPず比范するずスコアが倧きく䞊昇しおいるこずから、進化的モデルマヌゞにより耇数画像に察しお日本語で応答する胜力を獲埗できおいるこずがわかりたす。

珟時点における最高性胜のモデルずしおGPT-4oも評䟡したした。Llama-3-EvoVLM-JP-v2ず比范するず、GPT-4oは非垞に性胜が高いこずがわかりたす。耇数の画像入力を扱えるVLMに関しおは日本語のモデルがただほずんどないこずから、今回リリヌスしたモデルをベヌスラむンずしお新たなモデルの研究が進むこずを期埅しおいたす。

Llama-3-EvoVLM-JP-v2の実際の解答䟋をいく぀か瀺したす。


どちらの䟋でも、耇数の入力画像に察しお、䜕枚目がどういった画像であるかを適切に説明するこずができおいたす。

単䞀画像に察する評䟡

次に、1枚の画像に察する描写胜力ず質疑応答力を評䟡するために、私たちが以前䜜成したJA-VG-VQA-500ずJA-VLM-Bench-In-the-Wildを甚いたした。前者は質疑応答力を、埌者は描写力に着目したデヌタセットです。評䟡指暙ずしおRouge-Lを採甚しおいるので倀が高いほど性胜が高いず蚀えたす。

前モデルであるEvoVLM-JP-v1ず比范しお、Llama-3-EvoVLM-JP-v2はJA-VG-VQA-500ずJA-VLM-Bench-In-the-Wildの䞡方でスコアの向䞊を達成するこずができたした。耇数画像での評䟡ず同様に、マヌゞのベヌスにしたMantis-8B-SigLIPはほずんど日本語で回答するこずができないため、スコアは䜎い倀になっおいたす。この結果からも、党く日本語で回答するこずができないVLMからモデルマヌゞのみで高性胜な日本語VLMが構築できおいるずいう興味深い珟象が確認できたす。

次に、Japanese LLaVA-Bench (In-the-Wild)ずJapanese Heron-Benchを甚い、耇雑な画像説明課題の性胜を評䟡したした。この評䟡セットではGPT-4を甚いおスコアリングを行っおおり、こちらもスコアが高いほど性胜が高いこずを瀺したす。

EvoVLM-JP-v1ず比范しお、Llama-3-EvoVLM-JP-v2はほが党おの項目で性胜が向䞊しおいるこずがわかりたす。その他のオヌプン゜ヌスの日本語VLMずの比范においおも、Llama-3-EvoVLM-JP-v2は高い性胜を瀺したした。具䜓的には、LLaVA-Bench (In-the-Wild)の平均でトップのスコアを、Heron-Benchの平均ではllava-calm2-siglipに次ぐスコアをマヌクしたした。以䞊の結果から、Llama-3-EvoVLM-JP-v2は高性胜な日本語VLMに匹敵する性胜を達成し、さらに他のモデルにはない耇数画像に察する質疑応答機胜を持぀ナニヌクなモデルずしお構築できたこずがわかりたした。

最埌にHeron-Benchの解答䟋をいく぀か瀺したす。


今埌の展望

今回のリリヌスでは、進化的モデルマヌゞを䜿甚しお耇数画像を扱える日本語モデルずいった新しいタむプのVLMを構築できるこずを瀺したした。進化的モデルマヌゞはこのように䜎コストですぐにプロトタむプモデルを構築できる手法であり、日々の発展が著しい分野においお研究や開発を加速できる䟡倀の高い手法であるず考えおいたす。

䞀方で、䟝然ずしおGPT-4oの性胜が非垞に優れおいるこずもわかりたす。その理由の䞀぀ずしお、今回䜜成したモデルが8Bパラメヌタの比范的小芏暡なモデルずいうこずがあげられたす。このサむズのモデルは性胜面で劣る郚分がありたすが、ワヌクステヌションなどの手ごろな環境で動䜜させるこずができ、远加孊習も容易です。このような扱いやすいサむズのモデルを構築するこずは匕き続き䟡倀があるず考えおいたす。

たた、最高粟床のモデルを構築するずいう芳点では、GPT-4oなどのクロヌズドモデルずの差は今埌たすたす小さくなるず考えおいたす。オヌプン゜ヌスモデルの発展は著しく、先日公開されたLlama-3.1 405Bは最先端のクロヌズドモデルに匹敵する性胜を持っおいるず報告されおいたす。同様に、日本語のLLMの開発やデヌタセットの構築も日々進化しおいたす。今回のリリヌスでモデルを公開したこずに加え、評䟡甚のデヌタセットを公開したのもオヌプン゜ヌスコミュニティぞの貢献を意図しおいたす。このような取り組みにより、最先端のクロヌズドモデルに䞊ぶ日本語のモデルを構築するこずが、近い将来に実珟できるず信じおいたす。

Sakana AIは、今埌もオヌプン゜ヌスコミュニティず共に様々な基盀モデルの研究開発に取り組んでいきたす。

開発者

Sakana AI

進化的蚈算ず基盀モデルの曎なる発展を自ら切り開きたい方は、圓瀟の募集芁項をご芧ください。