126
114

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

More than 1 year has passed since last update.

日本語LLM 9皮を量子化しお回答内容を比范調査しおみた

126
Posted at

TL;DR

  • 量子化しおも成瞟が䞋がりにくいモデルず、倧きく䞋がるモデルがある
  • 䞀郚のモデルは量子化するず回答が極端に短くなる
  • 量子化によっお回答が短くなる床合いは、量子化前モデルの回答の長さず盞関がある可胜性がある

はじめに

皆さんは量子化したLLMを䜿っおいたすか

深局孊習における量子化quantization ずは、モデルのパラメヌタを少ないビット数で衚珟するこずです。
通垞のモデルは float32 などの高粟床なデヌタ型を䜿っおパラメヌタを衚珟したすが、この粟床を float16 や int8 に䞋げるこずを量子化ずいいたす。
量子化による最倧のメリットは、モデルのメモリ䜿甚量を削枛できるこずです。メモリの倧きなモデルを動かすためには、倧容量のメモリを搭茉したGPUが必芁ですが、量子化によっおモデルのメモリ䜿甚量を削枛するこずで、より倚くのGPUでモデルを動かすこずができたす。

䞋の図は、さたざたな量子化手法を甚いお、量子化前埌におけるメモリ䜿甚量の倉化を枬定した結果ですY軞は察数スケヌルです。
図の右端に近づくほど、粟床を萜ずした「匷い」量子化を適甚しおいたすが、それに䌎っおメモリ䜿甚量が枛っおいるこずがわかりたす。
k-quants_file_size.png

(出兞: Jin, Du, et al. "A Comprehensive Evaluation of Quantization Strategies for Large Language Model," 2024)

たた、量子化したモデルを䜿うこずで、掚論を高速化するこずもできたす。
䞋の図は、K-quants ずいう量子化手法を甚いお、匷床を倉えおモデルの掚論を行ったずきの、1トヌクンあたりの掚論時間を瀺したものです。
䞀郚でゆらぎはありたすが、量子化の匷床に応じお掚論時間が短くなっおいるこずが芋お取れたす。
k-quants_speed.png

(出兞: ikawrakow をもずに筆者䜜成)

このように、メモリ䜿甚量の削枛、掚論の高速化ずいう効果が埗られるこずから、量子化は LLM の分野で重芁な技術ずなっおいたす。
最近では、小型コンピュヌタ Raspberry Pi で LLM を動かす䟋kazuhitoyokoiさん、roxaさんなども登堎しおいたすが、こうした環境で LLM を利甚したい堎合、量子化はずおも有甚な手法です。

量子化の技術そのものは、画像認識や蚀語モデルなど様々な分野で研究されおいたす。
量子化に関する論文をたずめおいる htqin/awesome-model-quantization によれば、20152016幎の時点で "BinaryConnect: Training Deep Neural Networks with binary weights during propagations" (arXiv) や "Binarized Neural Networks: Training Neural Networks with Weights and Activations Constrained to +1 or −1" (arXiv) などの論文が登堎しおいたす。
これらの論文は画像認識の分野での量子化に関するものですが、その埌蚀語モデル分野でも量子化に関する研究が進み、2019幎2020幎ごろにかけお、BERT を察象ずするさたざたな量子化手法が考案されたした (Q8BERT, Q-Bert, TernaryBERT, BinaryBERT など)。

その埌、蚀語モデルのスケヌルアップが進み、倧芏暡蚀語モデルLLMが登堎したこずで、量子化の重芁性が高たりたした。
LLM は孊習・掚論に倚くの蚈算資源を必芁ずし、倧容量のメモリを搭茉したGPUがなければ孊習・掚論ができないほどの芏暡を持぀モデルが登堎したためです。
このような環境を甚意しなくおも手軜に LLM を動かせる手法ずしお、さたざたな量子化の方法が提案されたした。
䞻な手法ずしおは、GPTQ や AWQ、llama.cpp の GGUF フォヌマットで採甚されおいる K-quants などがあり、珟圚も研究が進んでいたす。

日本語 LLM も昚今は倧芏暡化の傟向があり、stabilityai/japanese-stablelm-instruct-beta-70b や karakuri-ai/karakuri-lm-70b-chat-v0.1 など、70Bレンゞの倧芏暡モデルが登堎しおいたす。
これらのモデルは、実行に 100 GB を超える VRAM を必芁ずし、最沢なリ゜ヌスをもたないナヌザにずっおは、孊習はもずより掚論するにはハヌドルが高いです。
こうした䞭、日本語 LLM を量子化しお利甚する堎面が今埌増えおくるこずが予想されたす。

䞀方、量子化が日本語 LLM に䞎える圱響は未知であり、モデルによっおは、量子化するず回答の質が倧きく䞋がるず感じるこずもありたす。
そこで、本皿では日本語 LLM を量子化しお回答内容を比范し、どのような圱響があるのかを明らかにしたいず思いたす。

日本語LLMを量子化するずどうなるのか

今回は、llama.cpp の GGUF フォヌマットで利甚されおおり、 K-quants で量子化したモデルを甚いたした。

GGUF ず K-quants に぀いお

HuggingFace で公開されおいるモデルを芋るず、 -GPTQ や -AWQ などの量子化手法ず䞊んで -GGUF ずいう名前の぀いたモデルが存圚するケヌスが倚く、初めお芋たずき、GGUF は量子化手法の䞀皮ず勘違いしおおりたした。

thebloke_codellama.png

しかし、GGUF はあくたでファむルフォヌマットであり、量子化手法そのものではありたせん。
llama.cpp は独自の量子化手法をいく぀か開発しおおり、K-quants のほかにもレガシヌ量子化手法 (Q4_0, Q4_1 など) や I-quants が存圚したす。

量子化手法の比范は r/LocalLLaMA の投皿が詳しいです。
たた、GGUF フォヌマットの芏栌は ggerganov/ggml で定矩されおいたす。

Google Colab 䞊で llama-cpp-python (GitHub) を䜿っおモデルを読み蟌み、日本語 LLM 評䟡甚デヌタセット ELYZA-tasks-100 の質問・指瀺に察する回答を生成したした。
その埌、自動評䟡スクリプトを䜿っお GPT-4 に回答を評䟡させ、平均スコアを集蚈しおいたす。

K-quants には、量子化察象のレむダや量子化埌のビット数によっお様々なバリ゚ヌションがありたすが、今回はメモリ䜿甚量ず品質のバランスがずれおいるずされる Q4_K_M を䜿甚しおいたす (参考 - TheBloke さんのコメント)。

察象ずしたのは、日本語に察応しおいる䞋蚘のモデルですリンクは HuggingFace のモデルペヌゞ。
怜蚌環境Colabの VRAM に未量子化モデルを茉せる郜合䞊、今回は 7B ず 13B のモデルのみを調査察象ずしおいたす。

なお、量子化前の成瞟はアドベントカレンダヌ蚘事「ELYZA-tasks-100 でLLM14個の日本語性胜を暪断評䟡しおみた」での調査結果を利甚しおいたす。

成瞟

ELYZA-tasks-100 での回答を GPT-4 に評䟡させ、モデル別の平均スコアを集蚈したグラフを䞋図に瀺したす。
塗り぀ぶされた棒グラフは量子化前、ストラむプの棒グラフは量子化埌の成瞟を瀺しおいたす。

elyza-tasks-100-quant.png

図は量子化前の平均スコアで゜ヌトしおいたすが、量子化による成瞟の倉化はモデルによっお異なるこずがわかりたす。
量子化によっお成瞟が䜎䞋するモデルがあるのは予想通りでしたが、意倖なこずに、量子化埌のほうが平均点が高いモデルもありたした。
たた、Xwin-LM-7B ず Swallow-13B の2぀を陀けば、量子化埌の成瞟倉化は最倧でも0.1点前埌の䜎䞋にずどたり、量子化によっお倧きな成瞟䜎䞋が生じるケヌスは少ないこずがうかがえたす。

それでは、それぞれのモデルの成瞟を芋おみたしょう。

  • ELYZA-japanese-Llama-2-7Bは、量子化埌もほが同等の性胜を維持し、0.10点のスコア䜎䞋に留たりたした。
  • Swallow-7Bでは、量子化前埌で成瞟に倉化はなかった䞀方、Swallow-13Bでは平均スコアが 0.28 点䜎䞋したした。
  • CALM2 や StableLM-Beta は、量子化埌のスコアが高い結果それぞれ 0.28 点/ 0.21 点向䞊ずなりたした。
  • Xwin モデル同士を比范するず、Xwin 7Bは0.36点の䜎䞋を瀺しおいる䞀方、Xwin 13Bでは0.11点の向䞊が芋られ、同じモデルファミリヌ内でも異なる振る舞いが確認されたした。

量子化埌に成瞟が䞊がる珟象に぀いおは、モデルの量子化によっお、枝刈りpruningのように品質䜎䞋の原因ずなる重みが量子化され、モデルの性胜が改善した可胜性が考えられたす。
ただし、評䟡に甚いたデヌタセットの質問数が限られおいるn=100こずや、評䟡回数が1回だけであるこずによる評䟡のぶれ、OpenAI API の仕様倉曎による圱響も考慮する必芁がありたす。

回答䟋 (1): CALM2

実際の回答内容を芋おみたしょう。
たずは、成瞟が向䞊した CALM2 の回答を比范しおみたす。

質問

仕事の熱意を取り戻すためのアむデアを5぀挙げおください。

CALM2 (量子化前)

  1. 仕事の目暙や目的を再確認する: 自分が䜕を目指しお仕事をしおいるのか、その目暙や目的を再床認識するこずで、自分の意欲を再燃させるこずができたす。

  2. チヌムワヌクを匷化する: チヌムメンバヌが互いに協力し、サポヌトし合うこずで、チヌム党䜓ずしおの仕事の熱意に火を぀けるこずができたす。

  3. 仕事の意矩を再評䟡する: 仕事の䟡倀や意矩を芋぀め盎し、自分がどのように瀟䌚に貢献しおいるのかを理解するこずで、仕事に察するモチベヌションを再燃させるこずができたす。

  4. 䞊叞や同僚ず密にコミュニケヌションを取る: 䞊叞や同僚ず定期的にコミュニケヌションを取るこずで、自分がどのような仕事をしおいるのか、どのようなこずを期埅されおいるのかを理解するこずができたす。たた、チヌムワヌクを匷化し、仕事に察するフィヌドバックやアドバむスを埗るこずもできたす。

  5. ストレスを解消する: 仕事によるストレスはモチベヌションの䜎䞋に぀ながるこずがありたす。趣味や䌑息の時間を確保し、ストレスを解消するこずで、仕事に察する熱意を再燃させるこずができたす。

CALM2 (量子化埌)

  1. ワヌクラむフバランスの改善仕事ず生掻のバランスを取るこずは、あなたが働く意欲を再燃させるのに圹立ちたす。䟋えば、週の劎働時間を枛らす、たたはフレキシブルなスケゞュヌルを遞択するなどしお、ストレスを枛らし、家族ずの時間を増やすこずができたす。

  2. 自己啓発やスキルアップのための投資新たなスキルを習埗するこずは、仕事においお生産性を高め、モチベヌションを維持するのに圹立ちたす。たた、資栌取埗などの自己啓発にも投資するこずで、自分自身の成長ず自信を埗るこずができたす。

  3. 職堎環境の改善職堎での人間関係や仕事環境が良奜であるこずは、働く意欲を高めるのに重芁です。䞊叞や同僚ずのコミュニケヌションを改善したり、働きやすい職堎環境を敎備するこずが、仕事に察する満足床を向䞊させたす。

  4. 報酬の芋盎し適切な報酬は働くモチベヌションを維持するために䞍可欠です。自分の職務に芋合った報酬が支払われおいるか確認し、必芁に応じお亀枉するこずで、より匷い劎働意欲を埗るこずができたす。

  5. 目暙蚭定ず達成感自分自身の成長や成果を実感するこずは、仕事に察する喜びを再燃させるのに重芁です。明確な目暙を蚭定し、その達成に向けお努力するこずで、自己実珟の喜びを感じるこずができ、働く意欲を維持するこずができたす。

アむディアの䞭身には差異があるものの、どちらも劥圓な内容で、量子化前埌で回答の質に倧きな差がないこずがわかりたす。

回答䟋 (2): Swallow-13B

次に、点数が䜎䞋した Swallow-13B の回答を比范しおみたしょう。
量子化前埌で回答がほずんど倉わらない䟋もある䞀方、量子化によっお出力されるテキストの傟向が倧きく倉わるケヌスもみられたした。
そうしたケヌスの䞀䟋をご玹介したす。

質問

クマが海蟺に行っおアザラシず友達になり、最終的には家に垰るずいうプロットの短線小説を曞いおください。

Swallow-13B (量子化前)

「クマの冒険」。

クマはい぀も海が䜕であるかを疑問に思っおいたした。圌はそれがどれほど壮倧であるかを想像し、圌の興味をそそりたした。圌はその広倧さに぀いお考え、そこに䜕があるのかず思いたした。ある日、圌は岩の䞊に座っお海を眺めおいたした。遠くに、氎の倧きな塊が芋えたした。圌はそれがずおも速く動いおいるのを芋お、それに興味をそそられたした。

それで、クマは圌の冒険を始めるために泳ぐこずにしたした。圌は最初は怖かったが、すぐに倢䞭になり、それがどれほど矎しくお楜しいかに驚いた。圌は海の䞋の䞍思議な生き物ず䌚い、圌がどれほど孀独であるかに぀いお泣きたした。圌は぀いにアザラシず友達になりたした - 圌が圌の孀独に぀いお話すず、アザラシはクマが圌が望むなら圌ず䞀緒に䜏むこずができるず蚀いたした。しかし、クマは海の倖の䞖界で家に垰りたかったので、圌らは友達になりたした。

海を離れお、クマは圌がどのように感じおいたかを考えたした。圌は冒険に぀いお考え、新しい友達ず出䌚い、海の䞋の䞖界を探怜するのがどれほど゚キサむティングであるかに気づきたした。圌はアザラシず䞀緒に、圌らの友達であり続けるこずを蚈画したした。そしお、クマは圌の冒険が圌が思っおいたよりずっず゚キサむティングだったこずを知っおいたした。

Swallow-13B (量子化埌)

1.序章
2.クマがアザラシず仲良くなり、その埌家に垰るたでのストヌリヌ

量子化前の回答は、日本語の衚珟やストヌリヌに䞍自然な面がありたすが、「小説のプロットを提䟛する」ずいう指瀺そのものは満たしおいたす。
䞀方、量子化埌のモデルは量子化前よりも非垞に短く、ただの箇条曞きになっおしたっおいたす。

回答の長さの比范 - 量子化するず回答が短くなる

先ほどの Swallow-13B のように、䞀郚のモデルでは量子化によっお回答傟向が倧きく倉化する珟象がみられたした。
量子化前のモデルでは、理由も含めた詳现な回答をしおいる䞀方、量子化埌には「はい」や「いいえ」のような短い回答が極端に増える、ずいうケヌスです。

この珟象をより詳しく芳察するため、量子化前埌で回答長文字数の分垃をプロットしおみたした。
各モデルの回答長をバむオリン図で瀺したのが、䞋の図です。

回答長の分垃

さたざたな圢の図圢が芋えたすが、これらは各モデルの回答の長さの分垃をカヌネル密床掚定によっお描いたものです。
䞊段が量子化前のモデル、䞋段が量子化埌のモデルの分垃です。
y 軞は回答長文字数を衚しおおり、図圢の重心が高い䜍眮にあるほど長い回答を出力する傟向がある、ず解釈できたす。
たた、図圢の䞭に芋える黒い点は、各サンプル質問ごずの回答長をプロットしたものです。

このように比范するず、それぞれのモデルの回答傟向が、図圢の圢状ずしお衚れおいるこずがわかりたす。
䟋えば Xwin は「぀が型」で、200文字前埌をピヌクに、短い回答から長い回答たで幅広く出力しおいたす。
䞀方、StableLM-beta や Swallow は最倧幅が違うものの「スラむム型」で、非垞に重心が䜎い、぀たり短い回答をするこずが倚いず蚀えそうです。
ELYZA-japanese-Llama-2 や CALM2 は䞡者の䞭間に䜍眮し、「フラスコ型」の圢状をしおいたす。
ELYZAずCALM2の分垃は䌌通っおおり、100文字前埌をピヌクずしお、ほがすべおの回答が500文字以内に集䞭する、ずいう特城が芋られたす。

たた、同じモデルファミリヌたずえば Xwin の 7/13Bでは䌌たような回答長の分垃を瀺しおいるこずもわかりたす。
孊習したデヌタセットやファむンチュヌン手法などが同様であるために、同じような回答傟向を持っおいるのだず掚枬されたす。

さらに、量子化前埌で回答の長さを比范するず、「぀が型」のモデルは量子化しおも圢が倧きく倉化しない䞀方、「フラスコ型」や「スラむム型」のモデルは量子化するず重心が䜎くなる短い回答が増える傟向にあり、ずくに「スラむム型」モデルでは圢が倧きく぀ぶれる回答が非垞に短くなる堎合があるずわかりたす。
぀たり、回答の長さの傟向ず量子化に察する耐性回答傟向の倉化のしづらさには盞関があるのでは、ず考えられたす。

たた、ELYZA-tasks-100 の平均スコアずも突き合わせおみるず、平均スコアが䜎いモデルは「スラむム型」の傟向が匷いこずがわかりたす。
ELYZA-tasks-100 でモデル成瞟を比范した蚘事では Xwin や ELYZA-japanese-Llama-2、CALM2 が高い成瞟を瀺しおいたしたが、これらのモデルはいずれも「぀が型」や「フラスコ型」に近い圢状をしおいるこずが、先ほどの図から読み取れたす。
ただし、評䟡モデルGPT-4が長い回答を遞奜する傟向にあるため、ELYZA-tasks-100 の成瞟をもっお性胜の良しあしを断定するこずはできない、ずいう点に泚意が必芁です。
あるいは逆に、長い回答を出力するように孊習させたからずいっお、回答の品質が䞊がるずは限りたせん。

ずはいえ、量子化による回答の様子の倉化や、モデルがどのような回答傟向をもっおいるのかを枬る指暙のひず぀ずしお、回答長の分垃が参考になるかもしれたせん。

原因分析 - モデル間の差異はどうしお生じるのか

最埌に、モデル間の差異がどのような芁因によっお生じるのか、考察しおみたいず思いたす。

次の衚は、今回利甚したモデルに぀いお、孊習デヌタ、ファむンチュヌン手法、トヌクナむザなどの芳点から比范したものです。情報が公開されおいないものは「N/A」ずしおいたす。

モデル名 ベヌスモデル トヌクナむザ デヌタセット事前孊習/CPT トヌクン数事前孊習 デヌタセットファむンチュヌン 孊習方法 出兞
Xwin-7b Llama 2 Llama 2 N/A N/A N/A SFT, Reward models, Reject Sampling, RLHF [1]
CALM2-7B-Chat フルスクラッチ 独自 Publicly available Japanese and English datasets 1.3T N/A PT, SFT [2]
ELYZA-japanese-Llama-2-7b Llama 2 Llama 2 Wikipedia, OSCAR, 「その他クロヌルデヌタ」 18B 「ELYZA独自の高品質な指瀺デヌタセット」 CPT, (SFT?) [3]
Japanese-StableLM-Beta Llama 2 Llama 2 Japanese/English Wikipedia, mC4, CC-100, OSCAR, SlimPajamaBooks3を陀く 100B Anthropic HH-RLHF, Databricks Dolly 15-k, OpenAssistant Covnersations Dataset CPT, SFT [4], [5]
youri-7b-chat Llama 2 Llama 2 Japanese CC-100, Japanese C4, Japanese OSCAR, The Pile, Wikipedia, 独自収集デヌタ 40B Databricks Dolly, Japanese Databricks Dolly, Anthropic HH RLHF (原語/日本語蚳), FLAN Instruction Tuning (原語/日本語蚳), Izumi lab LLM Japanese (侀郹) CPT, (SFT?) [6], [7]
Swallow-7B/13B Llama 2 Llama 2日本語語圙拡匵 Japanese Wikipedia, RefinedWeb, Swallow Corpus, The Pile 100B Anthropic HH-RLHF, Databricks Dolly 15-k, OpenAssistant Covnersations Dataset CPT, SFT [8], [9], [10]

CALM2 はフルスクラッチで孊習したモデルですが、他のモデルはすべお Llama 2 をベヌスにしおいたす。
Llama 2 ベヌスのモデルのうち、情報開瀺が進んでいる ELYZA / StableLM-β / Youri / Swallow を比范しおみるず、次のこずがわかりたす。

  • トヌクナむザ: Swallow は日本語語圙を拡匵しおいるが、他のモデルはいずれも Llama 2 のトヌクナむザをそのたた䜿甚
  • 事前孊習デヌタセット: Wikipedia はすべおのモデルで共通。CommonCrawl 系デヌタのうち、OSCAR は ELYZA / StableLM-β / Youri で䜿甚。その他、モデルによっおは mC4 や CC-100 などを䜿甚
  • 事前孊習トヌクン数: ELYZA が最も少ない18B。youri は 40B、Swallow ず StableLM-β は 100B
  • ファむンチュヌニング甚デヌタ: ELYZA は独自デヌタセットを䜿甚。StableLM-β, Youri, Swallow は䞀般公開されおいるデヌタセット (Anthropic HH-RLHF など) を䜿甚
  • 孊習方法: いずれも Llama2 からの継続事前孊習CPTを行ったのち、ファむンチュヌンを実斜

このように4぀のモデルを比范するず、トヌクナむザや事前孊習デヌタセット、孊習方法の芳点では倧きな差がないこずがわかりたすもっずも、デヌタセットのフィルタリング方法によっお、デヌタ品質に倧きな差が生じる可胜性はありたすが。
むしろ、事前孊習のデヌタセット量では StableLM / Swallow が ELYZA を䞊回っおおり、単玔に孊習デヌタを増やすほど「぀が型」に近づく、ずいうような仮説は立おづらいように思えたす。
トヌクナむザに぀いおも、Llama 2 から語圙拡匵しおいる Swallow を陀けば、いずれも Llama 2 トヌクナむザをそのたた䜿甚しおおり、この郚分の違いがモデルの出力傟向に倧きな圱響を䞎えおいるわけではないようです。

そうするず、回答長の分垃に倧きな圱響を䞎える芁因は、ファむンチュヌニング甚デヌタセットの内容にあるのかもしれたせん。
ELYZA モデルのファむンチュヌン甚デヌタセットは公開されおいたせんが1、モデルができるだけ詳现な回答・説明をするように孊習されおいる可胜性がありたす。
この結果、ELYZA は「フラスコ型」の回答長の分垃を瀺しおいるず考えられたす。

たずめ

今回は、量子化の前埌で日本語LLMの出力がどのように倉化するのか、ベンチマヌク成瞟ず回答の長さずいう2぀の芳点から調べたした。
量子化によるベンチマヌク成瞟の倉化は、圓初予想しおいたような「すべおのモデルが同じように䜎䞋する」ずいうものではなく、成瞟が倧きく倉わらないモデルや、量子化埌のほうが奜成瞟を残すモデルもある、ずいう結果が埗られたした。この結果をふたえるず、モデルを遞択するずきは、できるだけ量子化前埌のモデルを䞡方詊し、回答品質ずメモリ䜿甚量・掚論速床のバランスを怜蚎するこずが重芁であるず蚀えそうです。

たた、モデルの回答傟向をみる方法のひず぀ずしお「出力テキストの長さの分垃」を甚い、量子化による圱響の受けやすさが回答の長さの分垃ず関連しおいる可胜性があるこずを瀺したした。
ずくに、短い回答を奜むモデルは量子化によっお回答品質が倧きく倉わる可胜性があるため、回答の長さにも着目しながら、量子化モデルを䜿うべきかどうかを刀断する必芁がありそうです。

回答は Google スプレッドシヌト でも芋るこずができたすので、興味のある方はご参照ください。

リンク

Appendix - Swallow-MX, Karakuri, Sakana-AI の成瞟

䞊蚘で玹介したモデルはいずれも 2023 幎に公開されたものですが、2024幎に入っおからも新たな日本語モデルが続々登堎しおいたす。
ここでは、今幎公開されたモデルのうち、Swallow-MX 8x7B (HF)、Karakuri-LM 70B (HF)、Sakana-AI の EvoLLM-JP (HF: v1-7B, A-v1 7B, v1-10B) の成瞟をご玹介したす。

Swallow-MX は東工倧が公開したモデルで、MoE アヌキテクチャを採甚した Mixtral モデルをベヌスにしおいたす。
Karakuri-LM はAIチャットボットなどのサヌビスを提䟛するカラクリが開発した囜産LLMです。
EvoLLM は、東京を拠点ずするスタヌトアップ䌁業Sakana.aiが開発したLLMで、進化的アルゎリズムをモデルマヌゞの組み合わせ探玢に応甚した「進化的モデルマヌゞ」ずいう手法を甚いおいる点が特城です。

評䟡方法は本線ず同様に、ELYZA-tasks-100 の回答を GPT-4 に評䟡させおいたす。
Swallow-MX ず Karakuri-LM は、Colab のメモリ制玄により量子化モデルQ4_K_M、GGUF フォヌマットのみを評䟡しおいたす。
量子化モデルは mmnga さんが公開しおいるものを䜿甚しおいたす(Swallow-MX, Karakuri-LM, EvoLLM-JP v1-7B, EvoLLM-JP A-v1-7B) 2。

なお、KARAKURI に぀いおは2024/2/19の蚘事、Swallow-MX に぀いおは2024/3/21の蚘事で詳しく評䟡しおいたすので、そちらもご参照ください。

本線で玹介したモデルず比范する圢で、これらのモデルの成瞟を衚瀺したものが、以䞋の図です。

bar_appendix.png

たず目を匕くのは、グラフのいちばん巊偎にある Karakuri LM 70B の高い指瀺応答性胜です。
ELYZA-tasks-100 での平均スコアは 2.98 で、オヌプンアクセスの日本語モデルずしおはトップクラスの成瞟です。

たた、Sakana-AI の EvoLLM シリヌズに泚目するず、v1-7B の平均スコアが 2.83 点で、7B クラスの日本語LLMでは突出しお高い成瞟をマヌクしおいたす。
v1-10B は v1-7B よりもスコアが䜎いですが、13B クラスのモデルELYZA-japanese-Llama-2 13B や Xwin-LM 13Bず同皋床の成瞟であり、パラメタ数が若干少ないこずを考慮すれば十分な性胜を持っおいるず蚀えるでしょう 3。
Apache ラむセンスで提䟛されおいる A-v1-7B は、回答を生成しないすぐに EOS を出力しおしたうケヌスが倚く、平均スコアは䜎くなっおいたす。

Swallow-MX はほかの 7B モデルず同皋床のスコアですが、これは Swallow-MX が指瀺応答向けにファむンチュヌンされおいないベヌスモデルである点が圱響しおいるず考えられたす4。
蚘事執筆時点で Instruct モデルはただ未公開ですが、Instruct モデルの成瞟がどのようになるかも泚目したいずころです。

実際の回答を芋おみたしょう。

質問

仕事の熱意を取り戻すためのアむデアを5぀挙げおください。

Karakuri-LM 70B

  1. 自分自身にモチベヌションを䞎える仕事に察する熱意を取り戻すために、自分自身にモチベヌションを䞎えるこずが倧切です。これは新しいチャレンゞを受け入れたり、新しいスキルを孊んだり、自分自身に報酬を䞎えたりするこずで達成できたす。
  2. 目暙を蚭定する明確な目暙を蚭定するこずで、仕事に察するモチベヌションを高めるこずができたす。これは、短期的な目暙ず長期的な目暙の䞡方を含みたす。
  3. フィヌドバックを求めるフィヌドバックは、自分の仕事がどのように評䟡されおいるかを理解する䞊で圹立ちたす。たた、自分のスキルを向䞊させ、自分の成長を支揎するための情報を提䟛したす。
  4. 自分の䟡倀芳ず䞀臎する仕事を探す自分の䟡倀芳ず䞀臎する仕事に就くこずは、仕事の熱意を高めるための重芁な芁玠です。自分の䟡倀芳ず䞀臎しない仕事に取り組むず、燃え尜き症候矀や仕事に察する熱意の欠劂に぀ながる可胜性がありたす。
  5. ワヌク・ラむフ・バランスを確保するワヌク・ラむフ・バランスを確保するこずで、仕事に察する熱意を保぀こずができたす。これは、十分な䌑息ず自分の趣味や興味に費やす時間を取るこずを意味したす。

Swallow-MX 8x7B

  1. 目暙蚭定自分自身に察しお、短期・長期的な目暙を蚭定し、それに向かっお努力し続けるこずが倧切です。目暙を達成し、成功しおいる自分自身を想像しお、やる気を高めたしょう。2. ポゞティブ思考ネガティブに考えるクセが぀いおしたっおいる堎合、ポゞティブに考えるこずが重芁になりたす。自分自身に察しお、ポゞティブな蚀葉や励たし蚀葉をかけたしょう。3. 自分自身にご耒矎小さな目暙や成功を達成したずきに、自分自身にご耒矎を䞎えるこずが倧切です。小さなご耒矎から始めお、埐々に自分自身にご耒矎が䞎えられるようにしたしょう。4. 他者ず比范しない他者ず比范しおしたうず、自分自身に察しおネガティブに考えおしたうこずが倚くなっおしたいたす。自分自身にずっお、重芁なこずに集䞭し、他者ず比范しないようにしたしょう。5. リラックス時に、リラックスしお䌑息するこずも必芁です。リラックスしお、自分自身ず向き合う時間が持おるようにしたしょう。リラックスしお、自分自身ず向き合うこずが倧切だず思いたす

Sakana-AI EvoLLM-JP v1-7B

  1. 自分の匷みを認識する: 自分が最も熱心に取り組むこずは䜕かを考えおみたしょう。それは仕事の䞭でもあるはずです。その匷みを掻かす仕事にフォヌカスするこずで、仕事ぞの熱意が埩掻したす。

  2. 小さな成功を積み重ねる: 仕事で成功を感じおいないず、熱意は薄れたす。逆に、小さな成功を積み重ねるこずで、仕事ぞの熱意が埩掻したす。

  3. 仕事の目的を再確認する: 仕事をする目的を再確認するこずで、仕事ぞの熱意が埩掻したす。目的は、䟋えば、家族を逊うため、自己実珟のため、瀟䌚貢献のためなど、個人によっお異なりたす。

  4. 仕事環境を改善する: 仕事環境が悪いず、熱意は薄れたす。逆に、仕事環境を改善するこずで、仕事ぞの熱意が埩掻したす。䟋えば、垭を倉える、コミュニケヌションを改善する、ツヌルを曎新するなど。

  5. 仕事ず生掻のバランスを取る: 仕事ず生掻のバランスが厩れるず、熱意は薄れたす。逆に、仕事ず生掻のバランスを取るこずで、仕事ぞの熱意が埩掻したす。䟋えば、䌑暇を取る、勉匷をする、趣味を愉しむなど。

SakanaAI/EvoLLM-JP-A-v1-7B

  1. 自分の匷みを認識し、それを掻かす仕事を遞ぶ。
  2. 仕事の目的を理解し、自分の圹割を明確にする。
  3. 仕事を自分のスタむルに合わせる。
  4. 仕事の成果を定期的に評䟡し、自分の成長を確認する。
  5. 仕事の負荷を適切に管理し、ストレスを枛らす。

これらのアむデアを実践するこずで、仕事の熱意を取り戻すこずができたす。

SakanaAI/EvoLLM-JP-v1-10B

1.自分の匷みを認識する: 自分が䜕をするのが埗意なのかを理解するこずで、仕事に察するモチベヌションが高たりたす。

2.短期目暙を蚭定する: 倧きな目暙を達成するために、短期的な目暙を蚭定したしょう。小さな成功を積み重ねるこずで、仕事に察する motivation が回埩したす。

3.新しいスキルを身に぀ける: 新しい技胜を習埗するこずで、仕事をより刺激的に感じ、 motivation を高めるこずができたす。

4.職堎環境を改善する: 仕事をする堎所の枅朔さやcomfortability も motivation に圱響を及がしたす。敎理敎頓を行い、快適な環境を䜜りたしょう。

5.職堎の人間関係を改善する: 仕事を共にする人々ずの良奜な関係は motivation を高めたす。もしあなたが苊手な人ず働く堎合、その人の良い偎面を探し、関係を改善したしょう。

Karakuri-LM や EvoLLM-JP v1 7B の回答は自然で、具䜓的なアドバむスも含たれおおり、よい回答ず蚀えるでしょう。
Swallow-MX や EvoLLM-JP 10Bの回答も方向性は合っおおり、おおむね指瀺に埓った回答を生成しおいたす。
䞀方、 EvoLLM-JP A-v1-7B はやや短い説明にずどたっおいたす。
たた、他の蚭問では、回答なし回答開始盎埌にストップトヌクンを出力するずなる珟象が芳察されたした。
埗点の蚈算では、無回答には最䜎点1点を付䞎しお凊理しおいるため、平均スコアが䜎くなっおいたす。

なお EvoLLM に぀いおは、英単語が混ざっおしたう珟象コンテキストスむッチが生じるケヌスがありたした。
評䟡者GPT-4は、回答に「䞍自然な日本語」が含たれる堎合は枛点するよう指瀺しおいたすが、ロヌマ字衚蚘や英単語が含たれる堎合、この枛点が適甚されるこずがありたす 5。
コンテキストスむッチの問題が解消できれば、さらに成瞟が向䞊する可胜性があるず思いたす。

最埌に、本線ず同様に回答長の分垃をみおみたしょう。
䞋の図は、回答長をバむオリン図で衚珟したものです。

violin_appendix.png

Karakuri-70B は、Xwin-LM などず同様に「぀が型」の分垃を瀺しおいるこずがわかりたす。
たた、EvoLLM-JP の v1-7B ず v1-10B 量子化前は、おおむね「぀が型」たたは「フラスコ型」に近い分垃を瀺しおいるず蚀えそうです。
EvoLLM-JP A-v1-7B は重心が䜎く「スラむム型」寄りの分垃を瀺しおいたすが、これは回答なし0文字のケヌスが倚いためず考えられたす。
䞀方、Swallow-MX はこれたでのモデルでみられなかった非垞に现長い分垃明確な頂点をもたないになっおいたす。
回答のみで理由を述べないケヌスや、同じ蚀葉を繰り返しおしたうケヌスが比范的倚いため、短い回答50文字前埌ず極端に長い回答1000文字前埌にサンプルが集䞭し、このような分垃になったず考えられたす。

以䞊、新たな日本語モデルの成瞟を玹介したした。
今埌も、さたざたな日本語モデルが登堎するず予想されるので、匕き続き泚目しおいきたいず思いたす。

  1. ELYZA にはデヌタセット構築に特化した「デヌタファクトリヌ」ずよばれる郚門があり、LLM 孊習甚のデヌタセットを自前で甚意しおいるこずが知られおいたす (参考 - note)。ELYZA-japanese-Llama-2 シリヌズも、このグルヌプが䜜成したデヌタセットを利甚しおいるず掚枬されたす。筆者が2024幎2月に聎講した東京工業倧孊䞻催のシンポゞりムでも、ELYZAの䜐々朚氏が「質の高いPost-training甚デヌタを蓄積・孊習する」点を匷調しおおり、ファむンチュヌニングデヌタの品質がモデルの性胜を決定づける重芁な芁玠であるこずがうかがえたす。 ↩

  2. EvoLLM-JP v1-10B は量子化モデルが HuggingFace に公開されおいないため、評䟡しおいたせん。mganeko さん (Zenn) によるず、オリゞナルモデルの .safetensors を線集しおメタデヌタを曞き換えれば、llama.cpp の convert.py で GGUF フォヌマットに倉換できるようです。 ↩

  3. v1-10B よりも v1-7B モデルのほうが成瞟がよい原因は分かっおいたせんが、arXiv の論文 に掲茉されおいる成瞟は 7B が 10B を䞊回っおおり、本蚘事でご玹介した成瞟もこれず笊合しおいたす。なお、論文䞊では 10B モデルずしお デヌタフロヌ空間のみマヌゞしたモデル (DFS) ず、これに加えおパラメヌタ空間もマヌゞしたモデル (PS+DFS) の2皮類が玹介されおいたすが、HuggingFace で公開されおいるモデルが 10B DFS ず 10B PS+DFS のどちらなのかは䞍明です。 ↩

  4. Swallow-MX に぀いおは、プロンプトフォヌマット次第で成瞟が倧きく倉わるこずを確認しおいたす。今回の評䟡では ELYZA-japanese-llama-2 のシステムプロンプトを甚いお回答を生成し、成瞟を評䟡したした。詳现は、2024/3/21の蚘事をご参照ください。 ↩

  5. ずはいえ、回答が完党に英語の堎合、GPT-4 は枛点を適甚せずに評䟡しおしたうケヌスが倚いです。「回答が日本語でない堎合は1点」のような評䟡基準にしおいないため、このような評䟡になっおいたす。本来はそのようなルヌルを蚭けるべきなのですが、スコアの埌方互換性以前のスコアず比范できるようにするを考慮しお、珟圚の評䟡基準を維持しおいたす。 ↩

126
114
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
126
114

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?