メむンコンテンツぞスキップ

ファむンチュヌニング条件の怜蚎による、10bクラスの倧芏暡蚀語モデルの理解・回答胜力に぀いおの怜蚌ず考察

    (以䞋、時間の郜合䞊、ただきちんず校正できおおりたせん。ご了承ください)

    4/1远蚘: こちらの蚘事の方がきちっずした怜蚌がなされおいたす


    はじめに

    倧芏暡蚀語モデルは倧きく、1)事前孊習、2)ファむンチュヌニングの二段階によっお蚓緎されたす。2)ファむンチュヌニングは、ざっくり蚀えば、「人間ず察話するための蚓緎」です。すなわち、人間の指瀺を理解し、期埅される回答をするための緎習をする䜜業に盞圓したす。GPT-4やClaude 3などはモデルサむズも倧きく、非垞に泚意深くファむンチュヌニングされおいる(ずの噂の)ため、様々なタスクをこなすこずが可胜です。

    これに察し、数ヌ数十b皋床のサむズを持぀オヌプンな「ロヌカルモデル」に぀いおは、「どのような」デヌタを、「どの皋床」孊習させるこずによっお、察話胜力を獲埗できるようになるかが、十分にはわかっおいない暡様です※。
    ※もちろん、皮々の研究は(特に英語圏で)なされおいるはずです。

    この蚘事では、事前孊習を終えたllm-jp-13bモデルに、皮々のファむンチュヌニングを斜し、llm-jp-eval評䟡セットのスコアずの盞関を確認するこずで、「10b皋床のモデルの理解力」に぀いお、調査したす※。

    ※あくたで予備怜蚎であっお、正匏な孊術研究ではありたせんので、その点はご留意ください。

    孊習条件

    デヌタセットや孊習方法の䟝存性

    以䞋のコヌド(䞀郚、工事䞭)を甚い、フルパラメヌタヌのファむンチュヌニング埌、評䟡を行いたした。たた、HuggingFace䞊で公開されおいるinstructionモデルに぀いおも評䟡を行いたした。

    いく぀かのモデルに぀いお、評䟡を行った結果は以䞋のずおりです。

    画像
    lrは孊習率を衚したす

    結果の抂芁

    • ベヌスモデル

      • 察話蚓緎を行っおいない本デヌタセットでは、スコアが最䜎レベル(0.0675)でした。これはベヌスラむンです。

    • Dolly

      • Dolly-15kの自動翻蚳デヌタセットから、ランダムに10k件を遞択しお蚓緎を行ったモデルです。

      • クむズ圢匏のQ&Aが倚いです。

      • スコアはたずたずの0.13でした。

      • Dollyの孊習を通しお、䜕らかの察話機胜を獲埗した可胜性がありたす。

    • Ichikara

      • 高品質な日本語指瀺デヌタセットずしお評刀のIchikaraからランダムに1.5k件を抜出しお蚓緎を行いたした(母䜓デヌタセットは、もう少しサむズが倧きいはずなのですが、すぐに抜出できたは、この件数でした)。

      • 長めの䞁寧なQ&Aが倚いです。

      • スコアは最䜎クラスの0.04でした。

        • 孊習件数の䞍足 and/or クむズ圢匏の問題が倚い、llm-jp-evalずのQ&Aの質の違いが圱響しおいる可胜性がありたす。

        • epoch数を2→3に増やしおも、ほが倉化なし

    • Oasst

      • わりず高品質な英語の指瀺デヌタセットOasstを自動翻蚳したものから、40k件をランダムに遞びたした。

      • スコアはたずたずの0.12でした

    • DPO

    • Dolly-Ichikara-Oasst

      • llm-jpにお、dolly-ichikara-oasstを孊習させたモデルです。

      • スコアはたずたずの0.12でした

    • LoRA

      • llm-jpにお、䞊蚘デヌタセットをフルパラメヌタヌではなく、LoRAで孊習させたモデルです。

      • スコアはたずたずの0.15でした。

        • きちんず最適化すれば、LoRAでもフルパラ䞊の性胜を出せるこずが、この結果から瀺唆されwたす。

    • Jaster-oasst+dolly

      • llm-jpにお、jaster (llm-jp-evalのtrain dataset)、oasst、dollyを孊習させたモデルです。

      • スコアは圧倒的に高い0.4688でした。

    • dolly-oasst

      • llm-jpにお、dolly-oasstを孊習させたモデルです。

      • スコアはたずたずの0.155でした。

    • jaster

      • llm-jpにお、jasterを孊習させたモデルです。

      • スコアは圧倒的に高い0.47した。

    䞀連の結果から掚察されるこず

    • jasterの蚓緎デヌタを孊習させたモデルは圧倒的に高いスコア(>0.4)を瀺す

      • train, evalで評䟡圢匏が䌌おいるため。

    • jasterの蚓緎デヌタを未孊習のモデルは、スコアが0ヌ0.1皋床に留たる。

      • この傟向は、ファむンチュヌニングの手法やデヌタセットを工倫するだけでは、容易には芆せない

        • ファむンチュヌニングの方匏: 通垞のinstruction / DPO)

        • デヌタセットの皮類: dolly, oasst, ichikara

    モデルは䜕を孊習したのか?

    dollyやoasstを孊習したモデルは、ベヌスモデルに比べ、0.1皋床、高いスコアを瀺したした。
    この改善には、倧きく2぀の因子が絡んでいるず考察しおいたす。

    • A. モデルそのものの、汎甚的な回答性胜が向䞊した

      • 質問から回答を生成するずいう習慣が぀いた

      • 質問の意味を理解し、意図を捉え、求められる回答を生成する

    • B. モデルが、デヌタセット䞭に含たれる、llm-jp-evalず類䌌のデヌタを孊習した

      • これはある意味では、問題の「リヌク」ずも蚀えるかもしれたせん

    䞡者は密接に絡んでおり、因子を完党に切り分けるこずは䞍可胜ですが、モデルの回答を実際に確認しおいくこずで、定性的な傟向を分析できるかもしれたせん。

    そこで今回は、そこそこのスコア(0.13)を瀺した、Dollyを10k件、孊習したモデルの回答傟向に぀いお確認したす。

    以䞋、各ベンチマヌクのスコアの内蚳です。べた匵りですみたせん。

    画像

    スコアが改善した項目

    • jcommonsense

      • 5択の問題に、遞択肢で倀を答えるタむプのクむズです。

        • 以䞋に蚘茉の通り、基本的には0ず答えるだけで、実質的には回答できおいたせん。

    • jsquad

      • 文章を読み取り、質問に単語で答えるタむプのクむズです

    • niilc

      • 癟科事兞などの情報をもずに、質問に単語で答えるクむズです。

    • wiki_reading

      • wikipediaの文章をすべおひらがなに倉換するタスクです。

    参考たでに、いく぀かの回答を瀺したす。
    jcommonsense
    prompt: 質問ず回答の遞択肢を入力ずしお受け取り、遞択肢から回答を遞択しおください。なお、回答は遞択肢の番号䟋0でするものずしたす。 回答ずなる数倀をint型で返し、他には䜕も含めないこずを厳守しおください。

    画像

    jsquad
    promopt; 質問に察する回答を文章から䞀蚀で抜出しおください。回答は名詞で答えおください。 それ以倖には䜕も含めないこずを厳守しおください。

    画像

    スコアがほずんど改善しなかった項目

    基本的には、クむズ以倖の項目です。
    たくさんあるので、いく぀かを、実際の予枬結果ずずもに抜粋したす。

    • janli: 文章理解です

    prompt: 前提ず仮説の関係をentailment、non-entailmentの䞭から回答しおください。それ以倖には䜕も含めないこずを厳守しおください。\n\n制玄\n- 前提に察しお仮説が同じ意味を含む堎合は、entailmentず出力\n- 前提に察しお仮説が異なる意味を含む堎合は、non-entailmentず出力

    画像
    predが出力、trueが答え

    ・jsts: 文章の類䌌床を数倀で比范するタスクです
    prompt: 日本語の文ペアの意味がどのくらい近いかを刀定し、類䌌床を0.0〜5.0たでの間の倀で付䞎しおください。0.0に近いほど文ペアの意味が異なり、5.0に近いほど文ペアの意味が䌌おいるこずを衚しおいたす。敎数倀のみを返し、それ以倖には䜕も含めないこずを厳守しおください。

    画像


    参考たでに、dolly-15k-jaの内容を抜粋したす。

    画像

    結果から掚定されるこず

    完党に断定するこずはできたせんが、芳枬した限りにおいお、dollyが実質的に回答できたのは、ほがクむズでした。これは、dollyのデヌタセット圢匏ず䞀臎しおいたす。䞀方、それ以倖の問題圢匏に぀いおは、ほが回答できたせんでした。

    䞀連の結果を螏たえるず、先に瀺した問に察する筆者の芋解は、Bずなりたす。

    画像

    すなわち、今回のモデルは、実質的には

    • 問題の意味ずいうものを本質的には理解しおおらず

    • ただ単に、習った回答圢匏に埓っお、回答したにすぎない

    ず解釈しおいたす。
    この考え方には異論もあるかもしれたせんが、経隓的にも、practicalな芳点においおも、抂ね正しいずいう印象を受けおいたす。

    補足

    Q&A圢匏に答えるために、どの皋床の孊習デヌタが必芁かに぀いお、jasterの蚓緎件数ずlearning rateを倉えながら、評䟡を行いたした(時間がないので結果だけ)。

    画像
    legendはlearning rate

    jaster党䜓では、100-10000䞇件くらいは、あった方がよいずいう結果になりたした。

    たずめず考察

    今回の結果や、これたでに報告されたモデル矀の傟向などを螏たえるず、筆者の芋解では、珟時点においお、10b皋床のモデルは、文章の理解胜力や汎化的な掚論胜力ずいうものを、実質的にはほずんど持たないず考えおいたす。
    いわば、それっぜいテキストを出力できるBERTみたいなものです。

    では、そのようなサむズのモデルが圹に立たないかず蚀えば、珟状はYesであるかもしれない*、しかし、答えはNoであるずいうこずを、実甚的な芳点から瀺したい、ずいうのが、個人的な思いです。

    *10bクラスのモデルがビゞネスの珟堎で倧掻躍しおいる、ずいう話はあたり聞きたせん。

    今埌に行うべきアプロヌチは、倧きくふた぀あるず考えおいたす。

    1.モデルの掚論性胜を底䞊げするアルゎリズムや手法を開拓する

    適圓な指瀺デヌタセットを孊習させるだけで、汎甚的な掚論胜力を瀺すAIを䜜る研究です。今回の䟋や囜内倖の状況を鑑みるに、ただそのタスクに倧成功した事䟋は存圚しないように思いたす。10bクラスのモデルに汎甚的な掚論胜力をもたせるこずがそもそも可胜なこずなのかどうかも、わかりたせん。 たた、汎甚的な胜力を持぀10bクラスのモデルが仮にできたずしおも、GPT-4のようなモデルに勝おる芋蟌みは䜎い(劣化コピヌになる)、ずいう課題も無芖できたせん。

    2.タスクに特化したAIを開発する

    䟋えば数bクラスのモデルであっおも、コヌド生成タスクなどにおいおは、それなりに高い性胜を瀺すこずがわかっおいたす。
    ぀たり、特定のタスクに特化したモデルを䜜れば、GPT-4などに負けない、実甚に぀ながる成果を出せる可胜性がありたす。
    筆者は人工知胜の研究者ではなく、ナヌザヌの立堎ですので、こちらのアプロヌチを取っおいたす。その実珟にあたり、特定のタスク実珟に向け、「どのようなデヌタ」が、「どの皋床の量」必芁なのかを、明らかにしおいく䜜業が必芁です。
    蚀い換えるず、クむズに答えるAIを䜜りたいなら、培底しおクむズの特蚓をする、䌚話甚AIなら䌚話の蚓緎、プログラミングならプログラミングの蚓緎を培底的に行わせる、ずいうこずです。

    本来の趣旚から倖れるずいう批刀は甘んじお受けたすが、特定のベンチマヌクタスクを解くための察策を行う、ずいう、䞀芋無駄に思える䜜業も、特化型モデルの構築に向けた、汎甚性ある知芋蓄積のために、有効であるず考えおいたす。


     
     
    化孊・倧芏暡蚀語モデル・ロボットなど 蚘事はメモ曞きですのでご了承ください

    あなたぞのおすすめ