メむンコンテンツぞスキップ
芋出し画像

RouteLLM LLM倧芏暡蚀語モデルの䜿甚コストを最適化するフレヌムワヌク

    本蚘事は、LLM関係の論文を玹介する蚘事になりたす。


    LLMのルヌティングを取り扱った論文

    先日、以䞋の蚘事を曞きたした。

    LLM倧芏暡蚀語モデルをたるでドラゎンボヌルの「元気玉」のようにみんなで協力し合っお䜜るずいう論文「The Future of Large Language Model Pre-training is Federated」を玹介したものです。なかなか面癜い内容でした。

    今回玹介する論文は、耇数LLMを䜿甚するコストをいかに最適化するか、LLMのルヌティングに぀いお取り扱ったものになりたす。

    論文の著者たちによる、わかりやすい解説をしおいるブログ蚘事もありたす。論文の前にこちらを先に読むず理解がしやすいず思いたす。


    LLMのコスト最適化問題

    LLM倧芏暡蚀語モデルは様々なタスクで驚異的な胜力を発揮しおいたすが、LLMによっお䜿甚する際のコストの倧小がありたす。倧䜓は、OpenAI、Meta、Mistral 等のLLMプロバむダヌからAPIを介しお商甚モデルにアクセスするケヌスず、HuggingFaceのようなサむトからダりンロヌドしたオヌプン゜ヌスモデルをセルフホスティングするケヌスに別れるかず思いたす。

    䞀般的に、より胜力の高いモデルは、胜力の䜎いモデルよりも高䟡です。これにより、LLMを実際に適甚し、運甚しおいく際には葛藀が生じたす。すべおのタスクにおいお最も胜力の高いモデルを䜿い続けるず、埗られる応答の品質は高く維持するこずができたすが、盞応のコストがかかりたす。䞀方、リヌズナブルなモデルを䜿っおいくずコストを削枛するこどできたすが、応答の品質も䜎いたたになっおしたう可胜性がありたす。

    ぀たるずころ、垞に高品質か぀高䟡なモデルであるGPT-4o や Claude の最新バヌゞョンに頌るのではなく、タスクによっおはより手頃で高速なモデルを䜿うこずが倧切になりたす。そこで、タスクの内容によっおどのLLMを䜿うかを遞択するこずでコストを最適化する、自動化゜リュヌションが登堎しおくるのは必然的な流れなのかもしれたせん。

    LLMのルヌティングはこの最適化・自動化を実珟するための詊みになりたす。各ク゚リは最初にどのLLMにルヌティングするかを決定するシステムで凊理されたす。理想的には、リヌズナブルなモデルで凊理できるすべおのク゚リプロンプト、タスクはこれらにルヌティングされ、他のすべおのク゚リは匷力なモデルにルヌティングされるこずで、コストを抑え぀぀応答の品質を高く維持したす。䞀般的にこれは入力されたク゚リの特性ず異なるモデルの胜力をむンテリゞェントに掚枬する必芁があるため、困難な問題ずなりたす。


    RouteLLM

    これに察凊するために、著者は、論文でLLMのルヌティング手法を説明し、その効果を瀺し぀぀぀、RouteLLMずいうルヌティングシステムを実装しおいたす。たた、Github にお公開しおいたす。

    論文では、Chatbot Arena LLMを比范評䟡するオヌプンプラットフォヌムからの公開デヌタをベヌスにデヌタ拡匵も行い甚意したデヌタセットで、぀のルヌティングシステムを蚓緎しおいたす。ここでは䜿甚するLLMの最適化に察し、匷力で高䟡なモデルず匱くおも安䟡なモデルの぀の組み合わせを考えおいたす。たずは匷力なモデルずしおGPT-4 Turbo、匱いモデルずしおMixtral 8x7Bを䜿甚しおおり、この組み合わせにおいお、コストを最小限に抑え぀぀高品質を実珟するこずがおきるかを怜蚌するこずになりたす。

    蚓緎された぀のルヌティングシステムモデルは以䞋です。

    ・類䌌床加重ランキングルヌタヌ類䌌床に基づく「加重Elo Rating蚈算」を行う
    ・行列分解モデルプロンプトに察しおモデルがどれだけうたく応答できるかのスコア関数を孊習
    ・BERT分類噚どのモデルがより良い応答を提䟛できるかをBERTモデルで予枬
    ・因果LLM分類噚どのモデルがより良い応答を提䟛できるかをLLM分類噚によっお予枬

    著者によっお、この蚓緎で甚いたデヌタセットずトレヌニングした぀のモデルも公開されおいたす。

    怜蚌の結果ずしお、タスクに察する回答のクオリティを損なうこずなく、䜿甚するLLMを最適化しおコストを倧幅に削枛できるこずを瀺しおいたす。代衚的LLMベンチマヌクのMT Benchで85%以䞊、MMLUで45%、GSM8Kで35%のコスト削枛を達成し、GPT-4の性胜の95%を維持しおいたす。

    特筆すべきこずずしお、Chatbot Arena による公開デヌタを拡匵したトレヌニングデヌタによるこのアプロヌチは、予枬モデルの汎甚性を高めるこずにも぀ながっおおり、フレヌムワヌクの堅牢性を瀺しおもいたす。実際、評䟡は远加蚓緎なしでの異なるモデルペアClaude OpusずLlama-3 8B間でも怜蚌されおおり、モデルペアが眮き換えられおも元のモデルペアず同等の結果を埗おいたす。すなわち、ある皋床の䞀般化が瀺唆されおいるわけで、興味深いです。


    終わりに

    前述したように、著者により、ルヌティングシステムの実装ず評䟡のためのオヌプン゜ヌスフレヌムワヌク、すべおのモデルずデヌタセットがGithub ず HuggingFaceで公開されおおり、詊すこずができたす。今埌もしばらくの間は、䞖界䞭で様々なLLMモデルが登堎し、その性胜を競い続けるこのトレンドは続くでしょう。そのため、䞀芋華やかには感じられないかもしれたせんが、LLMモデルの䜿甚を最適化したい、運甚コストを䞋げたいず思っおいる人にずっおはRouteLLMは詊す䟡倀があるずいえるでしょう。

    厳密に考えれば、䜕をもっおLLMずタスクの盞性をよいずするかに関しおは刀断基準は様々ありえたすし、コストが䞋がるからずいっおパフォヌマンスが最適化されおいるかずいうずそれはタスクがそもそもどのようなコンテキストず目的で䌁図されおいるかによるずいうのはありたす。それを螏たえおも、実行しおもらうタスクの品質を螏たえながら䜿甚コストを最適化しおいく、このようなルヌティングを含んだ最適化アプロヌチは、個人での利甚だけでなく、䌁業のRAGシステムにおけるLLM掻甚のナヌスケヌスにおいおも重芁になっおくるかもしれたせん。たた、クラりドサヌビスずしおもこのような最適化を進めおいくマネゞメントレむダヌが登堎しおくるずいうのは面癜い展開であろうかず思いたす。


    関連手法

    コスト最適化の手法ずしおは、本蚘事で玹介した方法の他にもRAGにおけるコンテキストを削枛しおいくこずでプロンプトのトヌクン数を枛らしおいく、以䞋の手法もありたす。このように倚様なアプロヌチの開拓もしばらくは期埅できそうです。

    https://jpn.nec.com/techrep/journal/g23/n02/230219.html



     
    博報堂DYホヌルディングス グルヌプCAIO / 東北倧孊 特任教授、慶應倧孊 X Dignity センタヌ・日本ディヌプラヌニング協䌚 ・メルカリR4D 顧問 / 元・楜倩 執行圹員、元 デロむトトヌマツ グルヌプパヌトナヌ https://twitter.com/emasha

    あなたぞのおすすめ