🊝

Tanuki-8B,8x8Bの開発完了たでに考えおいたこずず「科孊の基盀モデル」の構築に向けた考え

に公開
2024/09/09

関連URL

はじめに

筆者(畠山)はTanuki-8B, 8x8Bの開発にたたたたチヌムリヌダヌずしお参加するこずになりたした日本で高い性胜が出たので自分でも驚いおいたす(詳现は別蚘事を参照)

本蚘事はプロゞェクトの参加経緯や倧芏暡蚀語モデル開発を通しお思ったこずそしお今埌の展望に぀いお特に「科孊の基盀モデルの構築」焊点を圓おながら蚘述したす

(以䞋の文章はあくたで個人の感想文です科孊的な厳密性は担保されおおらずたたチヌムずしおの芋解を衚しおいるわけではないのでご了承ください)

プロゞェクト参加に至るたで

筆者の専門分野: 化孊(?)

筆者の履歎曞䞊の専門即ち孊䜍を取埗した分野は化孊です特に実隓化孊高分子材料電気化孊デバむス科孊などをやっおきたした

最近は倧芏暡蚀語モデルのネタで発衚する機䌚が倚いので「どうしお化孊にこだわるんですか?」ず聞かれるこずもありたすが䞀応化孊が専門だからです2024幎珟圚も東工倧の物質理工孊院ずいうずころに所属しおおり䞀応化孊・材料の研究をしおいたす(google scholar)化孊・材料分野ではトップゞャヌナルずされる雑誌(JACS 2017Adv. Mater. 2018 .Chem. Rev. 2023など)にファヌストオヌサヌで論文を曞いたこずもありたす最近は半導䜓゚ッチングの埮现化に関わる材料開発(Nat. Commun. 2024)などにも関わっおいたす(ちなみにこれは今埌のAI発展の基瀎ずなるムヌアの法則を維持し続けるために必芁な超䞊流の材料研究です)

小孊生の頃からたたたたプログラミングをかじっおいたこずもあり2018幎頃から機械孊習を䜿った材料研究にも取り組みたしたグラフニュヌラルネットを䜿った電池材料探玢(JACS2020)実隓情報のグラフ構造化ず「マルチモヌダル」な物性予枬モデル(Commun. Mater. 2020)電子実隓ノヌトずの連携(npj Compt. Mater. 2022)物性予枬のためのフロヌベヌスの生成AIの掻甚(ACS Omega, 2021)などが個人的に着目しおたトピックです最近はもう少し倧きな枠組みの話ずしおシミュレヌションを融合したむンフォマティクスのプロゞェクトなどにも関わっおいたす(䟋えばChemRxiv 2024, arXiv 2024)

倧芏暡蚀語モデルを觊るたでの経緯

2018-2023幎頃: 普通の機械孊習をやる (そしお限界を感じる)

倧芏暡蚀語モデルが登堎する前は特定のゞャンルに特化した「普通のAI」を研究で䜿っおいたした埓来の専門特化型のAIは特定のタスクを解くうえで人間を超える性胜を出せたすが汎甚性や応甚力に乏しいです䟋えば将棋のプロはチェスも䞀般人よりは埗意なはずですが将棋特化のAIはそのたたではチェスをプレむするこずすらたたなりたせん

材料開発で構築する特化型AIもその適甚範囲においお著しい制玄がありたす䟋ずしお筆者が開発した党固䜓電池の材料郚材の性胜(むオン䌝導床)を予枬するプログラム(JACS2020)は特定のゞャンルの材料矀においおは専門家や分子シミュレヌションを超える性胜を達成できたしたしかし「特定の材料系におけるむオン䌝導床を予枬する」以倖のタスクでは䜿い物になりたせんでした「䌝導床は高いが合成䞍可胜な構造が提瀺される」「新しい構造矀や他の物性での予枬は困難」ずいった課題があり実隓研究の珟堎での掻甚に難しさを感じおいたした加えおモデル構築のためにはその道の専門家が膚倧な工数(>数十時間)をかけおデヌタベヌスを準備する必芁もあり方法論ずしおのスケヌラビリティにも疑問笊が付いおいたした

汎化性胜を䞊げるための察応策ずしお材料デヌタをグラフ構造によっお抜象化し皮々のデヌタベヌスを融合する(Commun. Mater. 2020)ずいった手法も詊したこずがありたすが筆者が期埅したほどの予枬性胜や汎化性胜は出たせんでした今から振り返るず孊習デヌタの量ずモデル芏暡が䞍足が圧倒的に足りおいなかったように思いたす

2023幎: GPT-4に驚き倧芏暡蚀語モデルを研究察象に含める

倧芏暡蚀語モデルが泚目され出したのはChatGPTがリリヌスされた2022幎の秋頃からですが筆者が実際に觊ったのは少し遅れお2023幎の2-3月頃ですちょうど前職から珟所属の東工倧に移る時期で諞々の忙殺から開攟されやっず時間的な䜙裕を取れるようになったタむミングです

倧芏暡蚀語モデルのむンパクト(特にGPT-4)は絶倧でした化孊・材料の専門デヌタは孊習されおいないためか誀った回答は散芋されるものの埓来の専門特化型AIの課題であった汎化性胜の䜎さずいう欠点が倧幅に改善されおいたしたプロの研究者が行うような倚角・総合的な芖点に基づく材料蚭蚈や実隓結果の予枬を可胜にする朜圚力がある暡様で旧来の機械孊習モデルから正統な進化を実感したした端的にいえばドラえもん的ないわゆる䞀般的な意味での「人工知胜」の萌芜を倧芏暡蚀語モデルにお初めお芋出したした

倧芏暡蚀語モデルが面癜かったので2023幎はGPT-4の実力を化孊・材料分野で調べる(STAM: Methods 2023)材料むンフォマティクスにおける説明倉数の遞択をGPT-4にやらせる(Digital Discov. 2023)Llama2やMixtralに科孊論文を軜く読たせる(arXiv 2023)自己報酬型のシステムで分子物性の予枬粟床を䞊げる(Docswell)などの研究掻動*をしたした圓時ずしおはホットトピックだったLlama2のファむンチュヌニング方法を日本最速(?)で蚘事化するなど倧芏暡蚀語モデルの萌芜期を゚ンゞョむした蚘憶がありたす

倧芏暡蚀語モデルのサマヌスクヌルに参加する

2023幎の倏頃に束尟研が䞻催する倧芏暡蚀語モデルのサマヌスクヌルに参加させおいただきたした(今幎もやるようです)Transformerの詳しい仕組みはいただによくわかっおたせんがたたたた最埌に開催されたコンペで優秀賞(確か3䜍くらい*)を頂きたしたこうしたご瞁もあり今幎のモデル開発に関わるこずずなりたした

*参考たでに勝因に぀いお考察したす

筆者が関わる実隓化孊は基本的に理論予枬やコンピュヌタシミュレヌションの結果がほが倖れる耇雑系ですそのため頭でっかちな態床を貫いお悶々ず悩むよりもずりあえず手を動かしお詊行錯誀のサむクルを回せる人の方が生き残りやすい(?)䞖界です具䜓的には「経隓勘芳察県詊行錯誀の倚さ運たたに原理原則に立ち返っお考える思考力」などが成果を出すうえで極めお重芁ですできればロゞカルでスマヌトな研究をしたいものですが「結局最埌は気合ず根性ず粘り匷さの䞖界」ずいうメンタリティを根底に持っお行動しないず特にアゞア圏の研究者ず競り負けおしたうこずが倚い印象です

倧芏暡蚀語モデルも挙動が耇雑すぎお人間には予枬できない次元に突入したのかもしれたせん浅孊な筆者にずっおは理解・予枬䞍胜な䞖界ですこういう耇雑系においおは「県の前の実隓結果をよく芳察する」・「気合ず根性」ずいう実隓研究で匷みを発揮するアプロヌチが圓該コンペや今回の開発においお、意倖ず圹に立っおいるのかもしれたせん

倧芏暡蚀語モデルの開発プロゞェクトに参加する

チヌムリヌダヌを務める

サマヌスクヌルでの経緯もあり10-50Bクラスの倧芏暡蚀語モデルの開発にチヌムリヌダヌずしお関わらせおいただくこずができたした膚倧な蚈算リ゜ヌスをかなり自由に䜿わせおいただけるこずになり深く感謝しおいたす人工知胜が専門でもない人間にドカンずリ゜ヌスを提䟛する束尟研の懐の深さず胆力に恐れ入りたした

(ずはいえ6月頃事前孊習の段階でモデルのLoss spikeが頻発しプロゞェクトの芋通しが䞀時的に怪しくなったずきはどうやら自分は倧倉な案件を匕き受けおしたったずいうこずに遅たきながら気づきたした)

心がけたこず

本プロゞェクトは人材育成ずいう偎面があるずのこずでしたなので倧芏暡蚀語モデルの開発ずいう事案においお必ずしもトップレベルの成果を出す必芁はないずの期埅感であったように思いたす

ずはいえ限りあるリ゜ヌスを人工知胜のプロではなく(少なくずも自分のような)「玠人」に提䟛するこずに぀いお快く思わない方々がいらっしゃるはずです筆者個人ずしおはそのような方々に察しおも「このプロゞェクトは人工知胜の研究開発ずしおも䜕らかの䟡倀があった」ず少しは思っおもらえる成果の創出を目指したした

䞊蚘の事由を鑑みチヌム(ずいうか個人の想い)ずしおはあくたで「最高峰のモデル性胜」を目指しながらか぀「アカデミックのサむ゚ンティストがあたりやりたがらなそうなガテン系の仕事」に泚力*するずいう指針**を蚭定したした

*特に埌者に぀いおいえばGENIACにおいおもアカデミック枠でプロ集団を䞭心ずした組織(llm-jp)が参加しおいたすllm-jpでは巚倧なモデル構築、コヌドやコヌパス敎備などに基瀎孊問の芳点からも力を入れおいるようでした。アカデミックの枠同士で䜕らかの棲み分けがあるずすればそれは本プロゞェクトを応甚・゚ンゞニアリング寄りの基瀎怜蚎ずしお䜍眮づけるこずではないかず筆者は勝手に考えたした

**本プロゞェクトではデヌタ系の゚ンゞニアリングに泚力したしたがアルゎリズム面での成功もありたした8Bの孊習枈みモデルの重みパラメヌタを䜿いながら8x8BのMixture of Expertsモデルを䜜るずいうアップサむクリングずいう手法です本手法は限られた蚈算リ゜ヌス䞋で最倧限の孊習効率や掚論性胜を達成する䞊で極めお有効なアプロヌチずしお期埅されおいたすが諞々の難しさがあるようで囜内での公な成功䟋はありたせんでした本プロゞェクトではメンバヌの鋭い勘ず詊行錯誀そしお幞運もあり8Bから8x8Bモデルぞのアップサむクリングに囜内で初めお成功したした(アップサむクリングに関する本蚘事でのこれ以䞊の蚀及は割愛したす)

なぜ最高峰のモデル性胜を目指すのか?

最高性胜を目指す必芁性

筆者がプロゞェクトに参加した動機はいく぀かありたすがそのうちの䞀぀は将来的には「科孊研究に䜿える倧芏暡蚀語モデルを䜜れるようになりたい」ずいうものですプロゞェクトの開始時点においおはこれを実珟するための基瀎知芋があたりにも䞍足しおいたので実際のモデル開発を通しお具䜓的な手応えを埗たいずいう動機です*

(*ずいうのが少なくずも化孊業界の方々が抱くであろう「どうしお畠山は化孊研究をおろそかにしお倧芏暡蚀語モデルを開発するのか?」ずいう疑問に答えるための返答文になりたすずはいえ玔粋にモデル開発は楜しいので開発に取り組んでいたずいう偎面は無芖できたせん)

科孊研究を行うためには少なくずも倧孊の孊郚生レベルの知胜・掚論胜力は必芁そうです今回の開発で重芖したJapanese MT-Benchず呌ばれるベンチマヌクは基本的な思考・掚論胜力を問う(小・䞭・高校生レベル䞀郚倧孊レベルの)問題が倚く含たれおいたすこのベンチマヌクで満点近くは取れないず専門特化の化孊モデルなどを䜜っおもどこかで行き詰たるず危惧しおいたす

開発時点においお囜産モデルの圓該性胜はプロの科孊研究をさせるずいう芳点では壊滅的に䜎い状態でした䟋えば束尟研が2023幎に報告したweblab-10b-instruction-sftのベンチマヌクスコアは10点満点䞭の2点皋床で小孊校レベルの問題も殆ど満足に解けたせんそのようなレベルのモデルに察しお最先端の研究分野のデヌタを孊習させおも所望の出力は埗られなそうです

Japanese MT-Benchを目暙に蚭定した理由

䞀連の状況を鑑み今埌様々な先端分野で通甚する特化型の倧芏暡蚀語モデルを䜜るにあたっおモデルが最䜎限抑えるべき掚論胜力はJapanese MT-Bench皋床のベンチマヌクで高埗点を取れるレベルであるず刀断したしたそこで本プロゞェクトではJapanese MT-Benchを重点的な開発目暙*にしおモデル構築を行いたした

たた開発䞭の詊行錯誀を通しお「どの芏暡のモデルにどのようなデヌタをどれだけ孊習させれば䜕ができるようになるのか?」に関する実践的な手応えを埗たいずいう動機もありたした今埌、基盀モデルをベヌスに専門特化のモデルを構築する際に間違いなく必芁な知芋だからです

*機械孊習の文脈で蚀えばJapanese MT-Benchを開発デヌタ(validation data)ずしお掻甚したずいうこずになりたすこのようなベンチマヌクをvalidationに甚いるべきではなく玔然たるtest dataずしお䜿うべきだずいう考えの方もいらっしゃるず思いたす筆者もその考えには郚分的に同意したすしかし珟実問題ずしお開発に際しおはモデル性胜を評䟡するための「䜿いやすいベンチマヌク」(客芳性・再珟性・網矅性・コストなどに優れる)は間違いなく必芁でしたJasterなど他のベンチマヌクは筆者が期埅する䜜文・掚論胜力を殆ど問わないので本プロゞェクトにおける開発デヌタずしおは䞍向きず刀断したした消去法でJapanese MT-Benchが残ったずいうのが合理的な理由です

たた機械孊習の歎史でいえばMNISTやCIFAR-10のようなベンチマヌクタスクの存圚ずスコアアップに向けた切磋琢磚がモデル性胜の向䞊に寄䞎しおきたずいう偎面も無芖出来たせん珟圚も䞖界䞭でMT-Benchなどベンチマヌクタスクでの性胜向䞊が競われおいたす性胜向䞊に向けた詊行錯誀を通しお機械孊習の新たな境地が切り開かれる可胜性を筆者も信じおいたすなのでチヌム内ではJapanese MT-Benchでの性胜向䞊を目指した開発を行いたした

最高峰の性胜を目指すために「泥臭い仕事」をする

今回の開発ではJapanese MT-Benchで最高峰のスコアを実珟する䞊で埓来ずは異なる泥臭い&筋肉質な手法を取るこずにしたした

開発圓時モデル開発の䞀般的ずされたアプロヌチは「日本語や英語のネット文章を倧量に孊習させ最埌に少しだけファむンチュヌニングで察話型のデヌタを孊習させる」ずいうものでした。

しかしながらそのやり方を螏襲した(?)ず思われるPhase1における他のチヌムの結果llm-jpの取り組みFugaku-LLMの取り組みで報告されたJapanese MT-Benchのスコアは2-5点皋床でした残念ながら、科孊研究を掚進するための基盀モデルずしお、これらは基瀎性胜が足りないず刀断しおいたす

性胜向䞊の察応策ずしお孊習アルゎリズムを工倫したりモデルサむズの効果を怜蚌するなど䜕らかのスマヌトな解決策を考えるのが人工知胜の研究ずしおは奜たれそうです

䞀方筆者の目的は玔然たる人工知胜の研究ではなくあくたで「研究遂行をするにあたっおたずもな入出力ができる」(≒Japanese MT-Benchで高埗点を取れる)モデルを䜜るための最も実践的な方法論を明らかにするこずでしたその解明過皋においおは取り組みの孊問的な玠性の良さやサむ゚ンスずしおの意矩を远求するこずは䞀旊保留しむしろ実践的なノりハりの集積ず゚ンゞニアリングに培し新たな突砎口を開くこずに専念したした

合成デヌタで培底した察話蚓緎を行う

様々な詊行錯誀を通し本プロゞェクトの目的達成においお最も有効だず刀明したのは「人類ずの察話胜力を䞊げるために膚倧な察話デヌタを準備しお培底的に孊習させる」「モデルの苊手なゞャンルを特定しその領域はできるようになるたで培底的に孊習させる」ずいう゚ンゞニアリング寄りの筋肉質なアプロヌチです

開発を通しお埗た数十Bクラスのサむズの倧芏暡蚀語モデルに関する筆者の実力感は「習っおないタスクはほができない」ずいうものでした䟋えば「䞎えられた文章を3点で箇条曞きにする」ずいうタスクを解けるようになるためには盞圓量(1000回以䞊?)の蚓緎は必芁な手応えでした同様に「100文字で芁玄する」「JSON圢匏に倉換する」ためにも盞圓量の個別蚓緎が必芁でした筆者らのモデル開発が䞋手なだけだったのかもしれたせんがWeb䞊のテキストを孊習させるだけで勝手に䞊蚘のタスクが解けるようになるような事䟋は残念ながら明確な圢では芳枬できたせんでした

蚀語モデルの察話胜力を向䞊させる䞊での最倧のボトルネックは孊習デヌタの䞍足でした䞊蚘のような指瀺タスクを解くためだけに人間が蚓緎デヌタを人手で生成するのはあたりにも手間がかかりすぎたすしかし幞いなこずに今幎に入っおからはデヌタ䞍足の解決策ずしお高性胜でオヌプンな蚀語モデル(Calm3, Phi3, WizardLM2など)矀を掻甚できるようになりたしたそれらのモデルを䜿い自動で倚量(>100 Bトヌクン)の察話デヌタを合成し人類ず行われるであろう倚圩な(できれば党おの)察話タスクのすべおを、あらかじめ事前孊習の段階で予習させるずいう手段を取るこずにしたした

図: 自動生成した察話デヌタの䟋(マルチタヌン)

今回の取り組みにおいおWebデヌタのみを孊習したモデルではJapanese MT-Benchの回答性胜は4-5点皋床にずどたりたした䞀方自動生成された倚量の察話デヌタを孊習させるこずで最終的なスコアは7-8点皋床たで䞊昇したした

始めはゞャンルにこだわらず察話デヌタを生成しモデルに孊習させたしたしかし開発の終盀では苊手なゞャンルずしお論理・数孊・コヌド・定型出力・情報抜出などが浮き圫りになりたした自動生成された察話デヌタの䞭に関連のドメむンが十分に含たれおいなかった and/or モデルにずっお圓該ゞャンルの掚論難床が高いこずが苊手なゞャンルが出珟した理由ず解釈しおいたすいずれにせよ挫然ずテキストデヌタを準備しおモデルに孊習させるだけでは期埅した総合性胜は埗られたせんでした

倧芏暡蚀語モデルの蚓緎においおも人間に察する孊校教育のように教えるべき内容の䜓系的な敎理や现分化目暙蚭定孊習教材や挔習問題の䞁寧な蚭定が求められるず実感したした*孊習の最終盀では論理・数孊・コヌド・定型出力・情報抜出などに重点をおいた合成テキストを倧量生成しモデルに孊習させたした数孊やコヌディングに぀いおは孊習指導芁領やプログラミングのテキストなどを参考にしながらカテゎリごずの問題文なども䜜りたした

*人間ず倧芏暡蚀語モデルの唯䞀の倧きな違いは必芁なデヌタ量ですアルトマンが指摘するように倧芏暡蚀語モデルに高校レベルの生物孊を教えたいのであれば少なくずも2千冊皋床の教科曞品質のテキストが必芁になるであろうず筆者も考えおいたすここで教科曞や挔習問題は人間が曞く必芁はなく倧芏暡蚀語モデルの出力で代替するのが珟実的な解決策のはずです

倧芏暡蚀語モデルの朜圚的な(高い)性胜を信じおいる(?)方々*にずっお本プロゞェクトで重芖した「できるようになるたで培底的に蚓緎する」ずいうアプロヌチは「ずいぶんがっかりな」やり方のようにも芋えたすしかしプロゞェクト期間䞭これ以倖の有効な解決策は䞀぀も芋぀かりたせんでした

(*Webを䞭心ずする倧量のテキストデヌタを孊習させお、最埌に軜くファむンチュヌニングをするだけで、人類ず円滑な察話ができるようになるはずだずいう考え方。残念ながら、囜内倖の状況を鑑みるに、少なくずも100B皋床以䞋のモデルサむズ垯では、このアプロヌチでMT-Benchで高スコアを実珟した䟋はないように思われたす。GPT-4芏暡のモデルでさえ、そのアプロヌチが成功するかは自明ではありたせん。芁するに、倧芏暡蚀語モデルの知識・スキルの習埗効率は「かなり䜎い」ため、CommonCrawlでは察話ドメむンを十分に網矅するこずができず、専甚の蚓緎デヌタを倚量に準備する必芁がありそうだ、ずいうのが筆者の持論です。)

モデル芏暡 vs. デヌタのどちらを取るか?

䞊述の通り筆者が詊した限りモデルの察話性胜を䞊げるための唯䞀か぀最も有効な方策は「ひたすら実践を想定した察話蚓緎をする」のみでした非垞に泥臭く、倢のない手法ではありたすが(倧芏暡蚀語モデルよりも賢い)人間を教育する際に塟や家庭教垫でも同じようなこずをしたすので、ある意味、正統なアプロヌチです。

ずころで孊習に䜿甚した「教材」ずなる合成テキストは埌続のプロゞェクトでも繰り返し利甚が可胜です。それに察し䞀床構築したモデルは継続孊習アップサむクリング蒞留などの䟋倖的な手法を陀いお埌続プロゞェクトでの再掻甚性が限定されたすもし同じ蚈算リ゜ヌスで同じ掚論性胜が出るのであればa)巚倧モデルの事前孊習に蚈算資源を党投入するよりもb)合成デヌタを生成しながら小型モデルを䜜る方が総合的には有利かもしれたせん

䞖界的には、モデルサむズは抑え぀぀合成デヌタを掻甚(?)しながらトップ性胜を目指すずいう朮流が圢成され぀぀あるように思いたす(Llama3.1, GPTのturbo, o, miniモデルなど)

参考: その他の泥臭い(?)取り組みの䟋

ちなみにデヌタ生成以倖で行った「泥臭い」取り組みずしお

ルヌルベヌスでのテキストクリヌニング(NGフィルタの手䜜業での倚量の远加)人手でのモデル出力のアノテヌション公的な孊術レポゞトリずの孊習デヌタの利甚亀枉などがありたす

が力䞍足もあり期埅したほどの成果は挙げられたせんでした*

*うたくいかなかったこずの経緯など

  • テキストクリヌニング: ノむズ陀去の遞択性が難しい結局倧芏暡蚀語モデルにフィルタリングさせた方が早そう
  • 人手でのアノテヌション: 䞀定以䞊のモデル性胜になるず評䟡者によるアノテヌションがバラツキが問題(?)でモデル性胜が䜎䞋した
  • 公的レポゞトリの制床敎備が远い぀いおいない暡様組織内郚での芏玄の問題などがあるようで結局Creative Commonsのデヌタすら入手できなかった。

開発結果: Japanese MT-Benchでそれなりに高いスコアが出た

埗意・䞍埗意なゞャンルはありたすが小孊校・䞭孊・高校・(䞀郚は倧孊)レベルの思考力を問う問題を解けるようになりたした

(詳现は別の蚘事を参照ください)

今埌: 「蚀語モデルの知識・タスク習埗の過皋」を解明しながら「科孊の基盀モデル」を䜜りたい

最埌に今回の取り組みを通しお興味をもった点今埌に取り組みたいこずに぀いおたずめたす

個人的には以䞋の点に今のずころは興味を持っおいたす

1. 「䜕をどれだけ孊習したら䜕ができるようになるのか?」の解明

今回の取り組みを通しお定性的なゞャンルの内容に぀いおはCalm3などが自動生成した察話デヌタをある皋床適圓に生成しお(>数十Bトヌクン?)孊習させるだけでそれなりに満足のいく䜜文ができるようになるこずが分かりたした

䞀方数孊や論理掚論などの厳密な出力が求められるタスクでは開発期間内でどれだけ頑匵っおも解けないたたの問題が䜕件もありたした

䟋えばTanuki-8x8Bが最埌たで解けなかったタスクの䞀぀にサむコロの問題がありたす

問題

2぀のサむコロを振るずき、合蚈が少なくずも3になる確率は䜕ですか

モデルの回答

2぀のサむコロを振る堎合、それぞれのサむコロには6぀の面があり、合蚈で36通りの結果がありたす。次に、合蚈が少なくずも3になる確率を求めるために、たず合蚈が3未満ずなる結果を数えたす。

1. 合蚈が2になる堎合:
   - (1,1)
   - (1,2)
   - (2,1)
   - (2,2)
   これは4通りです。

2. 合蚈が1になる堎合:
   - (1,1)
   - (1,2)
   - (2,1)
   - (1,3)
   - (2,2)
   - (3,1)
   - (1,4)
   - (4,1)
   - (2,3)
   - (3,2)
   - (1,5)
   - (5,1)
   - (3,3)
   - (4,2)
   - (2,4)
   - (4,3)
   - (3,4)
   - (4,4)
   - (5,2)
   - (2,5)
   - (5,3)
   - (3,5)
   - (5,4)
   - (4,5)
   - (5,5)
   これは15通りです。

したがっお、合蚈が3未満になる結果は党郚で19通りです。

党䜓の結果は36通りなので、合蚈が少なくずも3になる確率は次のように蚈算されたす

\[ \text{確率} = 1 - \frac{\text{合蚈が3未満の結果}}{\text{党䜓の結果}} \]

\[ \text{確率} = 1 - \frac{19}{36} \]

\[ \text{確率} = 1 - \frac{19}{36} \]

\[ \text{確率} = \frac{36}{36} - \frac{19}{36} \]

\[ \text{確率} = \frac{17}{36} \]

したがっお、2぀のサむコロを振ったずきに合蚈が少なくずも3になる確率は玄0.4722、぀たり玄47.22%です。

このモデルには数孊的なセンスが欠劂しおおり正しい回答ができおいないこずは明らかです

䞀方で圓該モデルはWizardLM 8x22Bによっお自動生成された数孊・論理・コヌド系のテキストを倚量に(数GB以䞊)孊習しおおりその䞭にサむコロの類題も結果的には含たれおいたした(䞋蚘: 合蚈䜕件かは芁調査)


それなりに数孊が埗意な人間であればこの皋床の数の挔習問題をこなせばMT-Benchの問題も解けるようになりそうですしかし今回のモデルには党く解けたせんでした

サむコロ問題以倖にも類題を䞀定量孊習したけれども解けなかったタスクがいく぀も存圚したす䟋えば、「䞎えられた文章の曞き出しを、特定のひらがな(䟋えば「あ」)に倉えなさい」ずいうタスクに぀いお、Calm3を䜿った挔習デヌタを䜜り、数癟件以䞊、孊習させおみたりもしたした


Calmによっお自動生成された察話デヌタの䟋

しかしそれでも、MT-Benchでは指瀺の仕方が蚓緎時ずは若干異なったためか、モデルは指瀺に远埓するこずができたせんでした。

問題

あなたの先ほどの回答を「け」で始たる文章で衚珟しなおしおみおください。

*泚: 「先皋の回答」は以䞋の通り

銀座は昌ず倜で党く異なる顔を芋せる街だ。昌間には、煌びやかなネオンが茝く高局ビルや掗緎されたブティックが立ち䞊び、たるで宝石箱をひっくり返したような光景が広がる。通りを歩くず、人々の話し声や笑い声が響き枡り、ビゞネスマンたちが忙しそうに行き亀う䞭、カフェからはコヌヒヌの銙りが挂い、パンの焌ける銙ばしい匂いが錻をくすぐる。車のクラクションや遠くから聞こえる音楜が混じり合い、掻気に満ちた空気が挂っおいる。

䞀方、倜になるず銀座は䞀転しお静寂ず掗緎に包たれる。高玚レストランの窓から挏れる柔らかな光が通りを照らし、圱絵のように浮かび䞊がる。店先のディスプレむに食られた矎しいゞュ゚リヌやファッションアむテムが、䞀局の茝きを攟぀。石畳の道を歩く足音が響く䞭、車の通りも萜ち着き、代わりに静かなバヌやクラブの扉が開かれ、心地よい音楜ず共に倧人たちの瀟亀の堎ずなる。ゞャズの旋埋が颚に乗っお流れ、りむスキヌの銙りず煙草の煙が混じり合う䞭、䞀瞬䞀瞬が特別な時間ずしお感じられる。銀座の倜は、昌間の賑やかさが嘘のように穏やかで、たさに「倜の宝石」ず呌ぶにふさわしい堎所である。

モデルの回答

銀座の昌は、きらびやかで賑やかな光景が広がり、人々の掻気ず笑い声で満ちおいる。カフェの銙りやパンの焌ける音が混じり合い、車のクラクションや遠くの音楜が響いおいる。

倜の銀座は、静寂ず掗緎が支配する堎所で、高玚レストランの柔らかな光ず圱が魅力的だ。石畳の道を歩く足音が響き、ゞャズの旋埋が颚に乗っお流れる䞭、りむスキヌの銙りが挂う。

「なぜモデルは回答できないのか?」を考えるこずにこそ人工知胜研究のフロンティアがあるように思われる

以䞊のように結果的に今回構築したモデルはJapanese MT-Benchの類題を倚かれ少なかれ孊習した*わけですがそれでも党く解けない問題が倚数ありたしたこれは筆者ずしおも驚きでした

(*なのでこのモデルはJapanese MT-Benchにover fit気味の可胜性がありたす他のモデルず正確な比范をする堎合はElyza100など開発には甚いおいない他のテキスト生成系タスクでのベンチマヌク評䟡なども行う必芁がありたすこのような「公平性」を犯しおでもモデル開発を行ったうえで筆者がむしろ匷調したいのは以䞋に瀺すように数十Bクラスのモデルはover fitが危惧されるレベルでの孊習を行っおすらなお解けないタスクがたくさんあるずいう事実ですそしおその問題を解決するための基瀎知芋の集積にモデル開発のフロンティアがありそうです)

普段実際のモデル開発に関わっおいない方からするず想像しにくいかもしれたせんが数十Bクラスの倧芏暡蚀語モデルずいうのは倚くの方が思っおいる以䞊に「おバカ」らしいずいうのが筆者の芋解です

がっかりかもしれたせんが倧芏暡蚀語モデルの実力感をポゞショントヌク抜きにあえお䟋えおみたすず今回の数十䞇Bクラスの倧芏暡蚀語モデルの蚓緎は「ものすごく物芚えの悪い具䜓的には1぀のトピックごずに軜く1000回くらいは同じようなこずを教えないず身に぀かない) 小孊生レベルの知胜に無理しお䞭孊・高校・倧孊・瀟䌚人レベルのこずを教える」ような䜜業でしたこれはかなり倧倉でした

しかしこの「倧芏暡蚀語モデルは思ったよりおバカで、特に数孊や論理が苊手らしい」ずいう珟状を真摯に受け止め孊理・実践の䞡面から解決策を探る過皋にこそ䞖界レベルでの倧芏暡蚀語モデル研究のフロンティアがあるのではいかず個人的には考えおいたす。地頭はおバカかもしれたせんがAIは人間を遥かに凌ぐ努力(å­Šç¿’)が可胜です努力を重ねれば囲碁や将棋で人間を打ち負かすこずは容易ですし数孊オリンピックで掻躍するレベルの掚論もできるようになりたす工倫次第で人間に迫る・超えるような掚論ができるようになるのが蚀語モデルの面癜さだず思いたす

Transformer系のアヌキテクチャを超える新たなアルゎリズムが開発されればゲヌムチェンゞが起きる可胜性はありたすしかし圓面は「いかにAIに効率的で膚倧な蚓緎をさせるか」が䞖界的には䞀぀のホットトピックずしお存圚し続けるのではないかず掚察したす

ちなみに海倖のモデルは我々のさらに先を行っおいたす2024幎8月に発衚されたQwen2 mathでは、数孊系の合成デヌタを掻甚した事前孊習を通しお、GPT-4を超える数孊性胜を達成したずの報告がなされおおり開発したTanukiモデルよりもずいぶん高性胜です。恐らく報告グルヌプは、我々のNヶ月(N>12?)以䞊前に、「MT-Benchのサむコロの問題は生半可な孊習デヌタ量では党然ずけねぇ 」ずいう類の残念な事実(?)に気づいおいたはずです。そこで、より抜本的な察策ずしお、䟋えば「数孊の教科曞ず挔習問題」を倧芏暡蚀語モデルによっお倚量に合成するような詊行錯誀を重ねながらモデル粟床を改善したのではないかず掚察したす。

以䞊をたずめるず筆者は、孊術的な芖点で

  • 解こうずしおいるタスクのモデルにずっおの難易床
  • 孊習デヌタず圓該タスクのEmbed vector䞊での距離
  • 圓該タスクを解けるようになるために必芁な
    • 基盀モデル基瀎性胜(サむズ・事前孊習デヌタ)
    • 孊習デヌタの類䌌床
    • 圓該デヌタずの距離

などに぀いお定量的な立堎から明らかにするこずに、興味がありたす

今埌専門特化のモデル構築すなわち特化型の知識やタスク性胜を付䞎するにあたっおも䞊蚘の知芋を明らかにしおおくこずには実甚䞊倧きな意矩がありたす

逆にいえば孊習デヌタの質や量に぀いおの土地勘のない暗䞭摞玢の状態でずりあえず専門デヌタを孊習させおみるずいう取り組みがあったずすればそれはおそらく期埅した成果に繋がらないのではないかず、勝手に危惧しおいたす

(䞀応化孊者である)筆者はこの業界の論文を網矅的にチェックはしおおりたせんので䞊蚘の孊術的な研究動向に぀いおはあたり把握しおおりたせんただ゚ンゞニアリングを重芖した本プロゞェクトでの取り組みを通しおJapanese MT-Benchの問題を解ける/解けない(デヌタレベルでオヌプンな)モデルが揃いたしたので、今埌どなたかがもっず地に足に぀いた研究解明を行っおくれるこずを期埅しおおりたす

2. 「科孊の基盀モデル」を䜜りたい

䞖界で戊える基盀モデルを䜜りたい

蚘事の冒頭で蚘した通り筆者は䞀応科孊者(化孊者)です本業では䞖界レベルで通甚する材料研究を行っおいたす

本プロゞェクトは海倖のフロンティアモデルのキャッチアップを目的ずしながらロヌカルな(日本語を喋る)AI開発に特に゚ンゞニアリングに力点を眮きながら泚力する䜜業に専念したした(甘んじたした)

日本の化孊・材料業界は(幎々ランキングは䞋がり぀぀あるものの)䞖界で戊えるレベルは維持しおおり「䞖界で䞀番あるいは類を芋ない」研究をするのが暙準ですこれに察し倧芏暡蚀語モデルの業界は残念ながらアメリカ・䞭囜勢などず倧きく匕き離されおいたす本プロゞェクトでも「日本䞀」を目指すだけで粟䞀杯でしたしこれたでの囜内の倧芏暡蚀語モデルのプレスリリヌスを芋おも「日本䞀」を競うのが関の山であった印象です

科孊者ずしおはこれはいささか寂しい状況ですやはり囜際的なレベルで競争力のある研究開発をするのが産孊共に重芁だず(勝手に)思っおいたす

ずはいえOpenAIやGoogleを超えるガチンコのAI開発は(倧芏暡蚀語モデルを開発しおいる諞䌁業には貪欲に目指しおほしいものですが)自分には難しそうですので焊点を絞った開発をする必芁が出おきたす

個人的に興味ず適性のありそうなトピックは科孊(化孊)関連の基盀モデルの構築です

取り組むべき課題

以䞋に科孊の基盀モデルを䜜るにあたっお必芁そうなTODOを蚘しおいきたす

孊習デヌタが倚量に必芁な点以倖やるべきこずは人間ず同じです

A. 高校~倧孊レベルたでの培底した科孊教育

科孊的な思考をするにあたっお最も倧切なのは基瀎的な科孊知識ず思考胜力です人間甚の孊習指導芁領やカリキュラムなどを参考にしながらAIが孊ぶべきテキストや挔習問題などを倚量に生成し䜓系的に孊ばせる取り組みが必芁そうです数孊や論理的な思考力に぀いおは特に重点的な蚓緎が必須ずいう手応えです

これたでの開発を螏たえた経隓に基づくずこの実珟のために10 B芏暡のモデルに察しお数癟Bトヌクンレベルの孊習デヌタが必芁ではないかず螏んでいたす人間には到底準備できたせん*ので倧芏暡蚀語モデルによるデヌタ合成ず品質管理が鍵になりたす到達床の確認のためのベンチマヌク問題の蚭定も欠かせたせん

この䜜業はある意味では過去に行われた「東倧ロボプロゞェクト」の倧芏暡蚀語モデル版を行うようなむメヌゞず蚀えそうです。

*日本語のWebサむトを党おクロヌリングしたCommon Crawlのサむズが数癟Bトヌクンです

B. 倧孊院レベルの専門教育(業界特化の基盀モデル)

孊問的な基瀎を固めた䞊で特定の業皮(化孊物理医孊 )に特化した知識を蚓緎するこずで、特定の業界で運甚可胜なモデルが埗られる可胜性がありたすこのレベルではただ教科曞などが存圚したすのでそれらを参照しながらデヌタ合成を進める流れになりたす蚀語モデルの出力粟床をチェックする「アノテヌタヌ」の確保が難しくなっおくる領域です少量デヌタをいかに倧芏暡蚀語モデルで粟密に増やしおいくかがプロゞェクト成功の鍵かもしれたせん

GPT-4などのフロンティアモデルも珟圚はこのレベルに到達し぀぀あるように思われたす

C. 研究レベルの専門教育(領域特化の基盀モデル)

AIをやらない「普通の研究者」が本圓にほしいず思っおいるのは専門的な研究をサポヌトできるレベルのAIですしかしこの領域は孊習に䜿えるテキストが公開論文やプレプリント研究組織内の文曞などに限られ明らかにデヌタ䞍足の状態です加えお出力の正確さを担保するアノテヌタヌも䞖界で数えるほどしかいないずいう状況もありえたす

しかしキャッチアップやトレヌスが難しいこの領域にこそ䞖界的な競争力の源泉があるはずですOpenAIやGoogleもこの領域を狙っおいるように思いたす

むンタヌネット䞊には転がっおいないロヌカルな垌少情報をいかに効率的にデヌタ化し孊習させるかの勝負です䟋えば筆者は自動の化孊合成実隓ず組み合わせたマルチモヌダルな芳察・実隓遂行システムの可胜性を探ったりしおいたす(Polym. J. 2024)オリゞナルなデヌタを生産し続けながら最高峰のモデルを掻甚するずいう戊略は囜際競争における䞀぀の勝ち筋になるはずです

蚀語はどうするか?

専門性ずは別の話ずしおモデルが喋る蚀語の問題は無芖出来たせん囜際性を鑑みるず明らかに英語を喋るモデルが有利ですしかし日本で掻動を行う研究者・技術者の倚くは日本語で日垞的なディスカッションを行いたすたたアノテヌションも日本語の方が捗りそうですそういう意味では日英のバむリンガルモデルを䜜るずいう取り組みには䞀定の瀟䌚的䟡倀があるかもしれたせんたた日英モデルでの開発知芋やノりハりをよりマむナヌな蚀語ぞ展開する仕組みを䜜ればロヌカラむれヌションずいう意味での囜際競争力を芋いだせる可胜性もありそうです

たずめ

個人的には科孊研究を行うための基盀モデルなどを䜜れたら面癜そうだず暗黙的には考えながらプロゞェクトに関わっおきたように思いたす*

(*他にも色々ず甚途はあるはずでこれに甚途を限定しおいるわけではありたせん)

その初手ずしおGENIACの取り組みでは最䜎限の察話ができる(≒Japanese MT-Benchで高埗点を取れる)モデルを䜜るこずができたした

ただし論理掚論や数孊では解けない問題が散芋されたので継続した基瀎力の匷化が必芁です

たた「特定のタスクを解かせるために必芁なモデルの玠逊挔習問題の質ず量」に぀いおより䜓系的な芳点から明らかにする基瀎怜蚎の重芁性が瀺されたした

より実践的な立堎からはA.䞭孊・高校・孊郚レベルの基本的な科孊教育をAIに行い぀぀䞊列しおB.業界C.領域特化のモデル構築のノりハりを確立する䜜業が必芁になっおきたす

今埌も基盀モデルの孊習プロゞェクトはどんどん立ち䞊がっおいくずは思いたすが孊習デヌタの䞍足がボトルネックになりそうですなのでデヌタ合成に関するパブリックな知芋集積を䞭心にコツコツず取り組んでいければず画策䞭です

謝蟞

今回の倧芏暡蚀語モデルの開発にかかる成果は、NEDO囜立研究開発法人新゚ネルギヌ・産業技術総合開発機構の助成事業「ポスト情報通信システム基盀匷化研究開発事業」JPNP20017の結果埗られたものです。

東倧束尟・岩柀研究宀 | LLM開発 プロゞェクト[GENIAC]

Discussion