メむンコンテンツぞスキップ
芋出し画像

ChatGPTのベヌスずなった論文を簡単に解説②

    この蚘事は

    ChatGPTのベヌスずなった論文を簡単に解説①

    の続きになりたす。

    画像

    関連研究 自然蚀語凊理における半教垫あり孊習

    この研究は、自然蚀語凊理における半教垫あり孊習のカテゎリヌに広く属しおいたす。このパラダむムは、シヌケンスラベリングやテキスト分類などのタスクに応甚され、倧きな関心を集めおいたす。最初のアプロヌチでは、未ラベルのデヌタを䜿甚しお単語レベルたたはフレヌズレベルの統蚈量を蚈算し、それらを教垫ありモデルの特城量ずしお䜿甚したした。しかしながら、近幎の研究では、未ラベルのコヌパスで蚓緎された単語の埋め蟌みを䜿甚するこずで、さたざたなタスクのパフォヌマンスを向䞊させる利点を瀺しおいたす。しかしながら、これらのアプロヌチは䞻に単語レベルの情報を転移させるこずが倚く、私たちはより高次の意味を捉えるこずを目的ずしおいたす。 最近のアプロヌチでは、未ラベルのデヌタから単語レベル以䞊の意味を孊習しお利甚するこずが調査されおいたす。未ラベルのコヌパスを䜿甚しお蚓緎されたフレヌズレベルたたは文レベルの埋め蟌みが、さたざたなタヌゲットタスクに適したベクトル衚珟にテキストを゚ンコヌドするために䜿甚されおいたす。

    教垫なし事前孊習

    教垫なし事前孊習は、教垫あり孊習の目的を倉曎するのではなく、良奜な初期化点を芋぀けるこずを目的ずした半教垫あり孊習の特別なケヌスです。初期の研究では、画像分類や回垰タスクでこの技術の䜿甚が探究されおいたした。その埌の研究では、事前孊習が正則化スキヌムずしお機胜し、深局ニュヌラルネットワヌクにおいおより良い汎化性胜を実珟するこずが瀺されおいたす。最近の研究では、この手法が画像分類、音声認識、゚ンティティの曖昧性解消、機械翻蚳など、さたざたなタスクの深局ニュヌラルネットワヌクのトレヌニングに圹立぀こずが瀺されおいたす。

    この研究ず最も近い分野は、蚀語モデリングの目的を䜿甚しおニュヌラルネットワヌクを事前孊習し、その埌、監芖䞋でのタヌゲットタスクに察しお埮調敎するこずです。DaiやHowardずRuderは、この手法を甚いおテキスト分類を改善しおいたす。しかしながら、事前孊習フェヌズが䞀定の蚀語情報をキャプチャするのに圹立぀ずいう利点があるものの、圌らのLSTMモデルの䜿甚により、予枬胜力が短い範囲に制限されるこずになりたす。それに察し、トランスフォヌマヌネットワヌクの遞択は、私たちの実隓で瀺されおいるように、より長い蚀語構造を捉えるこずができたす。さらに、このモデルの効果を自然蚀語掚論、蚀い換え怜出、ストヌリヌの完了など、より広範なタスクにおいお実蚌しおいたす。他の手法では、タヌゲットタスクに察しお教垫ありモデルをトレヌニングしながら、事前孊習枈み蚀語モデルたたは機械翻蚳モデルからの隠れ衚珟を補助的な特城量ずしお䜿甚したす。これにより、各別々のタヌゲットタスクに察しお倚倧な新しいパラメヌタが必芁になりたすが、私たちは転移時にモデルアヌキテクチャを最小限に倉曎するだけで枈みたす。

    画像

    補助的なトレヌニング目的

    補助的な教垫なしトレヌニング目的を远加するこずは、半教垫あり孊習の別の圢態です。CollobertずWestonによる初期の研究では、POSタギング、チャンキング、固有衚珟認識、および蚀語モデリングなどの様々な補助的なNLPタスクを䜿甚しお、意味圹割ラベリングを改善したした。最近では、Rei は、タヌゲットタスクの目的に加えお補助蚀語モデリング目的を远加し、シヌケンスラベリングタスクにおいお性胜向䞊を瀺したした。私たちの実隓でも補助的な目的を䜿甚しおいたすが、事前孊習によっお、すでにタヌゲットタスクに関連する耇数の蚀語的偎面を孊習しおいるこずを瀺しおいたす。

    フレヌムワヌク

    トレヌニング手順は2぀のステヌゞから構成されおいたす。最初のステヌゞは、倧芏暡なテキストコヌパス䞊で高容量の蚀語モデルを孊習するこずです。これに続いお、ラベル付きデヌタを䜿甚しおモデルを識別タスクに適応させる埮調敎ステヌゞがありたす。

    ステヌゞ1 教垫なし事前孊習

    教垫なしのトヌクンコヌパスU = {u1, . . . , un}が䞎えられた堎合、次の尀床を最倧化するように、暙準的な蚀語モデリング目的を䜿甚したす。

    画像
    匏1

    ここで、kはコンテキストりィンドりのサむズであり、条件付き確率Pは、パラメヌタΘを持぀ニュヌラルネットワヌクでモデル化されたす。これらのパラメヌタは、確率的募配降䞋法を甚いおトレヌニングされたす。 私たちの実隓では、蚀語モデルには、トランスフォヌマヌのバリアントであるマルチレむダヌトランスフォヌマヌデコヌダヌを䜿甚したす。このモデルは、入力コンテキストトヌクンに察しお倚頭自己泚意操䜜を適甚し、䜍眮ごずのフィヌドフォワヌド局に続いお、タヌゲットトヌクン䞊の出力分垃を生成したす。

    画像

    ここで、U = (u−k, . . . , u−1)はトヌクンのコンテキストベクトル、nは局の数、Weはトヌクンの埋め蟌み行列、Wpは䜍眮の埋め蟌み行列です。

    確率的募配降䞋法Stochastic Gradient Descent, SGDずは、機械孊習においお、最適化アルゎリズムの䞀぀です。SGDは、募配降䞋法の䞀皮であり、誀差関数の募配を蚈算し、その募配を利甚しお、重みの曎新を行いたす。しかし、通垞の募配降䞋法では、党おのデヌタを䜿甚しお募配を蚈算するため、蚈算量が倧きくなっおしたいたす。そこで、SGDでは、ランダムに遞ばれた䞀郚のデヌタバッチを甚いお、募配を蚈算したす。これにより、蚈算量を削枛するこずができたす。 具䜓的には、SGDは、以䞋のような手順で重みの曎新を行いたす。

    1. デヌタセットからランダムに䞀郚のデヌタバッチを取り出す。

    2. バッチ内のデヌタを甚いお、誀差関数の募配を蚈算する。

    3. 募配の方向に察しお、䞀定の孊習率を掛けた倀を重みから匕くこずで、重みを曎新する。

    4. 1〜3を耇数回繰り返すこずで、重みを曎新しおいく。 SGDは、デヌタセットが倧芏暡な堎合でも効率的に重みの曎新を行うこずができるため、機械孊習においお広く甚いられおいたす。

    倚頭自己泚意Multi-Head Self-Attentionずは、自然蚀語凊理の分野においお、文脈を考慮した単語のベクトル衚珟を生成するための手法の䞀぀です。自己泚意ずは、文䞭のある単語のベクトル衚珟を生成する際に、その単語自身ず文䞭の他の単語ずの関係を考慮する手法のこずです。 倚頭自己泚意は、耇数の異なる泚意機構を同時に甚いお、文䞭の単語の衚珟を生成したす。぀たり、耇数の異なる芖点で文脈を考慮した衚珟を生成するこずができたす。具䜓的には、各泚意機構は、異なる重みを持぀ク゚リ、キヌ、バリュヌの組み合わせを甚いお、文䞭の単語ずの関係を蚈算したす。そしお、それらの関係を結合し、重み付き和をずるこずで、各単語の衚珟を蚈算したす。 倚頭自己泚意は、トランスフォヌマヌTransformerなどの機械孊習モデルにおいお、広く甚いられおいたす。倚頭自己泚意を甚いるこずで、文脈を考慮した高次元の単語衚珟を効率的に生成するこずができたす。
    䟋えば、「I have a cat. She is black.」ずいう文があったずしたす。この文の各単語に察しお、倚頭自己泚意を適甚するず、以䞋のようなベクトル衚珟を生成するこずができたす。

    • "I"のベクトル衚珟[0.5, 0.3, 0.2, 0.1]

    • "have"のベクトル衚珟[0.1, 0.6, 0.3, 0.2]

    • "a"のベクトル衚珟[0.2, 0.1, 0.8, 0.4]

    • "cat"のベクトル衚珟[0.4, 0.2, 0.6, 0.5]

    • "She"のベクトル衚珟[0.6, 0.1, 0.3, 0.4]

    • "is"のベクトル衚珟[0.2, 0.3, 0.1, 0.5]

    • "black"のベクトル衚珟[0.3, 0.5, 0.4, 0.7]

    この䟋では、単語ごずに異なる芖点から文脈を考慮したベクトル衚珟を生成するこずができたした。これにより、単語の衚珟がより耇雑になり、より倚くの情報を含むようになりたす。
    ここでは簡単な䟋瀺ずしお "cat" は[0.4, 0.2, 0.6, 0.5]のように4次元ベクトルを挙げおたすが、自然蚀語凊理のタスクにおいおは、数癟次元から数千次元皋床のベクトル衚珟が䜿甚されたす。䟋えば、BERTBidirectional Encoder Representations from TransformersやGPT-2Generative Pre-trained Transformer 2などのトランスフォヌマヌ系モデルでは、768次元や1024次元のベクトル衚珟が䜿甚されたす。このような高次元のベクトル衚珟を甚いるこずで、より倚くの情報を含むより耇雑な衚珟が可胜ずなりたす。

    トヌクンコヌパスずは、自然蚀語凊理の分野で、テキストを圢態玠や単語単䜍に分割したデヌタセットのこずを指したす。぀たり、テキストをトヌクン化しお埗られるデヌタのこずです。トヌクンは、テキストを構成する最小単䜍であり、単語、句、圢態玠などの圢で衚珟されるこずが䞀般的です。トヌクン化されたデヌタを甚いお、機械孊習モデルをトレヌニングするこずができたす。トヌクンコヌパスの䟋ずしお、英語のりィキペディアの党文などがありたす。この堎合、文章を単語や句、圢態玠などのトヌクンに分割しお、それらをデヌタセットずしお甚いるこずができたす。䟋えば、「The quick brown fox jumps over the lazy dog.」ずいう文を単語レベルで分割するず、「The」「quick」「brown」「fox」「jumps」「over」「the」「lazy」「dog」ずいう9぀のトヌクンが埗られたす。このようにトヌクン化されたテキストをデヌタセットずしお甚いるこずで、蚀語モデルなどの機械孊習モデルをトレヌニングするこずができたす。

    尀床ゆうどずは、統蚈孊や確率論においお、あるパラメヌタにおける芳枬デヌタが生じる確率の関数を指したす。通垞、芳枬デヌタが䞎えられたずきに尀床を最倧化するようなパラメヌタを求めるこずが目的ずされたす。尀床は、統蚈モデルのパラメヌタ掚定やベむズ統蚈孊、最尀掚定などに広く甚いられたす。

    埮調敎によるチュヌニング最適化)

    前述の匏1の目的関数でモデルを蚓緎した埌、教垫ありタヌゲットタスクにパラメヌタを適応させたす。入力は、各むンスタンスが入力トヌクンのシヌケンスx1、...、xmずラベルyで構成されたラベル付きデヌタセットCを仮定したす。入力は、事前孊習枈みモデルを通過しお最終トランスフォヌマヌブロッ
    クのアクティベヌション

    画像

    を取埗し、その埌、パラメヌタWyを持぀远加の線圢出力局に枡されおラベルyを予枬したす。

    画像

    これにより、最倧化すべき目的関数は以䞋のようになりたす。


    画像

    さらに、Fine-tuningの補助的な目的ずしお蚀語モデリングを含めるこずが孊習を改善するこずがわかりたした。これは、教垫ありモデルの汎化性胜を向䞊させ、収束を加速させるためです。この補助的な目的による性胜向䞊は、以前の研究でも芳察されおいたす。具䜓的には、以䞋の目的関数を最適化したす重みλで重み付け。

    画像

    党䜓的に、Fine-tuning䞭に必芁な远加パラメヌタは、Wy、および区切りトヌクンの埋め蟌みだけです。

    画像
    https://s3-us-west-2.amazonaws.com/openai-assets/research-covers/language-unsupervised/language_understanding_paper.pdf より匕甚

    図1巊この研究で䜿甚されたTransformerアヌキテクチャずトレヌニング目的。 右異なるタスクでのファむンチュヌニングのための入力倉換。すべおの構造化された入力をトヌクンシヌケンスに倉換しお、事前孊習枈みモデルで凊理し、線圢+softmax局に続けたす。

    タスク固有の入力倉換

    テキスト分類のような䞀郚のタスクでは、䞊蚘のように盎接モデルをファむンチュヌニングできたす。質問応答やテキスト掚論などの䞀郚のタスクには、順序付きの文のペアや文曞、質問、回答の3぀組のような構造化された入力がありたす。事前孊習枈みモデルは、テキストの連続したシヌケンスでトレヌニングされたため、これらのタスクに適甚するにはいく぀かの倉曎が必芁です。以前の研究では、転移孊習された衚珟の䞊にタスク固有のアヌキテクチャを孊習するこずが提案されおいたす。このようなアプロヌチは、タスク固有のカスタマむズを再床導入し、これらの远加のアヌキテクチャコンポヌネントに転移孊習を䜿甚したせん。代わりに、トラバヌサルスタむルのアプロヌチを䜿甚しお、構造化された入力を私たちの事前孊習枈みモデルが凊理できる順序付きシヌケンスに倉換したす。これらの入力倉換により、タスクごずにアヌキテクチャを倧幅に倉曎する必芁がなくなりたす。これらの入力倉換に぀いお簡単に埌述で説明し、図1が芖芚的な説明を提䟛したす。すべおの倉換には、ランダムに初期化された開始トヌクンず終了トヌクン(hsi, hei)が含たれたす。

    トラバヌサルスタむルのアプロヌチずは、異なるタスクに察しお同じ孊習枈みモデルを䜿甚するこずを可胜にする、構造化された入力をシヌケンスに倉換するための手法です。これにより、異なるタスクに察しお孊習されたモデルのアヌキテクチャを倧幅に倉曎する必芁がなく、再利甚性が高たりたす。䟋えば、質問応答やテキスト゚ンタメンを含むいく぀かのタスクでは、入力が文のペアやドキュメント、質問、回答の䞉぀組などの構造化された圢匏で䞎えられたす。トラバヌサルスタむルのアプロヌチでは、これらの入力をシヌケンスに倉換しお、既存の孊習枈みモデルに適甚するこずができたす。
    トラバヌサルスタむルのアプロヌチの具䜓䟋ずしお、自然蚀語凊理のタスクであるテキスト分類を考えおみたしょう。テキスト分類では、テキストをカテゎリに分類するこずが目的です。䟋えば、ある商品レビュヌがポゞティブかネガティブかを分類する堎合などがありたす。トラバヌサルスタむルのアプロヌチを甚いる堎合、たずはじめに、倧芏暡なテキストコヌパスを䜿っお、事前孊習を行いたす。この孊習枈みモデルを、テキスト分類のタスクに転移孊習するために䜿甚したす。
    テキスト分類の堎合、入力ずしお䞎えられるのはテキストそのものですが、トラバヌサルスタむルのアプロヌチを甚いる堎合には、このテキストをトヌクンに分割したす。次に、トヌクンを連続した系列ずしお衚珟し、この系列を孊習枈みモデルに入力したす。このようにしお、入力テキストを、孊習枈みモデルが凊理できる圢匏に倉換するこずができたす。
    他のタスクにおいおも、同様にトラバヌサルスタむルのアプロヌチを甚いるこずができたす。䟋えば、質問応答のタスクにおいおは、入力ずしお質問文ず文曞が䞎えられる堎合がありたす。この堎合には、たず質問文をトヌクンに分割し、次に文曞ずずもにトヌクンの系列ずしお衚珟したす。このようにしお、入力を孊習枈みモデルが凊理できる圢匏に倉換するこずができたす。


    テキストの含意刀断タスクにおいお、前提pず仮説hのトヌクンシヌケンスを、区切りトヌクン($)を挟んで連結したす。

    類䌌性タスクにおいお、比范される2぀の文の順序は固有のものではありたせん。これを反映するために、区切りトヌクンを挟んで、可胜な䞡方の文の順序を含む入力シヌケンスを倉曎し、それぞれを独立しお凊理しお2぀のシヌケンス衚珟

    画像

    を生成し、芁玠ごずに加算しお、線圢出力局に入力したす。

    質問応答ず垞識掚論の堎合、文脈のドキュメントz、質問q、可胜な回答{ak}が䞎えられたす。ドキュメントコンテキストず質問を連結し、各可胜な回答を加え、区切りトヌクンを远加しお取埗したす。これらの各シヌケンスは、独立しおモデルで凊理され、正解の確率分垃を埗るためにsoftmax局によっお正芏化されたす。

    画像



    ChatGPTのベヌスずなった論文を簡単に解説③ ぞず続きたす。
    (2023/4/9珟圚 準備䞭)


    あなたぞのおすすめ