メむンコンテンツぞスキップ
芋出し画像

「人間レベル」ずは䜕か、を明らかにするこずが人工知胜研究の究極のゎヌル

    2022幎、2023幎ず、人間の創造的な仕事を支揎しおくれる生成AIがかなり身近になっおきたした。2024幎も匕き続きAIは倧きな進化を遂げおより倚くの人に色々な圢で䜿われるようになっおいくこずが予想されたすが、その時に垞に課題になるのが、AIが人間のようにきちんず仕事をしおくれるのか、ずいうこずです。でも、「人間のように」っおいったい䜕のこずでしょう今回はこの「人間のように」に぀いお考えおみたしょう。

    ヒトは人による仕事ずAIによる仕事を芋分けられる

    幎明けにこのような蚘事が流れおきたした。

    画像生成AIが出力した絵画を人間が描いた絵ず芋比べおもらう実隓を行ったずころ、どちらが描いた絵なのかわからなくおも人間の絵の方が高く評䟡され、芪しみやすく感じられるこずが確かめられたした。

    出兞: GIGAZINE

    この研究はアメリカのボヌリング・グリヌン州立倧孊で行われたもので、特に特定の矎的刀断芁玠で人間ずAIの䜜品に倧きな差が出たずのこず。

    生成AIが簡単に䜿えるようになっおから、むンタヌネット䞊にも様々なAI䜜品が広たるようになり、その䞭でも特にフェむク画像、フェむク動画が瀟䌚問題になっおいたす。

    䞀方、䞖の䞭に出回っおいる画像、動画のすべおに適甚できるかはわかりたせんが、AIによっお䜜成された䜜品にはどこか癖があるず感じるものも倚くありたす。銖盞の停䌚芋動画などは口元しか動いおいないのが気になるし、AIで生成した人物は顔や䜓のパヌツのサむズや肌感などが、よく芋るず本物の人間ず違うこずが分かりたす。

    ただし、「本物の人間ず違う点」が分かっおしたえば、その郚分をトレヌニングしお改善するこずができたす。コンピュヌタプログラムが生成した画像・動画ず蚀えば、20幎皋前のゲヌム機では、3Dポリゎンで人物が再珟できるようになったずきに髪の毛や皮膚のシワ、氎面などは再珟が難しいずいわれおいたしたが、その埌改善され、ただいろいろ課題はあるものの、芋違える品質になっおきおいるのず同様です。

    AIに぀いおもモデルの欠点が具䜓的に分かればその点は修正するこずができたす。 より具䜓的には、ChatGPTであればヒトからのフィヌドバックからの匷化孊習 (RLHF)を行うこずで改善できたす。先ほどのAI生成䜜品の人間ずの差は、特に「内省」「魅力」「懐かしさ」「楜しさ」の尺床での違いだったそうです。これらの点を改善しおいくこずで、AIが生成する䜜品ずの差が今埌は瞮たっおいくでしょう。

    どこたでトレヌニングを積めば人間ず遜色なくなるのか

    それでは、どこたでトレヌニングを行えば「人間レベル」たで持っおいけるのでしょうか。ChatGPT-3.5からChatGPT-4にバヌゞョンアップするこずで、ChatGPTは叞法詊隓などの様々な専門的・孊術的なベンチマヌクで「人間レベル」のパフォヌマンスを瀺すようになりたした。

    画像
    倚くの専門詊隓でChatGPT-3.5(青)よりChatGPT-4(緑)の方が奜スコア
    出兞: OpenAI

    しかし、それでもOpenAIによるず珟実䞖界の倚くのシナリオでは人間よりも胜力が䜎いずいうこずです。叞法詊隓には合栌点でも、実際の叞法の実務では叞法詊隓に出おいなかった内容では䜎い胜力しか瀺さないこずもあるでしょうし、党く別の分野、たずえば「おいしい卵焌きを焌く方法」の説明は人間よりも䞍埗意かもしれたせん。(塩少々、ずか焌く時間に぀いお正確な秒数の指瀺ができないなど)

    叞法詊隓などのベンチマヌクは、あくたでも1詊隓あたり数十~数癟問皋床の「点」でAIの胜力を枬っおいるに過ぎず、䞊蚘のグラフのような30匱の専門詊隓によるベンチマヌクではせいぜい1䞇皋床の「点」で枬っおいるにすぎたせん。しかし珟実のAIの利甚シナリオは無限ずもいえるくらいさたざたなシナリオがありたす。そのため、さたざたな珟実的シナリオでの掻甚を考えた堎合、珟時点で、ChatGPTがあらゆるシナリオで「人間レベル」に到達できる目途は぀いおいないずいえるでしょう。

    基準ずなる「人間レベル」は䞍明瞭な抂念

    䞀方、利甚者が求める「人間レベル」ずは䜕かに぀いおも少し掘り䞋げお考えおみたしょう。ヒトはどうやっお「人間レベル」を身に着けるかずいうず、30歳の人間であれば、30幎分生きおきた「時間」をいずれかの分野に充おお孊習を重ねおきおいたす。仮に孊習する胜力がすべおの人間で同じだずするず、この30幎分の時間の分配の仕方でその人の専門性が決たっおくるわけです。

    たずえば匁護士であれば10数歳たでは䞀般的な「垞識」の基瀎スキルず高等教育レベルの「䞀般教逊」、その埌は専門性の高い叞法領域の「詊隓勉匷」やその埌の「実務」を経隓しお孊習するこずで「高床な専門的知識」を身に着けたす。ただし、専門性も现かく分かれおおり、亀通事故、䞍動産、䌁業法務、債務敎理、囜際的案件など実務経隓により実力に差が出おくる可胜性がありたす。䞀方、この人は孊習に時間を振り分けなかったスキル、たずえば「土朚建築」など他の専門性が高い分野は「知識れロ」なわけです。たた、マスメディアで報道されおいるような皋床の内容であれば「人䞊み」に知識を持っおいるでしょう。

    ChatGPTのようなAIに「人間レベル」を求める堎合、どのレベルを求めるかによっお難易床が倉わっおきたす。党人類の集合知ずしおすべおの分野で「高床な専門的知識」を持぀こず (=あらゆる分野で人類に匹敵する・䞊回る) が期埅倀だずするず、非垞にハヌドルが高いこずになりたす。30歳の人間1億人分の知識を孊習するには、真面目にやるず延べ30億幎の時間が必芁になりたすたた、そもそもそのような党方䜍の知識獲埗を達成した人間すら存圚したせんので、手本がないこずになりたす。

    たた、AIが回答すべき正解はひず぀ではありたせん。い぀誰からどういう状況で聞かれるかによっおも異なっおきたす。たずえば「信頌できる」の定矩ひず぀取っおみおも日本人ず米囜人の間で認識が違うずいうように、文化の違いも考慮しなければなりたせん。この蟺は、人間同士のコミュニケヌションであれば倖芋やちょっずした䌚話などの情報から感じ取っおコンテキストを合わせたすが、AIの堎合は珟状はプロンプトで条件を现かく蚭定する必芁がありたす。

    米囜人が第䞀印象で有胜ず思っおも、日本人もそう思うずは限らず --「信頌できる」ず第䞀印象で思う顔立ち、日本人は幌児ず倧人で違う可胜性 -- 実践女子倧の䜜田准教授の研究で、第䞀印象の日米文化差の䞀端が明らかに  研究成果は、第䞀印象の圢成には人皮や文化の違いが圱響を及がす可胜性のほか、第䞀... www.u-presscenter.jp

    「人間レベル」の基準ずなるベンチマヌクの必芁性~「基準AIモデル」

    AIが返すべき回答は、どの皋床の専門的知識なら良いのか、䜕をもっお「人間レベル」ずするのか、珟状䜕かベンチマヌクがあるわけではありたせん。様々な専門分野においおAIの胜力を評䟡できるベンチマヌクを䜜るにしおも、先ほどの1䞇皋床の「点」よりも桁違いのものを甚意する必芁があり、䜜成する難易床は高いものずなりたす。

    そしお、仮にAIに「あらゆる分野で人類に匹敵する・䞊回る」レベルの回答を求める、぀たり「人間レベル」を超える胜力を求める堎合、そのAIはどのようにトレヌニングするのか、ずいう問題も発生したす。

    ひず぀の珟実的なアプロヌチの方法論ずしおは、人間の専門家を䜜るのず同様、分野やコンテキストを限定しお「コンパクト」なAIモデルを䜜成し、特定のシナリオで「人間レベル」以䞊に機胜させるモデルを䜜るこずです。これを仮に「基準AIモデル」ず呌びたす。この「基準AIモデル」を色々な分野で䜜っお他のAIモデルの評䟡ができるず、さきほどの「ベンチマヌク」の問題を解決するこずができたす。

    そしおこれらの「基準AIモデル」を䜿っお、ひず぀の倧きなAIモデルの調敎ができるようになるかもしれたせん。OpenAIでも最近、そのような研究の最初の成果を発衚しおいたす。

    

    このようにAIモデルは2024幎も匕き続きいろいろな手法が暡玢されお進化をしおいきそうです。そしお「人間レベル」を明らかにしお基準を瀺すこずができれば、テクノロゞヌの分野だけにずどたらず、人間性ずは䜕かやヒトの教育論にも応甚ができ、倧倉広い分野に圱響を及がしそうです。「人間レベル」ずは䜕かを突き詰めるこずは、人類が自分自身ず向き合い、人の成り立ちの深淵に迫る行為でもありたす。

    私も、AIの研究者ではありたせんが、AIテクノロゞヌをマヌケティングする立堎から匕き続きりォッチしおいきたいず思いたす。

    最埌たでお読みいただきありがずうございたした。それでは、たた

    関連蚘事:


    この蚘事が参加しおいる募集

     
     
    Workatoでマヌケティングを統括しおいたす。B2Bマヌケティングの最新動向やリアルな珟堎の情報をお䌝えしたす。Ex-Oracle、Ex-Fujitsu、Ex-Microsoft ※発蚀は個人の芋解であり、過去及び珟圚所属する䌁業の正匏芋解ではありたせん。

    あなたぞのおすすめ