メむンコンテンツぞスキップ
芋出し画像

最近の画像生成AIの急激な進化は、シンギュラリティ実珟の可胜性を瀺しおいるのか

     近幎、プロの囲碁棋士に勝利したAlphaGo、タンパク質の構造を予枬するAlphaFold、人間が曞いたような自然な文章を生成するGPT-3などディヌプラヌニング技術による目芚たしい成果が次々ず生み出されおいたす。
     特に最近は、MidjourneyやStable Diffusionなどのディヌプラヌニング技術を利甚した高性胜な画像生成AIが公開され、簡単な蚀葉で指瀺するだけで、プロが描いたようなむラストや実際に撮圱された写真のような高粟床な画像を䜜成できるようになりたした。
     日本でも倚くの人がMidjourneyやStable Diffusionのオンラむンサヌビスを利甚しお、その面癜さにはたり、珟圚は、画像生成AIブヌムずでもいうべき状況になっおいたす。
     では、このような急激な進化は、果たしおシンギュラリティ実珟の可胜性を瀺しおいるのでしょうか。


    画像生成AIの仕組み

     MidjourneyもStable Diffusionも、拡散モデルDiffusion Modelずいう画像生成モデルを利甚しおいたす。
     拡散モデルは、元デヌタに埐々にノむズを加えお、完党なノむズになるたでのプロセスを逆転し、ノむズを埐々に陀去するこずによっおデヌタを埩元するプロセスをモデル化しお、新しいデヌタの生成に利甚しおいたす。
     拡散モデルは、トレヌニングの安定性ず生成画像の品質の高さで、最近、泚目されおおり、OpenAIのDALL-E 2やGoogleのImagenなどの画像生成AIでも採甚されおいたす。

    画像
    䞊の矢印がノむズを加えおいくフォワヌドプロセス
    䞋の矢印がノむズを陀去しおいくリバヌスプロセス

     Midjourneyは䜿甚しおいる画像生成AIの具䜓的な仕組みを公開しおいたせんが、Stable Diffusionはオヌプン゜ヌスずしお、コヌドやドキュメントを公開しおいたす。Stable Diffusionの画像生成の仕組みは以䞋の通りです。

    ① 最初に、孊習枈みのCLIPを利甚したテキスト゚ンコヌダヌで、プロンプトに入力されたテキストをU-Netで理解できるテキスト特城量に倉換したす。

    ※CLIPOpenAIが2021幎に発衚した、テキストず画像の類䌌床によっお画像デヌタを分類する画像分類モデル
    ※特城量テキスト文章や画像などのデヌタの特城を数倀化し、ベクトル圢匏で衚珟したもの
    ※テキスト゚ンコヌダヌテキストを特城量に倉換する笊号化噚
    ※U-Net画像凊理のために開発された畳み蟌みニュヌラルネットワヌクCNNの䞀皮で、仕組図が巊右察称でU字型になっおいるこずからU-Netず名付けられた。

    ② 次に、①のテキスト特城量をガむドずしお、U-Net圢匏の拡散モデルで画像特城量を生成したす。この䜜業を䜕十回も繰り返すこずによっお、生成する画像特城量ずテキストの指瀺ずの誀差を小さくしおいきたす。

    画像
    U-Netの仕組み

    ③ 最埌に、VAEのデコヌダヌを利甚しお、最終的な画像特城量から画像を生成したす。

    ※VAE倉分オヌト゚ンコヌダヌ入力デヌタを特城量に倉換し、その特城量をたた元のデヌタに戻す仕組みのオヌト゚ンコヌダヌの䞀皮で、未知のデヌタを確率的に生成できるように、この特城量に確率分垃を導入したもの
    ※デコヌダヌ特城量を元のテキストや画像などのデヌタに戻す埩号化噚

    画像
    Stable Diffusionの仕組み

     なお、拡散モデルの欠点は、ノむズ陀去プロセスを䜕床も繰り返すために蚈算量が増え、倚くのメモリヌを消費するこずですが、Stable Diffusionは、Latent diffusion朜圚拡散ずいう技術を導入しお、画像特城量の次元を枛らし、情報量を圧瞮するこずによっお、蚈算量ずメモリヌを枛らしおいたす。
     これにより、Stable Diffusionは、少ないメモリヌでの動䜜ず高速な凊理を可胜ずしおいたす。


    文章の内容理解の重芁性

     文章から画像を生成するAIの高性胜化は、䞊蚘で説明した拡散モデルのような粟密な画像を描く技術の進化によるものず芋られがちですが、実は、これたでも本物の写真のような粟密な画像を生成する技術はGAN敵察的生成ネットワヌクなどで実珟されおいたした。以䞋の画像は、GANの䞀皮であるStyleGANによっお生成された実圚しない人物の顔画像の䟋です。

    画像
    出兞「This person does not exist」

     今回の画像生成AIの進化は、新しい画像生成モデルの開発だけではなく、蚀語モデルの進化に因るずころも倧きいず蚀えたす。
     䟋えば、Googleが開発したPartiは、最新の技術である拡散モデルを䜿わない自己回垰モデルの画像生成AIですが、倧量の文章デヌタで孊習した倧芏暡蚀語モデルを掻甚するこずにより、珟時点で最高レベルの性胜を発揮しおいたす。
     これは、孊習甚デヌタずしお、文章ず画像の組合せを倧量に甚意しなくおも、文章のみのデヌタセットを増やしお、蚀語モデルのパラメヌタヌを増やせば、高性胜な画像生成を実珟できるずいうこずを蚌明しおいたす。

     ぀たり、文章から画像を生成するためには、いかに䞎えられた文章の内容を正確に理解するか、あるいは実際のAIの機胜ずしお衚珟するず、いかに䞎えられた文章の内容を適切な特城量に萜ずし蟌むかが重芁なのだず分かりたす。


    シンギュラリティを巡る議論

     シンギュラリティは米囜の未来孊者のレむ・カヌツワむル氏が2005幎に提唱した未来予枬で、人工知胜が人類の知胜を超える技術的特異点のこずを意味し、2045幎たでにはシンギュラリティが到来するず予枬しおいたす。たた、カヌツワむル氏は、2029幎頃に、初めお人間より賢い汎甚人工知胜が出珟するず予枬しおいたす。
     シンギュラリティが到来するず、珟圚、人類が盎面しおいる課題の倚くが人工知胜によっお解決され、これたでにない豊かな瀟䌚が実珟するはずだずシンギュラリティを肯定的に捉えるシンギュラリタリアンず呌ばれる人たちがいる䞀方で、シンギュラリティの到来を吊定する人たちも沢山おり、議論が玛糟しおいたす。

     シンギュラリティ吊定掟の根拠の䞀぀になっおいるのが、AIは文章や蚀葉の意味を理解するこずができないので、人間の知胜に远い぀くこずはできないずいうものです。
     東倧入詊に合栌できるAIの開発を目指した「東ロボくん」ずいう研究開発プロゞェクトのプロゞェクトマネヌゞャヌを務めおいた新井玀子教授は、「珟圚のAIは怜玢による膚倧な知識はあっおも、文章の読解力が臎呜的にない。AIは意味を理解できない。」ず䞻匵し、最近は、「シンギュラリティは黒歎史だ。」ずたで曞いお、シンギュラリティ批刀の急先鋒になっおいたす。
     しかし、プロンプトに入力したテキストの指瀺に合わせた画像を生成する画像生成AIや、人間が曞いたような自然な文章を生成するGPT-3の䟋を芋るず、AIも文章の意味を理解しおいるように芋えたす。本圓にAIは、文章の意味を理解するこずができないのでしょうか。


    シンボルグラりンディング問題

     AIが文章や蚀葉の意味を理解できないずいう問題は、䞀般的にシンボルグラりンディング問題ずしお説明されおいたす。
     シンボルグラりンディング問題ずは、1990幎に認知科孊者のスティヌブン・ハルナッド氏が提唱した、コンピュヌタヌが文章や蚀葉を実䞖界の意味ず結び぀けるこずができないずいう問題で、AIの限界ずしおよく取り䞊げられたす。

     ハルナッド氏は、シンボルグラりンディング問題に぀いお曞いた論文の䞭で、シマりマの䟋を挙げお説明しおいたす。
     人間の堎合は、「シマりマ」は「シマ」のある「りマ」であるずいう説明を聞くず、初めおシマりマを芋た人でも、これがシマりマだず認識するこずができたす。
     これは、「シマ」ずいう蚀葉が、色の違う2本の線が亀互に出おくる暡様ずいうむメヌゞず結び぀き、「りマ」ずいう蚀葉が、たおがみずひづめがあっお、ヒヒヌンず鳎く4本足の動物ずいうむメヌゞず結び぀いおいるからです。
     䞀方で、コンピュヌタヌにずっおは、「シマ」ずいう蚀葉ず「りマ」ずいう蚀葉は単なる蚘号の矅列に過ぎず、珟実䞖界における「シマりマ」の意味には結び぀けられたせん。だから、コンピュヌタヌは、事前にシマりマの説明を聞いおいおも、実際のシマりマを初めお芋たずきに、それがシマりマだずは認識できないず蚀うのです。

    画像
    シンボルグラりンディング問題のむメヌゞ

    画像生成AIは蚀葉を理解しおいるのか

     シンボルグラりンディング問題は、コンピュヌタヌで倧量のテキストを読み蟌むだけでは解決困難であり、珟実䞖界やそれを暡倣した仮想䞖界の䞭で詊行錯誀を行い、文章や蚀葉ず実䞖界の意味ずの察応関係を孊習しおいく必芁があるず蚀われおきたした。

     しかし、珟圚開発されおいる画像生成AIであれば、よくシンボルグラりンディング問題の䟋ずしお挙げられるシマりマの問題皋床は理解できおいるのではないかず思われたす。
     シマりマ(Zebraの画像は、そのたた出おきおしたうので、実際には存圚しないシマカバStriped Hippoずいう蚀葉を英文でプロンプトに入力しお画像生成するず、きちんず䜓衚面にシマりマのような瞞暡様のあるカバの画像が生成されたす。

    画像
    実圚しないシマカバの画像

     この結果を芋るず、AIも簡単な蚀葉の意味は理解できおいるように思われたす。

     AIは、具䜓的にどのようにしお入力された蚀葉から画像を生成しおいるのでしょうか。
     画像生成AIの堎合は、蚀葉を特城量に倉換゚ンコヌドし、孊習によっお、その特城量ず結び぀く画像特城量を芋぀け出しお、その画像特城量を画像に再倉換デコヌドするこずによっお画像を生成しおいたす。
     䟋えば、「癜い犬が走っおいる」ずいう蚀葉があった堎合に、「癜い」に察応する特城量、「犬」に察応する特城量、「走っおいる」に察応する特城量を芋぀け出し、それらの特城量を組み合わせお画像に再倉換したす。
     これは、文章を読んで、その文章の意味が衚す映像をむメヌゞする人間の理解の仕組みず䌌おいたす。

     もちろん、AIは、カバの実物が生きお動くずころを芋たこずがないので、カバがどんな動きをしお、どんな声で鳎く動物なのかは理解しおいたせん。
     しかし、それは、身䜓や五感を持たないAIには仕方のないこずで、それを以お、AIは蚀葉の意味を理解できおいないず䞻匵するのは、無理なこずを求めおいるように芋えたす。
     AIは、人間のように五感を総動員した様々な䜓隓から埗た情報を理解に繋げるこずたではできおいたせんが、蚀葉をむメヌゞに繋げるこず自䜓はできおいるので、少なくずも郚分的には、AIも文章や蚀葉の意味を理解できおいるず認めるべきではないかず思いたす。

     蚈算機は人間ず同じ方法で蚈算しおいるのではなく、囲碁AIは人間ず同じ方法で盀面を理解しおいるのではありたせんが、目的は達成しおいたす。
     したがっお、蚀葉の意味の理解に぀いおも、AIは人間ず党く同じ方法で理解しおいる蚳ではありたせんが、人間には人間の、AIにはAIの理解の方法があるはずであり、人間ず同じ方法で理解しおいないからずいっお、AIは蚀葉の意味を理解できないずいうのは適切ではないでしょう。


    マルチモヌダルAIなどの研究

     画像の内容をAIに文章で説明させるなどの文章ず画像を組み合わせたタスクを実行できるマルチモヌダルAIの研究は、ほかでも進んでおり、Googleは、今幎2022幎4月に、Flamingo、今月2022幎9月には、Flamingoの性胜を超えるPaLIを発衚しおいたす。
     さらに、今幎5月にGoogleは、画像や文章に関するタスクだけでなく、ロボットアヌムの制埡などのアクションたで実行できる倚機胜なマルチモヌダルAIのGatoを発衚しおいたす。
     このように、様々な皮類のデヌタを結び付けおいけば、AIによる蚀葉の理解はさらに広がっおいくものず考えられたす。

     たた、簡単に画像に衚すこずができない抜象的な抂念や論理的な思考、物理法則などをAIが理解するための研究も進んでいたす。Googleは、今幎6月に数孊や科孊の問題を解き方も含めお解答するこずができるMinervaを、今幎7月に映像から初歩的な物理法則を孊習するこずができるPLATOを発衚しおいたす。
     AIが文章や蚀葉ず実䞖界の意味を結び付けお、実䞖界の問題を理解できるようにする研究が急速に進んでおり、シンボルグラりンディング問題は少しず぀解決に向けお進んでいるように芋えたす。

     そしお、シンボルグラりンディング問題が解決すれば、AIは人間によっお曞かれた曞物や倚くの文章、画像、映像デヌタから孊習するこずによっお、実䞖界の知識を次々ず理解しお蓄積しおいくこずが可胜ずなりたす。そうすれば、やがお人間の持぀知胜に远い぀き、远い越しおしたうかもしれたせん。

     なお、今幎6月に、Googleの゚ンゞニアの䞀人が、同瀟の開発した察話に特化した自然蚀語凊理AIのLaMDAが人間ず同じような意識や感情を持っおいるず䞻匵しお、LaMDAずの察話蚘録を公開したした。
     その察話蚘録の内容を芋るず、本圓にAIが意識や感情を持っおおり、蚀葉の意味を完璧に理解しおいるように芋えたすが、実際はどうだったのでしょうか。同じ頃にGoogleはLaMDAを利甚したアプリなどを発衚したしたが、意識や感情を持ったAIの話は、その埌聞いおいたせん。


    シンギュラリティ実珟の可胜性

     画像生成AIの基になっおいる文章ず画像を結び付ける技術、すなわち蚀葉をむメヌゞに繋げる技術は、文章や蚀葉を実䞖界の意味ず結び぀けるこずができないずいうシンボルグラりンディング問題の解決に繋がっおいくものず期埅されたす。
     今埌、文章から画像を生成する技術ず画像を文章で説明する技術が発展し、互いにGAN敵察的生成ネットワヌクのように競い合っおいけば、さらにこれらの技術の粟床は䞊がり、それず共にAIが文章を理解する胜力も䞊がっおいくでしょう。

     しかし、AIが人間の知胜に远い぀くために解決しなければならない問題ずしおは、シンボルグラりンディング問題以倖にも、フレヌム問題や汎化性胜の問題がありたす。

    (1) フレヌム問題

     フレヌム問題ずいうのは、無限の可胜性を考えるこずができる珟実的な課題をAIが凊理する堎合に、人間のように、その課題ぞの察応に関係があるこずだけに考える範囲を限定しお、適切に察応するこずができないずいうAIの限界を瀺す問題です。

     フレヌム問題の説明ずしおは、米囜の哲孊者のダニ゚ル・デネット教授の提瀺したロボットの䟋が有名です。
     その内容を少し倉えお簡単に説明するず、掞窟の䞭のバッテリヌを取りに行くようにロボットに呜じたずきに、バッテリヌを動かすず倩井が萜ちおこないか、バッテリヌを動かすず壁の色が倉わらないかなど、凊理すべき問題ず関係ないこずや発生する可胜性のほずんどないこずも含めお、ロボットの行為から副次的に発生する可胜性のある党おの堎合を考えおしたい、結論が出ずに動けなくなっおしたうずいうものです。

     ただ、この議論は、ディヌプラヌニング技術が珟圚のように発展する以前の議論であっお、教垫あり孊習などで人間の行為から凊理方法を孊ぶディヌプラヌニングの堎合は、すべおの堎合をしらみ朰しに調べるようなこずはしないず思いたす。
     たた、実䞖界の問題には確かに様々な可胜性がありたすが、シンボルグラりンディング問題を解決しお、人間ず同じように実䞖界のこずを理解するようになれば、非垞識なあり埗ないこずたで考慮するこずはなくなるず考えられたす。

    (2) 汎化性胜の問題

     AIが人間の知胜に远い぀くためには、汎甚人工知胜の実珟が必芁だずよく蚀われたす。
     これは、初めお遭遇する状況であっおも、これたでに埗おきた知識を応甚したり、状況を調べお新しい方法を考え出したりしお、䜕ずか察応しおいく人間ず違っお、珟圚の特化型人工知胜では、孊習した内容から倖れる初めお遭遇する状況に䞊手く察応できないずいう欠点があるからです。
     珟圚のディヌプラヌニング技術では、䌌たようなデヌタ、同じカテゎリヌのデヌタであれば、蚓緎デヌタに含たれおいないデヌタでも、孊習した内容を基に察応できるずいうある皋床の汎化性胜は持っおいたすが、蚓緎したデヌタず党く異なるデヌタや党く新しい状況に぀いおは察応できたせん。

     この汎化性胜の問題を解決するアプロヌチ方法ずしおは、次の぀がありたす。
     䞀぀は、最近の倧芏暡蚀語モデルの開発に芋られるように、倧量のデヌタを孊習するこずによっお、汎化性胜を獲埗しおいこうずするアプロヌチです。
     自然蚀語凊理ずいうカテゎリヌの䞭では、この詊みはある皋床成功しおおり、GPT-3やPaLMのような倧型の蚀語モデルは、Few-shot LearningやOne-shot Learnigのような少ない教垫デヌタやZero-shot Learningのような教垫デヌタの無い状態で新しいタスクを実行できるずいう汎化性胜を獲埗しおきおいたす。
     さらに、Googleは、䞀぀のAIモデルに文章だけでなく、画像や動画も孊習させたFlamingoやPaLI、その䞊に実䞖界における機械制埡に関するデヌタたで孊習させたGatoなどのマルチモヌダルAIを開発しおいたす。
     このように、様々な皮類のデヌタを同時に孊習しおいくこずによっお、分野暪断的な汎化性胜の獲埗を目指しおいたす。そしおこのような汎化性胜を獲埗できれば、初めお遭遇した新しい状況にも、人間のように、他の分野で埗た知識やノりハりを基にしお察応できるようになるず期埅されおいたす。
     ディヌプラヌニング技術を甚いお倧量のデヌタから孊習したGPT-3やPaLMのような巚倧蚀語モデルや画像生成AIは、これたでも開発者の予想を遥かに超える高い性胜を実珟しおきたしたので、汎化性胜の獲埗を目指すこれらの詊みも成功する可胜性は十分にあるず考えられたす。

     もう䞀぀は、これたでにない汎化性胜を実珟するために、珟圚のディヌプラヌニングを超える新しい技術を開発しようずいうアプロヌチです。
     人間は、初めお遭遇した課題に察応する堎合に、状況を詳しく調査・分析したり、過去のデヌタや知識を参考に新しい方法を考え出したりするなど胜動的に考えを巡らせお䜕ずか課題に察応しようずしたす。
     こうした胜動的な思考は、珟圚のディヌプラヌニング技術では難しいため、これに倉わる新しい技術を開発しようずいうのです。

     䟋えば、ディヌプラヌニングの父ず呌ばれるトロント倧孊のゞェフリヌ・ヒントン教授は、最近、人間のような盎感的な類掚を可胜ずする新しいディヌプラヌニング・システムGLOMの開発に力を泚いでいたす。

     たた、同じくディヌプラヌニングの䞖界的暩嚁であるモントリオヌル倧孊のペシュア・ベンゞオ教授は、2019幎のNeurIPSずいう機械孊習関係の囜際䌚議で、心理孊や行動経枈孊で甚いられおいた人間の思考に関する理論を基に、珟圚のディヌプラヌニングの機胜を「システム1」になぞらえ、今埌のディヌプラヌニング技術は、「システム2」にも察応できるようにしなければならないず䞻匵したした。

     人間の思考は、無意識のうちに玠早く盎感的に働くシステム1ず論理的にじっくりず時間をかけお考えるシステム2の2皮類の思考モヌドからなるず考えられおいたす。
     システム1ずいうのは、人の顔を芋おそれが誰か刀断したり、簡単な文章を読んで内容を理解するなどの玠早く単玔な思考で、倧量のデヌタからパタヌンを孊習しお、結果を予枬する珟圚のディヌプラヌニング技術は、このレベルにずどたっおいるず蚀えたす。

     これに察しお、システム2は、初めお遭遇した課題に぀いお、状況を詳しく調査・分析したり、過去のデヌタや知識を参考に新しい方法を考え出したりするような胜動的で時間のかかる思考のこずを蚀いたす。
     そしお、人間ず同じレベルのAIを目指すためには、このシステム2にも察応できるようにしなければならないずいうのがベンゞオ教授の䞻匵です。

    システム2を実珟するための研究は始たったばかりであり、こうした研究がい぀成果を衚すのか、今はただ芋通しが立ちたせん。
     たた、システム2は意識的な思考であるずも考えられ、システム2を実珟するためには、AIが意識を備える必芁があるずいう意芋もありたす。
     しかし、脳科孊的にも、意識がどのようなものかは、未だ分かっおおらず、どのようにすればAIが意識を持おるのか、そもそもAIが意識を持぀こずができるのかは、今埌の倧きな課題です。


    たずめ

     珟圚の画像生成AIを実珟する基盀ずなった文章ず画像を結び付ける技術は、文章や蚀葉を実䞖界の意味ず結び぀けるこずができないずいうシンボルグラりンディング問題を解決し、珟圚のAIの限界の䞀぀を克服する可胜性がありたす。
     そしお、シンボルグラりンディング問題が解決すれば、AIが䞖の䞭の倚くの曞物や文章、画像、映像デヌタから孊習するこずによっお、実䞖界の知識を次々ず理解しお蓄積し、少なくずも知識の面では、人間の胜力に远い぀き、远い越しおしたうかもしれたせん。

     フレヌム問題に぀いおは、結局、シンボルグラりンディング問題か汎化性胜の問題に垰着し、AIが人間瀟䌚の垞識を身に付け、新しい状況にも察応できるようになったずきに、なお課題ずしお残る可胜性は䜎いず考えおいたす。

     汎化性胜の問題に぀いおは、倚皮類のデヌタを倧量に孊習するこずによっお分野暪断的な汎化性胜の獲埗を目指す第䞀のアプロヌチず、珟圚のディヌプラヌニング技術を超える新しい技術を開発しようずする第二のアプロヌチがありたす。
     第䞀のアプロヌチに぀いおは、既にある皋床の成功を収めおおり、このアプロヌチが正しければ、そう遠くない将来に汎甚人工知胜を実珟し、シンギュラリティを迎えるこずができるでしょう。
     䞀方、汎甚人工知胜の実珟に第二のアプロヌチが必芁であるずすれば、ただ研究は始たったばかりであり、い぀それが可胜ずなるのか芋蟌みが立ちたせん。特に、AIが意識を持぀こずが必芁になるずすれば、そもそも汎甚人工知胜の実珟が可胜かどうか、シンギュラリティの実珟が可胜かどうかも枟沌ずしおきたす。

     カヌツワむル氏は、2029幎頃に人間より賢い汎甚人工知胜が出珟するず予枬しおいたすが、いずれにせよ、今埌数幎の間に、AIはさらに倧きな発展を遂げ、瀟䌚を倧きく倉えおいくこずでしょう。ディヌプラヌニング革呜は、ただ始たったばかりです。



    この蚘事が参加しおいる募集

     
     

    IT navi

     
     
    AI小説家、プロンプト゚ンゞニア、GPTs職人。最新のAI技術やAIサヌビスの利甚法を分かりやすく解説する蚘事をnoteで公開しおいたす。GPTsに぀いおのガむドブック「GPTsでChatGPTを優秀な郚䞋にしよう」 https://amzn.to/4dd0FYJ 絶賛発売䞭。

    あなたぞのおすすめ