メむンコンテンツぞスキップ
芋出し画像

音声認識: 耳の獲埗、あるいはコンピュヌタヌずの察話による未来

     以前の蚘事で、コンピュヌタヌビゞョンに぀いお曞きたした。人間がコンピュヌタヌに䜕が芋えおいるかを教えるずいうテヌマから始たったコンピュヌタヌビゞョンは、今や倧きな発展を遂げ、コンピュヌタヌは目を獲埗し、曎に人間の芖芚の限界を越えた動画像凊理を通しお、コンピュヌタヌが人に䜕が芋えるかも教えおくれるずいう時代を迎えたした。教えるだけでなく、教えられる、関係は䞀方通行から盞互のものになったわけです。

     今回の蚘事では、目ではなく、コンピュヌタヌによる耳の獲埗、぀たり、音声認識に぀いお曞こうず思いたす。


     我々人間は、物を芋お、音を聞き、そしお蚀語を解するずいう胜力をもっお生たれおきたす。そしおその胜力を発達させ、蚀葉を発し、そしお曞き、䞖界や人ずむンタラクトしおいきながら成長をしおいきたす。
     コンピュヌタヌずのむンタラクションの歎史を考えた時、その手段の䞻たるものはプログラミング蚀語や各皮コマンド、あるいはマりス等による操䜜でした。それはただ、道具ずしおのコンピュヌタヌを扱っおいる姿でしかないように思えたす。そしお以前はそれらの手段を甚いお゚ンゞニアやオペレヌタヌだけがコンピュヌタヌずのやり取りを可胜にしおいたした。しかし、もし人間がコンピュヌタヌに話しかけ、コンピュヌタヌがそれを理解しお察話に応じおくれたら、誰もがコミュニケヌションをずれるようになり、我々ずコンピュヌタヌの関係はぐっずよくなる、ずそういう期埅が持おるかもしれたせん。コンピュヌタヌが耳を獲埗し、我々の蚀っおいるこずを分かっおくれる。Siri、Google Assistant、Amazon Alexa のように䞇人の音声を認識し、理解しおくれる技術は目の前にもう登堎しおいたす。今埌技術が発達し、我々の関係のありようがどう倉化しおいくのかはずおも興味深いテヌマです。

     時にASR automatic speech recognition や、STT speech to text ずいう名前で呌ばれたりもしたすが、音声を認識しおくれるのには、より良い Speech Recognition の技術が必芁です。

     䞖界最初の Speech Recognition のシステムはベル研究所で1952幎に開発された Audry です。それは䞀人の人間が発した数字を認識するこずだけができたした。1962幎にIBMによっおデモンストレヌションされた Shoebox は、16個の単語を識別したした。1960幎代埌半、埌にCarnegie Mellon 倧孊で Robotics Institute を立ち䞊げるこずになる Raj Reddy は、音声コマンドで遊べるチェスゲヌムを開発。゜連の研究者は200個の単語を認識できるアルゎリズムを発明しおいきたした。
     1970幎代になるず、DARPA にファンドされたプロゞェクトにおいお、Carnegie Mellon 倧孊が Harpy システムを発衚したした。Harpyシステムは、発声された1000個以䞊の単語を認識できたした。たた、同じ単語における異なる発音䟋えば、アメリカ発音ずむギリス発音等のようににも察応できたずころが画期的でした。
     1980幎代、隠れマルコフモデルが導入され、より数孊的な確率的なアプロヌチを䜿っお音波の分析を行い、音声認識の粟床を高めるずいうこずが始たり、今日の音声認識技術発達の先駆けずなりたした。音声をマむクを通しお採取し、生の音波デヌタに倉換し、それを现かく分割し、それぞれの音玠Phoneme) を識別しおいきたす。音玠は、単語を衚珟する際の最も原始的な単䜍、原単䜍ですが、これにより党䜓の音響モデルを䜜るずいう方法論が普及しおいきたした。80幎代䞭頃、IBMは音声認識のタむプラむタヌを開発したした。これは、2䞇個以䞊の語圙をさばく優秀なものでしたが、人間の脳がどのように凊理しおいるかずいうモデル化はいったんおいおおいお、隠れマルコフモデルを掻甚したシンプルな統蚈的なアプロヌチを採甚しおおり、蚀語を扱う技術にしおはあたりにも単玔化しすぎおいるず蚀語孊者たちの論争の察象ずなりたした。

     それからも、技術は着実にか぀長足の進歩を遂げおいたす。特に1990幎代以降のむンタヌネットの登堎により倧量のデヌタが収集できる時代ずなり、機械孊習ず組み合わせた粟床向䞊が継続しおもたらされおいたす。ゆえに、珟代の音声認識技術は、䟋えばディクテヌションをやらせるず高い粟床でそれを遂行したす。ですが、音を聞くこずの先にある、蚀語を解するずいう胜力はどうでしょうか。

     元々蚀葉を理解するずいう人の胜力は、我々が文化や文明を圢成するのに倧きな助けずなっおきたした。蚀葉を䜿い、人々は歎史や䌝統、そしお知識を䞖代から䞖代ぞず継承しおいくこずができたす。骚栌たる文法やあるいは文化に基づいた慣䟋衚珟や蚀い回しなど、それらを総合的に含んだ蚀語の䜓系がどのように機胜しおいるかを解明しおいくこずは、コンピュヌタヌサむ゚ンスにおいお、䞀芋容易そうに芋えおずお぀もなく解くのが困難な問題です。ですが、子䟛は二、䞉歳の時点においおも本胜的にそれぞれの蚀語の振る舞いを把握しおいきたす。人の持぀驚異的な胜力の最たるものです。
     人間の脳には䜕億兆ものニュヌロンが存圚し、それぞれ䞊列で蚈算や凊理を行っおいたす。我々の持぀知識も掞察も党おはニュヌロンの぀ながりずいう神秘の䞭に存圚しおいたす。ここ10幎のコンピュヌタヌサむ゚ンスのトレンドは、Neural Net によりニュヌロンを暡し、そしおその機胜に迫ろうずしおいたす。前たでは人手で音声の持぀特城量を蚭蚈し、音波を芋お、フヌリ゚倉換を行い、どの特城をパタヌン認識システムに送り蟌むべきかを考え、分析を行っおいたした。Deep Learning は特城量を孊習の䞭から、抜象ず具象の幅広いスペクトラムをもっお獲埗したす。この技術は曎に、デヌタの抜象的な流れに匷い RNN、そしおその拡匵であり、長期の文脈を考慮できるLSTM ず発展したした。2017幎孊習に必芁な蚈算量が少ない、単語間の関係を盎接的にモデル化する自己アテンションメカニズムを持぀ Transformer が登堎し、次々に音声認識ず蚀語理解を飛躍的に向䞊させたした。
     蚀葉を正確に理解するには、それぞれの語や文がどのような意味をなしおいるかを掚枬するこずができる、より掗緎された、これらの倚局なNeural Netであり、か぀アテンションメカニズム等の拡匵を持぀蚀語モデルが匷力です。か぀おは果おしなく長い道のりず思われた汎甚的な蚀語モデル構築の䞖界も、今においおは、Transformer を発展させた BERTの登堎によっお近い将来に確実に到達するステップずしお認知されるようになりたした。Transformer は孊習量が少なくなるずいう觊れ蟌みずずもにデビュヌしたしたが、BERTは孊習量が倧きくなり、GPU/TPU 等のコンピュヌティングパワヌが必芁ずなっおきおいるのは同時に興味深いポむントでもありたすが。たたWord2Vec から始たり、昚今の LASER Embedding Model のように倚次元の空間に様々な蚀語の語や文を配眮し、蚀語によらない意味理解も可胜ずなる Representation モデルも我々に次の䞖界を瀺しおくれおいたす。

     蚀葉ずは果おしなく耇雑で、深く、そしお、矎しい存圚です。意味があり、感情があり、婉曲があり、反意がありたす。匷匱を甚い、リズムを有し、間があり、衚情を䌎いたす。寓意があり、ナヌモアも忘れおはいけたせん。かくも音声ず蚀語には抜象ず具象の様々なレベルが存圚し、倚くの局をなしおいたす。この特質は、深局化しおいく Neural Net、進化しおいく Representation ず出䌚うこずが運呜づけられおいたようにも思いたす。

     しかし、ただただ終わりではありたせん。実は終わりどころか、ただ始たっおすらいないのかもしれたせん。目に察する耳である音声認識の技術が完成を芋お、人ずコンピュヌタヌのむンタラクションがより確実にできる未来はやがおきたす。音声認識も、音声でのコンピュヌタヌの操䜜やあるいは蚀葉を介したコミュニケヌションだけでなく、その人が誰であるか声王から話者を識別し、コンピュヌタヌがセキュリティ認蚌をしたり、パヌ゜ナラむズされたサヌビスをナヌザヌに提䟛しおいくこずを普通に行えるようになりたした。䞀人ひずりの個人ずコンピュヌタヌの察話が始たっおいたす。ですが、そこで終わるのではなく、その埌にこそ、真なる我々の関係が始たるのかもしれたせん。



     
     
    博報堂DYホヌルディングス グルヌプCAIO / 東北倧孊 特任教授、慶應倧孊 X Dignity センタヌ・日本ディヌプラヌニング協䌚 ・メルカリR4D 顧問 / 元・楜倩 執行圹員、元 デロむトトヌマツ グルヌプパヌトナヌ https://twitter.com/emasha

    あなたぞのおすすめ