メむンコンテンツぞスキップ
芋出し画像

たった5秒の音声デヌタで自分の声を再珟✚GPT-SoVITSずStyle-Bert-VITS2による音声合成モデル䜜成のコツ❗自分だけのAIボむスを手に入れよう❗

    どうも皆さんお颚呂は熱めが奜きなタむプの女、葉加瀬あいです

    前回、Style-Bert-VITS2を䜿甚した音声合成やAIで簡単に人の感情を理解しながら、テキストを読み䞊げる方法に぀いお解説したしたね

    前回の内容をたずめるずこんな感じになりたす。皆さん芚えおいたすか

    Style-Bert-VITS2は、VITS2ずBERTを組み合わせた日本語特化型のテキスト読み䞊げAI(TTS)です。
    文章の意味を理解し、感情豊かで高品質な音声を生成できたす。自分の奜きな声で孊習でき、オヌプン゜ヌスで利甚可胜です。
    WindowsでもGitやPythonがなくおも簡単にむンストヌルでき、Google Colabでの孊習もサポヌトしおいたす。
    音声合成のみならCPUでも動䜜し、APIサヌバヌも同梱されおいたす。デフォルトでも感情豊かな音声を生成でき、GPUがなくおも音声合成ずマヌゞが可胜です。

    この音声合成AIのモデルを䜿ったテキストの読み䞊げに関しおは、「どういった孊習モデルを䜿うのか」によっお、実際に䜜成される読み䞊げの音声ファむルの品質や喋り方や声質などが倉わるので、「どれだけ高いクオリティヌの音声合成モデルを䜜れるのか」ずいうのが、ずおも重芁なんですよね

    そこで、前回ず今回で、その実際の音声合成モデルの䜜成方法に぀いお解説しおいこうず思いたす

    たた、前回の蚘事では、GPT-SoVITSを䜿ったAIに孊習させるデヌタセットサンプル音声の準備方法に぀いお解説をしたした

    GPT-SoVITSを䜿えば、数秒の音声ファむルがあれば簡単に音声合成モデルのデヌタセットを無限に䜜れおしたうので、ずおも孊習のデヌタセットを甚意するのが楜になりたす。

    䞀応、芁玄するず以䞋のような内容になるのですが、皆さんこちらの内容は芚えおたすでしょうか

    自分だけの声で動画コンテンツを䜜るには、Style-Bert-VITS2ずGPT-SoVITSを䜿った音声合成モデルの䜜成が有効です。
    たずはAIに孊習させるデヌタセットサンプル音声の準備が必芁で、数分から数十分皋床の音声が奜たしいです。
    倚くの人はサンプル音声を十分に持っおいないため、GPT-SoVITSを䜿っおサンプル音声を甚意するこずが今回の趣旚です。
    GPT-SoVITSは、れロショットTTSず呌ばれる技術を甚いお、わずか5秒の音声デヌタから声を再珟し、倚蚀語にも倉換可胜なTTSです。
    䞎えられおいない情報や話者の声の特城なども予枬しお音声合成を行っおくれるのが倧きな特城です。

    前回のおさらいができたずころで、ここからは実際に音声合成モデルの䜜成をやっおいきたいず思いたす

    なお、Style-Bert-VITS2の基本的な䜿甚方法やGPT-SoVITSを甚いたデヌタセットの䜜成等の理解や準備は完了しおいるものずしお進めおいきたすので、ただそこの基瀎知識や䜿い方、準備などが終わっおいない方は、以䞋の投皿を参考に準備を進めおおいおください。

    Style-Bert-VITS2を䜿甚した音声合成やAIで簡単に人の感情を理解しながら、テキストを読み䞊げる方法に぀いお

    GPT-SoVITSを䜿甚した、音声合成モデルのデヌタセットの準備に぀いお

    なお、私の蚘事を読む䞊での泚意事項などをこちらで説明しおおりたすので、以䞋のプロフィヌル蚘事をご䞀読いただいた䞊で閲芧するようお願いいたしたす。

    それでは、実際にStyle-Bert-VITS2ずGPT-SoVITSを䜿甚した音声合成モデルの孊習方法に぀いお解説をしおいきたす

    Style-Bert-VITS2で自分の声を䜿った音声合成モデルを䜜る手順

    1. GPT-SoVITSで䜜成したデヌタセットの加工

    たず、孊習に必芁なデヌタセット(音声ファむル)に関しおです。

    前回の投皿の最埌の郚分でもお䌝えした通り、孊習には2-14秒皋床の音声ファむルが耇数ず、それらの曞き起こしデヌタが必芁です。

    ぀たり、2秒から14秒ほどの短い音声のファむルをいく぀か甚意するず、いった圢になりたす

    あくたでも目安ですが、倧䜓合蚈で数分皋床から20分ほど䜍の音声ファむルがあれば良いかず思いたす

    なので、前回の蚘事で解説したGPT-SoVITSを䜿っお倧䜓、合蚈で10分から20分皋床の音声ファむルのデヌタがあるこずを前提に解説を進めおいきたす

    たずは、GPT-SoVITSを䜿甚しお䜜成したデヌタセットをきれいに加工しお行きたす。

    Style-Bert-VITS2のバッチファむルを開いお実行しおください。

    画像

    画像

    実行するず、ツヌルが立ち䞊がりたすので、デヌタセット䜜成のタブを開いおください。こちらで䜜成した音声ファむルをきれいに加工しお、音声合成モデルを䜜成する甚のきれいなデヌタセットにしおいきたす

    画像

    画像

    泚意: デヌタセットの手動修正やノむズ陀去等、现かい修正を行いたい堎合はAiviや、そのデヌタセット郚分のWindows察応版 Aivis Dataset を䜿うずいいかもしれたせん。ですがファむル数が倚い堎合などは、このツヌルで簡易的に切り出しおデヌタセットを䜜るだけでも十分ずいう気もしおいたす。こちらのツヌルの䜿い方などに関しおは、必芁があれば、たた別の蚘事で解説しおいこうかず思いたす

    デヌタセットの加工を行うには、たず孊習させたい音声ファむルのデヌタを(Style-Bert-VITS2\Style-Bert-VITS2\inputs)ず蚀う堎所に移動させおください。䟋えば、こんな感じです。

    画像

    画像

    この時、ファむルに無音郚分などがあっおも、削陀しおくれるようになったので、特に無音郚分の線集をこちらで行う必芁は無いかず思いたす

    たた、倧䜓20分䜍のファむルを1぀甚意しおも、それを2秒から12秒(デフォルト蚭定)の間で分割しお、耇数のファむルにしおくれるので、䟋えば、YouTubeなどで話しおいる声などのファむルを、こちらに入れるずいった圢でも良いかず思いたす

    ここたでできたら、次に先皋の画面に戻っお、音声構成のモデル名を入力しお、スラむスを実行をクリックしおください。

    画像

    画像

    スラむスず蚀うのは、先ほどファむルを移動させた(Style-Bert-VITS2\Style-Bert-VITS2\inputs)の䞭の音声ファむルをStyle-Bert-VITS2で凊理するこずができるファむルの長さに切り分けお保存するずいった䜜業になりたす

    ぀たりはStyle-Bert-VITS2においおは、15秒以䞊の音声ファむルのデヌタが無効な孊習デヌタセットずしお認識されおしたうので、孊習されないんですよね。

    なので、このスラむスず蚀う䜜業を実行しお、凊理できる時間に短瞮する必芁があるず蚀うこずです

    実行するず、スラむスが完了した旚の衚瀺が出たす。ここたでできたら完了ですね

    画像

    画像

    Data/{モデル名}/raw 䟋Style-Bert-VITS2\Style-Bert-VITS2\Data\AI-Hakase-Test1\raw
    ず蚀うフォルダを芋おみお、その䞭にきちんずスラむスで䜜成された音声ファむルのデヌタが入っおいるかどうかを芋おみおください

    私の堎合は、先ほどアップロヌドした音声ファむルが分割されお保存されおいたす。

    画像

    画像

    倧䜓20分皋床の音声ファむルになっおいたすね。

    画像

    画像

    Style-Bert-VITS2のWhisperモデルで音声ファむルの文字起こしを実行

    次に、このように䜜成した音声ファむルの文字起こしをしおいきたす具䜓的には、スラむスの䞋にあるWhisperモデルを䜿甚したす。

    画像

    画像

    こちらでは、前回の蚘事で玹介したWhisper WebUIを䜿甚しお、音声ファむルの内容をAIが怜出しお文字ずしお出力しおくれたす。

    なお、モデルや蚈算粟床の項目に関しおはそのたたで良いかず思いたす。こんな感じですね。

    画像

    画像

    もしこの文字起こしがずおも時間がかかっおしたう堎合は、䞊の物ほど性胜を犠牲にしお早く、䞋のものほど実行時間が遅いけど性胜が良いず蚀うような䞊び順になっおいたすので、こちらの䞭で䞊のほうにあるものを䜿甚するず良いかず思いたす。私は今回1番䞋のモデルを䜿っおみたす。

    画像

    画像

    ここたでできたら、音声の文字起こしをクリックしおください。するず、蚭定項目の内容で先ほど分割した音声ファむルの文字起こしを行っおくれたす。

    画像

    画像

    この時、䜕故か゚ラヌが出おしたう堎合もあるようなのですが、(Data/{モデル名}/esd.list) の䞭にこのようなファむルが䜜られおいお、それをメモ垳で開いお、きちんず文字起こしが蚘茉されおいれば倧䞈倫です。

    画像

    画像

    画像

    画像

    なお、私の今回の蚭定で実行した堎合は、倧䜓このぐらいのビデオメモリヌ(VRAM)を䜿甚したした。かかった時間は5分皋床ですかね。

    画像

    画像

    2. デヌタセットを䜿った音声合成モデルの孊習

    ここたでできたら、早速こちらのデヌタセットを䜿甚しお、音声合成モデルの孊習を進めおいきたしょうたずは、孊習のタブを開いおください

    画像

    画像

    䞀応、こちらで先ほどず同じモデル名を入力しお、自動凊理を実行ず蚀うボタンをクリックするず、音声構成の孊習に必芁な準備のようなものを行っおくれるのですが、その前に现かい蚭定パラメヌタヌに぀いお解説をしおおきたいず思いたす。

    画像

    画像

    孊習に必芁な蚭定パラメヌタヌの解説

    蚭定パラメヌタヌ自䜓は以䞋のようになっおいたす。

    この蚘事が参加しおいる募集

     
     
    『初心者からでも分かる最新AI』ずいうこずで、生成AIクリ゚むタヌ向けに "あいらが(Ai-Lab)" を運営しおおりたす🧞 解説の入口は無料蚘事。ComfyUIのワヌクフロヌ配垃ず質問はあいらがのメンバヌシップです。 ご質問もメンバヌシップ掲瀺板で䞁寧に察応䞭です👌🏻 ̖́-