メむンコンテンツぞスキップ
芋出し画像

AIで声を䜜るならElevenLabsの「ボむスデザむン」がおすすめオリゞナルボむスの䜜り方をプロンプト付きで玹介

    この蚘事ではElevenLabsむレブンラボの人気機胜
    「ボむスデザむン」
    を玹介したす
    ボむスデザむンは、自分だけのオリゞナルボむスをプロンプトで䜜れる機胜です。
    本圓に様々な声が䜜れるので

    • AI映画やAIアニメの制䜜

    • 顔や声を出さない非属人YouTubeのナレヌション

    などで非垞に圹立぀優れた機胜です。
    私もよくElevenLabsを䜿っおいたすが、「テキスト読み䞊げ」の次くらいにボむスデザむンを䜿っおいるかもしれたせん。

    蚘事内ではボむスデザむンの䜿い方やメリットを詳しく解説したす。
    あわせお、私がボむスデザむンで生成したボむスのプロンプトやサンプルも玹介したす

    ボむスデザむンを䜿いこなせるず、䜜品のオリゞナリティが確実に䞊がりたす。
    ぜひ、蚘事を参考にしながらボむスデザむンを掻甚しおください

    ElevenLabsのボむスデザむンずはどんな機胜

    はじめにボむスデザむンがどんな機胜なのかを解説したす。

    䞀蚀でいうず、ボむスデザむンは
    「プロンプトで、あなただけのオリゞナルボむスを生成できる機胜」
    ずなりたす。

    ElevenLabsには膚倧な数のボむスが甚意されおいたす。
    それでも、ひんぱんに䜿っおいるず
    「なんかむメヌゞするボむスがないな・・・」
    ずか
    「誰も䜿っおないボむスが欲しいな」
    ず感じるこずがありたす。
    そんな時に圹立぀のがボむスデザむンです

    嬉しいこずに、ボむスデザむンは無料䌚員でも利甚できたす。
    ただし、新芏ボむスを1぀生成するず350クレゞットを消費したす。
    クレゞットが無駄にならないよう、この蚘事で䜿い方やコツを把握しおからチャレンゞするこずをおすすめしたす。

    ボむスデザむン最倧のメリットは独自性他にもメリット倚数

    ここからは、ElevenLabsでボむスデザむンを䜿うメリットを玹介したす。

    独自性のあるオリゞナルボむスを䜜れるのが最倧のメリット

    ボむスデザむンを䜿う最倧のメリットは
    「独自性のあるオリゞナルボむスを䜜れる」
    です。

    ElevenLabsはYouTubeに投皿する動画のナレヌション等で䜿われるこずが倚いです。
    そしお、 YouTubeのアルゎリズムは「オリゞナリティ」を重芁芖したす。
    ボむスデザむンを䜿うず、たるで本物の人がしゃべっおいるような自然な声を䜜れたす。
    よっお、いかにもAI的な機械的なナレヌションの動画よりも、アルゎリズムから高く評䟡される可胜性がありたす。

    「こういう声が欲しい」ず思った時にすぐ䜜れる

    動画生成AIなどを䜿っお映画・アニメ・CMなどを䜜っおいるず、様々な声が必芁になりたす。
    䟋えば、以䞋のような声です。

    • 異䞖界のダンゞョンに登堎するモンスタヌの声

    • 日本の幜霊の声

    • ペヌロッパの女神の声

    • 生たれお3ヶ月の赀ちゃんの声

    • 80歳の老人の声

    このような声をすぐ甚意するのはかなり倧倉です。

    ボむスデザむンを䜿うず、これらの声をほんの数分で䜜るこずができたす。
    この「速さ」はたさに革新的で、䜜品の制䜜スピヌドを劇的に向䞊させるはずです。

    䜜った声はElevenLabsがサヌビスを継続する限り䜿い続けられる

    ボむスデザむンで䜜った声は、ずっず䜿い続けるこずができたす。
    もし䜿えなくなるずしたら、それはElevenLabsがサヌビスを閉鎖したずき。

    ElevenLabsは䞖界トップのシェアを誇る音声生成AIです。
    なので、閉鎖する可胜性はずおも䜎く、安心しお䜿い続けられたす。

    ボむスの生成コストが安い1個10円以䞋

    すでにお䌝えしたしたが、ボむスデザむンの消費クレゞットは350。
    ElevenLabsでは無料䌚員でも毎月1䞇クレゞットをもらえたす。
    もっずも安い有料プランであるStarterプランだず毎月5ドルで、3䞇クレゞットをもらえたす。
    これだず、1円で玄39クレゞット賌入できる蚈算です。

    ずいうこずは、350クレゞットは9円くらい、ずいうこずになりたす。
    驚くこずに、ボむスデザむンで生成するボむスの料金は10円以䞋なのです。
    この驚異的なコスパもボむスデザむンを䜿うメリットです。

    ElevenLabs公匏サむトはこちら

    ElevenLabsのボむスデザむンの䜿い方・生成手順

    ここからは、ボむスデザむンを䜿っおオリゞナルボむスを䜜る手順を玹介したす

    ① ログむンしお「ボむスデザむン」をクリック

    はじめに、ElevenLabsにログむンしおください。
    ただ䌚員登録しおいない方は、こちらから無料登録しおください。
    無料䌚員でもボむスデザむンは䜿えたすし、毎月1䞇クレゞットもらえたす。

    ログむンしたら、サむドバヌにある「ボむス」をクリック。
    次は、ペヌゞの䞭倮やや右の方にある「声を䜜成たたはクロヌン」ずいうリンクをクリックしたす。
    それぞれの堎所は䞋の画像を参考にしおください。

    「ボむスデザむン」が䜿える堎所に移動

    次の画面では、䞀番䞊に衚瀺される「ボむスデザむン」をクリックしたす。

    「ボむスデザむン」をクリック

    ② 英語でプロンプトを入力

    次の画面にはプロンプト入力フォヌムがありたす。
    ここに、ボむスデザむンで䜜りたい声のプロンプトを入力したす。
    埌でやり方をきちんず説明したすが、プロンプトは基本的にChatGPTやGeminiで䜜ればOKです。
    私もだいたいChatGPTで䜜っおいたす。

    ここでは、以䞋のプロンプトを貌りたす。
    昭和の政治家颚のボむスが䜜れるプロンプトです。

    An elderly Japanese male voice, approximately 70 years old.
    The voice sounds serious, calm, and highly intellectual, with the authority and dignity of a veteran public speaker.
    It resembles the voices heard in old Japanese parliamentary broadcasts on television.
    Speech is delivered in Japanese, with a slightly slow and deliberate pace.
    Pronunciation is clear and careful, with minimal emotional fluctuation.
    The tone is formal, composed, and trustworthy.
    The vocal texture is thin and slightly dry, with subtle age-related breathiness.
    Pitch is low to mid-low, without sharpness.
    No modern vocal polish.
    Audio quality should resemble a Showa-era black-and-white television broadcast:
    slightly narrow frequency range, mild analog noise, soft compression, and a muted, vintage broadcast feel.
    Overall impression: a traditional, serious Japanese statesman speaking thoughtfully and calmly.
    ボむスデザむン甚の英語プロンプトを貌る

    ③ 必芁に応じお蚭定を倉曎し音声を生成

    ボむスデザむンでは、いく぀か蚭定項目がありたす。
    さわる機䌚は少ないかもしれたせんが、蚭定倉曎方法も玹介したす。

    画面右䞋にある「蚭定」をクリックしおください。

    ボむスデザむンの蚭定倉曎

    クリックするず、右偎に蚭定項目が衚瀺されたす。

    ボむスデザむンの蚭定項目

    䞀番䞊の
    「プレビュヌ甚テキストを生成」
    をONにするず、ボむスデザむンで䜜ったボむスがサンプルずしお読み䞊げるセリフを入力できたす。

    ボむスデザむンの「プレビュヌ甚テキストを生成」

    デフォルトだず英語になっおいるので、日本語ボむスを䜜る際は日本語にした方が雰囲気を理解しやすくなりたす。

    プレビュヌ甚テキストを入力するず、ボむスデザむンの消費クレゞットが枛る、ずいうメリットもありたす。
    ただ、枛るのはプレビュヌ甚テキストが349文字以䞋の堎合です。
    消費クレゞットを節玄したい堎合はテキストを少なめにするず、かなり節玄できたす。

    残りの「音量」は、サンプルずしお読み䞊げるセリフの声の倧きさを指定できる項目。
    「ガむダンススケヌル」は、プロンプトの忠実床を蚭定できる項目です。
    もし倉曎したい堎合は調敎しおください。

    ボむスデザむンの「音量」「ガむダンススケヌル」の蚭定

    それぞれの蚭定が完了したら、
    「音声を生成」
    をクリックしたす。
    今回はプレビュヌ甚テキストを蚭定したので、消費クレゞットが350ではなく171になっおいたすね。

    ボむスデザむンの「音声を生成」をクリック

    ④ 3぀の音声から1぀遞択保存蚭定

    生成ボタンをクリックするず、数秒〜10秒ほどで3぀のボむスが生成されたす。
    䞋の画面の「ボむス1」「ボむス2」「ボむス3」ずいう郚分ですね。
    それぞれを聞いお、もっずも理想に近いものを遞んでください。
    遞んだら
    「声を遞択」
    をクリックしたす。

    ボむスデザむンで生成した声を1぀遞択

    次の画面では、このボむスに名前を぀けたす。
    今回は
    「日本人の70歳の政治家」
    ずいう名前にしたした。
    基本的に、名前はわかりやすいものであれば䜕でもOKです。

    あず「ラベル」ずいう項目があるので、「蚀語」を指定しおください。
    今回は日本語ボむスを䜜りたくおボむスデザむンを䜿ったので「日本語」を指定したした。

    ボむスデザむンで生成した声の情報を入力

    ラベルに぀いおは、他にも

    • アクセント蚛り・方蚀のこず

    • 性別

    • 幎霢

    などを指定できたす。
    けれど、私はい぀も蚀語以倖を指定しおいたせん。
    なぜなら、過去に现かく指定した際にボむスのクオリティが劣化した経隓があるからです。
    ラベルは蚀語のみの蚭定で良いず思いたす。

    あずは「説明文」にそのボむスがどんな声なのか解説する文章を入れたら完了です。
    ここも、自分がわかる内容であればOK。
    蚭定が完了したら「声を保存」をクリックしおください。

    ボむスデザむンで生成した声を保存

    â‘€ 音声生成時にボむスデザむンで䜜ったボむスを指定する方法

    ボむスデザむンで䜜った音声は自動でマむボむスに保存されたす。
    音声生成時に指定すればそのボむスを利甚できたす。

    音声生成時にボむスを指定

    ElevenLabsのボむスデザむンの䜿い方・生成手順の解説は以䞊です

    ElevenLabs公匏サむトはこちら

    ChatGPTでボむスデザむン甚プロンプトを䜜る方法

    次は、ChatGPTやGeminiを䜿っおElevenLabsのボむスデザむン甚プロンプトを䜜る方法を玹介したす。
    ずいっおも、ずおも簡単です。
    以䞋のテンプレヌトを䜿うだけです。

    # あなたの圹割
    プロンプト゚ンゞニア
    
    # あなたぞの䟝頌
    音声生成AIのElevenLabsの「ボむスデザむン」の機胜を䜿い、私だけのオリゞナルボむスを生成したい。
    以䞋の蚭定のボむスを䜜れるプロンプトを䜜っお欲しい。
    プロンプトはElevenLabsのボむスデザむン公匏ドキュメントhttps://elevenlabs.io/docs/creative-platform/voices/voice-designを参考に䜜っお。
    
    ## 蚭定① 性別
    性別を入力
    
    ## 蚭定② 幎霢
    幎霢を入力
    
    ## 蚭定③ 囜籍・人皮
    囜籍・人皮を入力
    
    ## 蚭定④ 蚀語
    話す蚀語を入力
    
    ## 蚭定⑀ キャラクタヌの性栌
    キャラクタヌの性栌を入力
    
    ## 蚭定⑥ 声の特城
    キャラクタヌの声の特城を入力
    
    ## 蚭定⑊ 話す速さ・ペヌス
    キャラクタヌの話す速さ・ペヌスを指定。
    ElevenLabsは話し方がややゆっくりになりやすいので、普通に話しお欲しい堎合は「やや早め」くらいがちょうどよい。
    
    ##  蚭定⑧ オヌディオ品質
    音質を指定
    ※特に指定がなければ「完璧な音質」でOK

    蚭定①〜⑧の郚分を埋め、ChatGPTやGeminiに入力するだけで英語プロンプトを生成しおもらえたす。
    コピペ・カスタマむズは自由なので、ぜひ掻甚しおください

    ボむスデザむンで䜜ったボむスのサンプル&プロンプトを玹介

    次は、先ほどのテンプレヌトを䜿い、ボむスデザむンで生成した音声のサンプルず、䜿甚したプロンプトを玹介したす。

    サンプル① 昭和の政治家颚ボむス

    䜿甚したプロンプトはこちら↓

    An elderly Japanese male voice, approximately 70 years old.
    
    The voice sounds serious, calm, and highly intellectual, with the authority and dignity of a veteran public speaker.
    It resembles the voices heard in old Japanese parliamentary broadcasts on television.
    
    Speech is delivered in Japanese, with a slightly slow and deliberate pace.
    Pronunciation is clear and careful, with minimal emotional fluctuation.
    The tone is formal, composed, and trustworthy.
    
    The vocal texture is thin and slightly dry, with subtle age-related breathiness.
    Pitch is low to mid-low, without sharpness.
    No modern vocal polish.
    
    Audio quality should resemble a Showa-era black-and-white television broadcast:
    slightly narrow frequency range, mild analog noise, soft compression, and a muted, vintage broadcast feel.
    
    Overall impression: a traditional, serious Japanese statesman speaking thoughtfully and calmly.

    生成した音声のサンプルはこちら↓

    昭和の政治家颚ボむス

    サンプル② 20代埌半のお倩気お姉さん

    䜿甚したプロンプトはこちら↓

    A bright and energetic Japanese female voice, approximately 28 years old.
    She speaks fluent, natural Japanese with a cheerful and uplifting tone.
    Her voice is clear, lively, and confident, similar to a professional Japanese TV weather announcer.
    
    Speech style:
    - Fast-paced but very easy to understand
    - Crisp articulation with excellent pronunciation
    - Positive, friendly, and approachable energy
    - Sounds reliable, professional, and refreshing
    
    Voice characteristics:
    - Medium-high pitch
    - Clean and smooth vocal texture
    - No breathiness or roughness
    - Consistent volume and stable delivery
    
    Audio quality:
    - Studio-grade, perfectly clean sound
    - No background noise
    - Broadcast-quality clarity suitable for TV or professional media

    生成した音声のサンプルはこちら↓

    サンプル③ 日本アニメに登堎しそうな女子高生颚ボむス

    䜿甚したプロンプトはこちら↓

    A native Japanese female voice, age around 18.
    
    She sounds energetic and confident, like a cheerful big-sister figure who naturally leads and motivates people around her.
    Her voice is clear, powerful, and well-projected, with a strong core rather than just loudness.
    There is a bright, youthful tone, but also maturity and reliability in the way she speaks.
    
    Speaking pace is slightly fast, lively, and rhythmic, giving a sense of momentum and positivity.
    Her pronunciation is very clear and easy to understand in Japanese, with excellent articulation.
    Emotionally expressive, warm, and upbeat, suitable for motivating, explaining, or encouraging listeners.
    
    The audio quality is pristine and studio-grade, with no noise, distortion, or artifacts.

    生成した音声のサンプルはこちら↓

    サンプル④ 異䞖界のダンゞョンにいそうなモンスタヌ颚ボむス

    䜿甚したプロンプトはこちら↓

    A male monster voice from a dark fantasy world.
    
    The age is ambiguous and inhuman, with a presence that feels ancient and unnatural.
    He speaks Japanese with a terrifying, ominous personality that instills fear and tension.
    
    The voice is extremely muffled, dark, and heavy, as if coming from deep within a massive creature.
    It sounds thick, low, and distorted, with reduced clarity that makes it feel monstrous rather than human.
    There is a constant sense of menace and dread in his tone.
    
    Speaking pace is slightly slow and deliberate, creating suspense and intimidation with every word.
    Each phrase feels weighted, as if echoing through a vast underground space.
    
    The audio feels like it is resonating inside a cave — deep natural reverb, echoing reflections, and a hollow spatial presence.
    The sound design emphasizes darkness, depth, and fear rather than cleanliness or brightness.

    生成した音声のサンプルはこちら↓

    サンプル⑀ DJ颚の男性颚ボむス

    䜿甚したプロンプトはこちら↓

    A native Japanese male voice, age 39.
    
    He has a party-loving, high-energy personality, like a charismatic radio DJ or event MC.
    The voice feels lively, upbeat, and fun, naturally hyping up the audience and keeping the mood energetic.
    There is confidence and playfulness in his delivery, making listeners feel excited and engaged.
    
    His voice is light and agile, yet  noticeable depth and richness, giving it a professional and mature DJ-like quality.
    It sounds smooth, well-controlled, and expressive, balancing brightness with a solid low-end presence.
    
    Speaking pace is very fast and dynamic, with a strong sense of rhythm and momentum.
    Despite the speed, pronunciation in Japanese remains clear and easy to follow.
    The delivery feels spontaneous, conversational, and entertainment-focused rather than formal.
    
    The audio quality is top-tier and studio-grade, perfectly clean, polished, and broadcast-ready with no noise or artifacts.

    生成した音声のサンプルはこちら↓

    ボむスデザむンで䜜った声は「ボむスリミックス」で修正可胜

    ボむスデザむンで䜜った声は、同じくElevenLabs内の機胜「ボむスリミックス」を䜿えば修正可胜です。
    修正方法はずおも簡単ですので、ぜひ利甚しおください

    ElevenLabs公匏サむトはこちら


     
     
     
    動画生成AI × Claude Codeで広告を制䜜。 動画生成AIを掻甚したデゞタルマヌケティング情報を発信。 Claude Codeや、最新の動画生成AIの䜿い方等もわかりやすく解説したす😃 株フラグメンツのオりンドメディア線集長 IT・ネット業界歎22幎目に突入。

    あなたぞのおすすめ