ByteDanceの音声生成AI『Seed Audio 1.0』の使い方とプロンプトを解説
こんにちは!GENELです。
SeedanceでおなじみのByteDanceから、音声生成AI『Seed Audio 1.0』が登場!
早速使ってみましたが、日本語OK、自然な話し方で、感情表現もセリフに沿ってつけてくれます。
ByteDanceの音声生成AI
— GENEL | AIを用いた動画制作 (@genel_ai) June 26, 2026
「Seed Audio 1.0」
使用感はこんな感じでした!
・Seedance2.0での音声出力より日本語が安定
・セリフに沿って感情表現を微妙に合わせてくれる
・音声と画像は同時にリファレンス不可
・音声のリファレンスの精度が高い(Max30秒)
・高い声だと機械音っぽい感じが出やすい… https://t.co/p7skwSwPAR pic.twitter.com/F1oQMaT1Ol
自然なナレーションボイスでいいですよね。
今回の記事では
「Seed Audio 1.0って何者?」
「料金は?」
「どうやって使う?プロンプトは?」
などご紹介していきます。
また、
「この動画の作り方が知りたい!」
という声も多数いただいたので、せっかくなのでこの動画の作り方もご紹介します。
Seed Audio 1.0とは?
先日開催されたByteDanceのカンファレンスにて、動画生成AI界隈をざわつかせた「Seedance 2.5」の発表がありましたが、実はそこで発表されていたもう一つのモデルが『Seed Audio 1.0』です。

Seed Audio 1.0のすごい機能3つ
セリフ、BGM、環境音、効果音(足音など)を、テキストプロンプトだけで同時生成。別々のツールで作って編集する手間がなくなります。
入力された物語の文脈から、AIが最適なキャラクターの声質や感情を自動で出力してくれます。
1分近い長尺でも、声のトーンやアクセントが終始安定。Vlogやショートドラマの制作で没入感をキープします。
Seed Audio 1.0で作った音声
ということで、falにて実際に作ってみた音声集です!
どうでしょうか?
たまにイントネーションが気になるところもありますが、それぞれ音楽やSEも入れられるのと、シーンに合った声がプロンプトで生成できるので結構いいですよね!
Seed Audio 1.0、どこで使える?
Seed Audio 1.0は現時点では「fal」限定で使用可能とのことです。

以前ご紹介した「Grok Imagine Video 1.5」もfalが先行リリースだったような気がしますね…👀
他には「火山方舟(VolcArk)」の体験センターにて、体験版が用意されています。
現時点では、30分の無料クレジットが付与されているようです。

が、残念ながらアカウント登録しないと生成できず、登録には中国本土の電話番号が必要みたいでした…残念!
気になる料金
実は今日、falから「Seed Audioを値上げするよ」というメールが届きました。
元々は1分$0.075だったのですが、今日(6/27)から$0.1875(約2.5倍)になるとのこと。
値上げ後の値段は日本円でだいたい30円くらいです。

ElevenLabsと比べると?
声単体で比べると、ElevenLabsはざっくり1分あたり$0.17〜0.20くらいだと思います。
日本円でだいたい約27.5円〜32.3円です。
イレラボと比べると、Seed Audio 1.0は声が若干機械音っぽくなる場合もあるので、クリアなナレーションボイスが欲しいならElevenLabs、どちらかといえばもっと感情表現豊かな声が欲しい!って方にはSeed Audio 1.0が向いていると思います。
ElevenLabsの使い方、コツなどをまとめているので、どうしてもこれじゃ無理!って方はSeed Audio 1.0を試してみるのもありだと思います!
まずはあの動画の作り方から
ByteDanceの音声生成AI
— GENEL | AIを用いた動画制作 (@genel_ai) June 26, 2026
「Seed Audio 1.0」
使用感はこんな感じでした!
・Seedance2.0での音声出力より日本語が安定
・セリフに沿って感情表現を微妙に合わせてくれる
・音声と画像は同時にリファレンス不可
・音声のリファレンスの精度が高い(Max30秒)
・高い声だと機械音っぽい感じが出やすい… https://t.co/p7skwSwPAR pic.twitter.com/F1oQMaT1Ol
「あの動画どうやって作ったの?」が多かったので、先に全体像から。
ざっくり流れはこんな感じです↓
①画像生成:ChatGPT Images 2.0
②動画生成: Kling 3.0/2.6、Seedance2.0
③音声生成:Seed Audio 1.0
④編集
画像生成のやり方(ChatGPT Images 2.0)
まず最初に、こんな感じのコラージュ画像を作っていきました。

プロンプトはこちらの記事を参考にしてください↓
コラージュ画像生成を何回か繰り返して、これいいな!と思う画像ができたら、コラージュ画像を1枚1枚の画像にしていきます。


これで出来たのがこんな感じの画像です↓


画像ができたら、今度は動画生成をします。
動画生成のやり方(Kling 3.0/2.6、Seedance2.0)
やり方はシンプルで、画像をアップロードして、プロンプトを入力するだけです。
所謂「image to video」です。
例えばこの動画の場合は、

こんな感じの指示でOKです。

さらに、この動画の場合は、

こんな感じです。

ここまではKlingでだいたい行けると思います。
Klingでどうしてもできなかったのはこのシーンです。

このシーンはSeedance2.0を使用しました。
プロンプトはこんな感じです。
手で持った線香花火のクローズアップ。
線香花火の棒は最後まで手に持たれたまま、画面内の同じ位置に残る。
カメラはわずかに手振れしている。背景は強くぼけた夕暮れの空。
細い火花が静かにパチパチと散り、先端には小さな雫型の赤橙色の火の玉がついている。
約8秒後、棒は落ちずに固定されたまま、先端の火の玉だけが棒から離れて真下にぽとっと落ちる。
火の玉は短い光の尾を引きながら落ち、火花は弱まり、静かで哀愁のある余韻が残る。
切ない夏の終わりの雰囲気。実写風、シネマティック、浅い被写界深度。もうすぐ夏本番なのでこれは自分もまた使いそう🎆
という感じで、動画化まで出来たら、次はいよいよ音声の生成です!
音声生成のやり方(Seed Audio 1.0)
まずはfalに移動します。
そうするとこんな感じの画面になってると思います。

サンプルプロンプトはこんな感じで書かれていました。
Generate a short suspense radio drama in a late-night convenience store, in English
(深夜のコンビニを舞台にした、短いサスペンス系のラジオドラマを英語で作ってください。)このプロンプトのサンプル音声がこちらです!
英語は全くわかりませんが、ここまでラジオドラマになるのはすごい…!
と思って日本語で試してみたのがこちらです👇🏻
違う、そうじゃない…(笑)
ということで気を取り直して、プロンプトを書きなおして生成した音声がこちらです。
いいですね。
若干イントネーション気になりますが、複数話者も一発で作れる&SEも付けてくれるのが◎
実際に使用したプロンプトはこんな感じです👇🏻
ここから先は
メンバーシップ
¥ 3,980 /月
この記事が気に入ったらチップで応援してみませんか?
