見出し画像

Suno v6登場―音楽生成AIは「作る」から「思い通りに作る」段階へ。Duration・Max Mode・自然言語編集など進化点を徹底解説

AI音楽生成サービス「Suno」が、2026年9月9日に新世代モデル「Suno v6」を正式公開した。

今回のv6は、単純に「音質が良くなった」というだけのバージョンアップではない。

Suno自身がv6を「reliable(信頼性が高い)」「precise(精密)」と表現しているように、今回の進化で特に重要なのは、ユーザーが指定した内容をより正確に音楽へ反映する「制御性」の向上である。

さらに、自然言語による部分編集、複数楽曲のMashup、画像や動画を含めた入力、Max Mode、Varietyなどが加わり、Sunoは「プロンプトを入れて曲を生成するサービス」から、より本格的なAI音楽制作環境へと進化しつつある。


Suno v6は3つのモデルで構成

Suno v6は、用途の異なる3種類のモデルで構成されている。

  • v6
    標準となるフラッグシップモデル。精度、表現力、安定性を重視しており、通常の楽曲制作や、狙ったイメージに近い曲を作りたい場合に向いている。

  • v6-wild
    意図的に予測不能性や変化を大きくしたモデル。実験的な音楽、ジャンル融合、意外性のある展開を求める場合に適している。

  • v6-mini
    軽量・高速モデル。アイデア出し、大量生成、本格的な制作前の試作などに向いている。

v6とv6-wildはProおよびPremier向け、v6-miniは全プランで利用できる。

また、3モデルはいずれも1回の生成で最大8分までの音楽生成に対応する。もっとも、8分生成そのものは過去モデルにも存在していたため、「v6で初めて8分になった」という意味ではない。v6では3種類すべてが最大8分に対応したと理解するのが正確だ。


v6で何が変わったのか

大まかに整理すると、次のようになる。

この中でも特に興味深いのが、Duration、Prompt adherence、Max Mode、自然言語編集である。



注目点① Duration指定が以前より機能する?

Sunoでは2026年7月20日、v5.5向けに「Duration Slider」が導入された。

Create画面のスライダーから、生成したい曲の長さを事前に設定できる機能である。

一見すると非常に便利な機能だが、v5.5時代には、

「5~6分を指定したのに3分程度で終了する」

「指定時間を無視して長く生成される」

「CoverやRemixでは特に時間指定が安定しない」

といったユーザー報告もあり、必ずしも「指定した時間=実際の曲長」にはなっていなかった。Durationは厳密な制約というより、モデルへの希望値に近い挙動を示すことがあった。

ところがv6では、実際の生成で指定したDurationに近い時間で曲が終了するケースが増えたように感じられる。

ここはv6のかなり興味深いポイントである。

ただし注意したいのは、Suno公式が現在のところ、

「v6ではDurationの精度を改善した」

と明示しているわけではないことだ。

一方でSunoはv6について「precise」「greater control」といった表現を使っており、モデル全体としてユーザーの指示をより忠実に扱う方向へ改良されている。Durationへの追従性が改善しているとすれば、このPrompt adherence向上の一部として説明できる可能性がある。

公開直後のユーザー報告を見ると、Durationが有効に機能しているという例がある一方、短すぎる曲が生成されたという報告もあり、現時点では完全ではない。

そのため現段階では、

v5.5では「Duration=かなり大まかな目安」だったものが、v6では「より強い制約条件」として扱われ始めている可能性がある

程度に考えるのが妥当だろう。

これは今後さらに検証したいポイントである。


注目点② 長い曲では「Max Mode」が重要

v6には「Max Mode」という生成モードが用意されている。

通常より多くのクレジットを消費する代わりに、Suno側が生成へより多くのリソースを使うモードだ。

Suno公式はMax Modeを特に次の用途に推奨している。

  • 2分を超える長い曲

  • 元曲に忠実なCoverを作りたい場合

  • ある曲のStyleを別の曲へ移したい場合

  • 曲全体を通してVoiceやStyleの一貫性を維持したい場合

逆に短いアイデアや試作曲であれば、通常モードで十分としている。

AI音楽生成では、曲が長くなるほど、

「途中から別の曲のようになる」

「ボーカルの声質が変わる」

「後半だけ音質が崩れる」

「意図していない展開へ進む」

といった問題が起きやすい。

そのためMax Modeは単なる「高音質モード」というより、長い曲の構成・声・Styleを維持するための生成モードと考えると分かりやすい。

Durationを5分、6分、7分と長く設定する場合は、

Duration + Max Mode

の組み合わせがv6では重要になりそうだ。


注目点③ プロンプトの書き方が変わる

v6ではPrompt adherence、つまり「プロンプトへの追従性」が大きなテーマとなっている。

これまでのSunoでは、

uplifting, majestic, emotional, piano, cinematic

といったように、ジャンル名、雰囲気、楽器名などをタグ的に並べても比較的うまく生成できた。

v6でももちろんこの方法は使えるが、公開後のユーザー報告を見ると、より効果的なのは曲がどのように演奏され、どのように展開するのかを具体的に記述する方法のようだ。

例えば、

uplifting, majestic, piano, strings

だけではなく、

Solo piano opens quietly. Warm strings gradually enter. The arrangement slowly expands, building toward a majestic cinematic climax.

のように書く。

つまり、

「何のジャンルか」

だけではなく、

「どの楽器が、いつ入り、どのように演奏され、曲がどのように変化していくか」

まで書く。

これは従来の「音楽ジャンルを指定するプロンプト」から、音楽プロデューサーへ演奏・編曲を指示するようなプロンプトへの変化とも言える。

v5.5以前のプロンプトをそのままコピーすると意図と違う結果になる場合があるという報告もあり、v6にはv6向けのプロンプト設計が必要になりそうだ。


注目点④ 「Variety」で生成の自由度を調整

v6には「Variety」という新しい調整項目がある。

これは単純なランダム度ではない。

Suno公式によれば、VarietyはStyle Prompt自体を調整・更新することで、生成結果へ多様性を与える機能である。

逆に、自分が入力したStyle tagsをできるだけそのまま使わせたい場合には、

Varietyを0にする

ことが公式に推奨されている。

つまり使い分けとしては、

狙った曲を正確に作りたい
→ Varietyを低めにする

思いもよらない曲を生成してほしい
→ Varietyを上げる

という考え方になる。

Durationや曲構成を細かく指定する場合にも、Varietyを低めにすることでプロンプトをより直接的に反映させやすくなる可能性がある。

一方、偶然性を楽しむのであればVarietyを上げたり、v6-wildを使ったりする方法が考えられる。


v6 / v6-wild / v6-miniはどう使い分ける?

今回3種類に分かれたモデルの性格はかなり明確だ。

v6

基本となるフラッグシップモデル。

Suno自身が「reliable」「precise」と説明しており、狙った音楽を安定して作ることを重視したモデルと考えてよい。

通常はまずv6を使うのが基本になるだろう。

v6-wild

意図的に予測不能性を強めたモデル。

Sunoは「unexpected」「textured」「ambitious」と表現しており、ジャンル融合や実験的な音楽、通常とは違う展開を探したいときに適している。

v6が「制御」を重視するのに対し、v6-wildは偶然性を利用したアイデア発見を狙ったモデルと言える。

v6-mini

高速・軽量モデル。

短時間で多くのアイデアを試したり、本格生成の前に曲の方向性を確認したりする用途に適している。

v6-miniは無料プランを含む全プランで利用できる。


注目点⑤ 自然言語で曲の一部分だけ編集できる

v6で非常に大きな進化が「編集」である。

Suno公式が紹介している例では、

「コーラス部分だけゴスペル合唱に変更する」

といった指示を自然言語で入力し、曲のそれ以外の部分を維持したまま一部分だけ編集することができる。

これは従来のAI音楽生成にあった、

「少し直したいだけなのに曲全体を作り直さなければならない」

という問題への大きな改善である。

音楽生成AIが「一発生成」から「生成→修正→仕上げ」という制作フローへ移行していることを象徴する機能と言える。


注目点⑥ 歌詞を1語だけ変更できる

さらにv6では、完成した曲の歌詞について、

「loveをlightへ変える」

といったように、1単語や1行だけを変更することもできる。

曲全体の雰囲気や演奏を気に入っているのに、一か所だけ歌詞を変更したい――というケースでは非常に有効だ。

従来であれば修正後に曲全体を再生成し、結果としてメロディや歌声まで変わってしまうことがあった。

部分的な歌詞修正が可能になったことで、「良いテイクを残しながら完成度を高める」というDAWに近い制作思想へ一歩近づいている。


注目点⑦ 複数の曲からMashupを作れる

v6は複数の音楽素材を一度に扱える。

Suno公式が示している例では、

「曲Xのボーカルを使い、曲Yのドラムを使い、新しい歌詞を追加して80年代Synthwaveにする」

といった生成が可能だ。

つまり、

Song Aのボーカル
+
Song Bのドラム
+
新しいStyle
+
新しい歌詞

といった組み合わせを、ひとつの自然言語指示から作れる。

単なる「AI作曲」から、素材を再構成するAIアレンジャー/AIリミキサーへと機能が広がっている。


注目点⑧ サンプリング・分離・Beat生成を一つの指示で

例えば、

「0:45にあるギターリフをサンプリングし、ギターだけを分離して、そのリフを中心に新しいBeatを作る」

といった指示もv6では想定されている。

サンプリング、Stem分離、再構成といった従来なら複数の操作が必要だった処理を、自然言語から一連のワークフローとして実行する方向へ進んでいる。


注目点⑨ TextだけではなくAudio・Image・Videoから音楽を作る

v6では入力方法も拡大した。

Suno公式は、

Text
Audio
Image
Video

を音楽制作の入力として利用できるとしている。

例えば、

「この写真と、この音声と、この日記の文章から曲を作る」

といった生成も想定されている。

これまでもAudio Uploadなどは存在したが、v6では複数モダリティを組み合わせて「作品の雰囲気そのもの」を音楽へ変換する方向がより明確になった。

今後、旅行写真からBGMを生成したり、映像に合わせた音楽を作ったりするといった用途との相性も良さそうだ。


「雰囲気」そのものをプロンプトにできる

v6では、Genreや楽器を細かく指定しなくても、

「真夜中の屋上にいるような曲」

といった抽象的なイメージを起点として音楽を生成できることもSunoが強調している。

音楽用語を詳しく知らなくても、

風景
時間帯
感情
映像
物語

などから曲を作れるわけで、これはSunoらしい生成方法をさらに発展させたものと言える。


音質については評価が分かれている

ここまで見るとv6は全面的な進化のように思えるが、公開直後のユーザー評価は必ずしも一方向ではない。

一方では、

「楽器の分離感が良くなった」

「低域が改善した」

「具体的なプロンプトを以前より正確に反映する」

「楽器同士の関係やボーカルの質感まで記述すると非常に細かく制御できる」

といった肯定的な報告がある。

その一方で、

「音がこもっている」

「ボーカルが平坦になった」

「音を長く伸ばす歌唱が弱くなった」

「同じような構成の曲が出やすい」

「BPMや楽器指定を無視することがある」

といった否定的な意見も少なくない。

つまり現時点で、

v6=すべての面でv5.5より高音質

と断定するのは早い。

むしろ、

生成の制御性、編集性、ワークフローを大きく変えた新世代モデル

と捉えた方が適切だろう。

また公開からまだ日が浅いため、今後モデルやサービス側のチューニングによって評価が変化する可能性も十分にある。


v6では「プロンプトを細かく書く」ことがますます重要に

v6の特徴を考えると、今後は次のようなプロンプト設計が重要になりそうだ。

例えば長いInstrumentalを作るのであれば、

Session 1:静かなピアノから開始
↓
Session 2:ストリングスを追加
↓
Session 3:パーカッションを追加
↓
Session 4:メロディを広げる
↓
Session 5:壮大なクライマックス
↓
Session 6:ピアノへ戻り静かに終了

といった構造を文章で明示する。

さらに、

Duration:7分30秒
Max Mode:ON
Variety:低め

と組み合わせる。

v6では、このように

曲長
+
曲構成
+
楽器の入り方
+
演奏方法
+
盛り上がり方
+
終わり方

まで指定する方法が、従来以上に有効になる可能性がある。


Duration精度は今後ぜひ検証したい

特に興味深いのがDurationである。

同じPromptを使用して、

2:00
3:00
4:00
5:00
6:00
7:00
7:50

など複数のDurationを設定し、それぞれ複数回生成して、

指定時間 − 実際の生成時間

を測定すれば、v6のDuration追従性をかなり定量的に評価できる。

さらに同じ条件をv5.5と比較すれば、

「v6で本当にDuration精度が改善しているのか」

を数値で比較できる。

BPM、歌詞量、InstrumentalかVocal曲かによっても結果が変わると考えられるため、非常に興味深い検証テーマである。


Suno v6の本質は「生成」より「コントロール」

Suno v6の進化を一言でまとめるなら、

「AIが勝手に曲を作る」から「人間がAIへ具体的に演奏・編集を指示する」方向への進化

と言える。

v6では、

  • より具体的なPrompt理解

  • Durationによる曲長指定

  • Max Modeによる長尺曲の安定化

  • Varietyによる生成多様性の調整

  • 自然言語による部分編集

  • 1語単位の歌詞修正

  • 複数楽曲のMashup

  • サンプリングとStem分離

  • Text / Audio / Image / Videoからの生成

  • v6 / v6-wild / v6-miniの使い分け

といった機能が組み合わされている。

これらを見ると、Sunoが目指しているのは単なる「AI作曲サービス」ではなく、自然言語を中心に音楽制作全体を操作できるAI制作環境であることが分かる。


まとめ

2026年9月に登場したSuno v6は、音質だけを改善したモデルではない。

最も大きな変化は、

「生成結果をどこまで自分の意図に近づけられるか」

という制御性に重点が置かれたことだろう。

特にDurationについては公式に精度改善が発表されているわけではないものの、v6の「precise」という方向性と合わせて考えると、以前より指定時間を意識した生成になっている可能性があり、注目すべきポイントである。

一方、公開直後ということもあり、音質、ボーカル、創造性、BPMへの追従などについてはユーザー評価がかなり分かれている。

したがって現時点では、

「v5.5の完全な上位互換」

というより、

「プロンプト・Duration・編集機能を使って、より積極的に音楽をコントロールするための新しい世代」

と考えるのがよさそうだ。

Sunoは「曲を生成するAI」から、「人間と一緒に曲を作り、直し、仕上げるAI」へ。

v6は、その方向性がかなりはっきり見えてきたアップデートと言えるだろう。


プロンプト例

従前

Cinematic orchestral music, slow-building dynamic arc with slow tempo, warm clarinet ensemble and featured clarinet solo, gradually widening into majestic, brave harmonies with an uplifting atmosphere of love and peace; instrumental, no vocals

Suno Ver6用の例

  • 転調を入れる
    Cinematic orchestral instrumental, soft strings and delicate textures opening around a warm clarinet ensemble and lyrical solo; spacious production, slow-building dynamic arc, smooth mid-piece modulation to a brighter key, fuller strings, warm brass and timpani rising to a noble, graceful climax before a peaceful clarinet-theme resolution

  • 転調を明確に入れる
    cinematic orchestral instrumental; soft strings and delicate orchestral textures beneath a warm clarinet ensemble, featured lyrical clarinet solo, slow-building arc and slow tempo; distinct upward key change at midpoint, fuller strings, warm brass and timpani driving a noble, triumphant climax, spacious mix, peaceful warm resolution recalling the opening theme


いいなと思ったら応援しよう!