テンセントと清華大学が、誤認識率8.55%の「SongGeneration 2」を発表、Sunoへのプレッシャーが強まる
2026年初頭、AI音楽業界は再び大きな変化を迎えた。3月9日、テンセントと清華大学 「人間・コンピュータ音声相互作用研究所 」が共同開発した音楽基盤モデル「SongGeneration2」が正式にリリースされた。 このモデルは、技術アーキテクチャにおいて質的な飛躍を遂げただけでなく、複数の主要な指標において現在の主流となるオープンソースモデルを上回り、総合的な品質においてもトップクラスの商用モデルに匹敵する性能を示した。

3つの画期的な進歩:「プラスチック」のようなAI音楽とはおさらば
SongGeneration2 の主な強みは、基盤となるアーキテクチャの包括的なアップグレードにあり、従来のAI音楽が抱えていた3つの主要な課題を解決している:
高い音楽性:単純なメロディの積み重ねとは異なり、このモデルは印象的な空間的奥行きを備えた複雑なマルチトラック・アレンジメントを処理します。
高い歌詞の正確性:不明瞭な発音や幻聴のようなピッチシフトは過去のものとなりました。その音素誤り率(PER)はわずか8.55%で、主要な商用モデルであるSuno v5 (12.4%)を著しく上回り、MiniMax2.5 に次ぐ水準です。
高い制御性:テキストによる説明であれ音声プロンプトであれ、指示を正確に実行し、スタイルや感情のきめ細かなカスタマイズを可能にします。

「デュアルコア」駆動:LLMとディフュージョンモデルの夢のコラボレーション
アーキテクチャの面では、SongGeneration2は 革新的なハイブリッドLLM-ディフュージョンアーキテクチャを採用しています:
Composing Brain (LeLM):全体的な構造の計画とボーカルの細部を処理し、「どのように歌うか」という課題を解決します。
High-Fidelity Renderer(ディフュージョン):言語モデルの指導の下、極めて複雑な音響的ディテールを合成します。
階層的表現:混合およびマルチトラック表現の並列モデリングを業界で初めて採用し、メロディの安定性と音質の洗練さのバランスを実現しています。
真のオープンソース、参入障壁の低さ:普通のコンピュータでも「曲を作れる」
開発者たちを最も興奮させたのは、テンセントの驚くべきオープンな姿勢でした。40億パラメータを持つ「SongGeneration-v2-large」モデルは現在完全にオープンソース化されており、中国語や英語を含む多言語生成に対応しています。驚くべきことに、VRAMがわずか22GBの一般向けハードウェアでもスムーズに動作し、ローカルかつプライベートな音楽制作を可能にしています。
ユーザーがすぐに試せるよう、チームはHuggingFace上で「SongGeneration-v2-Fast」バージョンも公開した。これは、音質をわずかに犠牲にする代わりに超高速な生成を実現し、1分以内に1曲の楽曲を完成させることができる。
SongGeneration2 の性能を踏まえると、AI音楽は「オタク向けのおもちゃ」から「商用レベルのアプリケーション」の領域へと正式に進化したと言えます。12GBのVRAMに対応したMediumモデルの公開や自動評価フレームワークの登場が控えており、誰もが「作曲家」になれる時代が、ついに到来しようとしているのかもしれません。
関連記事
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン
カリフォルニア州の自動運転車規制:違反切符、ジオフェンス、そして100万マイルという新たな時代
Guident社は南フロリダでAuveTechのシャトルを運行しており、同社の遠隔監視技術を活用して、ウェストパームビーチでの4マイルのルートとボカラトンでの1マイルのルートを管理している。 | 提供:Guidentカリフォルニア州は、自動運転車の規制環境を再定義しつつあり、テクノロジー業界の「迅速に動き、失敗を恐れない」という考え方から、厳格な説明責任と厳しい走行距離要件へと移行している。Gui
関連特集おすすめ
コメント (0)
0/500
2026年初頭、AI音楽業界は再び大きな変化を迎えた。3月9日、

3つの画期的な進歩:「プラスチック」のようなAI音楽とはおさらば
高い音楽性:単純なメロディの積み重ねとは異なり、このモデルは印象的な空間的奥行きを備えた複雑なマルチトラック・アレンジメントを処理します。
高い歌詞の正確性:不明瞭な発音や幻聴のようなピッチシフトは過去のものとなりました。その音素誤り率(PER)はわずか8.55%で、主要な商用モデルである
高い制御性:テキストによる説明であれ音声プロンプトであれ、指示を正確に実行し、スタイルや感情のきめ細かなカスタマイズを可能にします。

「デュアルコア」駆動:LLMとディフュージョンモデルの夢のコラボレーション
アーキテクチャの面では、
Composing Brain (LeLM):全体的な構造の計画とボーカルの細部を処理し、「どのように歌うか」という課題を解決します。
High-Fidelity Renderer(ディフュージョン):言語モデルの指導の下、極めて複雑な音響的ディテールを合成します。
階層的表現:混合およびマルチトラック表現の並列モデリングを業界で初めて採用し、メロディの安定性と音質の洗練さのバランスを実現しています。
真のオープンソース、参入障壁の低さ:普通のコンピュータでも「曲を作れる」
開発者たちを最も興奮させたのは、テンセントの驚くべきオープンな姿勢でした。40億パラメータを持つ「SongGeneration-v2-large」モデルは現在完全にオープンソース化されており、中国語や英語を含む多言語生成に対応しています。驚くべきことに、VRAMがわずか22GBの一般向けハードウェアでもスムーズに動作し、ローカルかつプライベートな音楽制作を可能にしています。
ユーザーがすぐに試せるよう、チームはHuggingFace上で「SongGeneration-v2-Fast」バージョンも公開した。これは、音質をわずかに犠牲にする代わりに超高速な生成を実現し、1分以内に1曲の楽曲を完成させることができる。
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン





家






