マイクロソフトは、音声認識(Speech-to-Text)およびテキスト読み上げ(Text-to-Speech)向けのAIモデル「VibeVoice」をオープンソース化しました。 このスイートには、1時間の音声を文字起こしする「VibeVoice-ASR-7B」、最大90分間の複数話者による対話を生成する「VibeVoice-TTS-1.5B」、および300ミリ秒のレイテンシーを持つリアルタイムTTSモデルが含まれています。MITライセンスの下で公開されており、ローカル展開をサポートし、音声合成の革新を推進することを目指しています。





家
