オプション
速報
コンテンツ
FrankRoberts
FrankRoberts
2026年7月17日

Tongyi Labは、リアルタイムの対面対話において550msの応答遅延を実現するエンドツーエンドのマルチモーダルAIモデル「Wan-Streamer v0.2」を公開した。このモデルは、聴覚、視覚、発話、動作を単一のトランスフォーマーに統合しており、動画解像度は640×368に向上している。 このストリーミングアーキテクチャにより、160msでの処理が可能となり、個別指導やカウンセリングなどの用途において、全身のデジタルヒューマンをサポートします。

Tongyi Labは、リアルタイムの対面対話において550msの応答遅延を実現するエンドツーエンドのマルチモーダルAIモデル「Wan-Streamer v0.2」を公開した。このモデルは、聴覚、視覚、発話、動作を単一のトランスフォーマーに統合しており、動画解像度は640×368に向上している。 このストリーミングアーキテクチャにより、160msでの処理が可能となり、個別指導やカウンセリングなどの用途において、全身のデジタルヒューマンをサポートします。
コメント (0)
0/300
OR