AntGroup、体現知能向けの初の動画基盤モデル「LingBot-Video」をオープンソース化
7月9日、アント・グループは、Mixture-of-Experts(MoE)アーキテクチャを基盤とし、体現知能向けに特別に設計された世界初のオープンソース動画生成基盤モデル「LingBot-Video」をオープンソース化しました。 このモデルは、ロボットと具現化された知能の中核的なニーズに焦点を当てることで、動画の事前学習を再定義し、推論効率、物理的妥当性、行動理解、およびタスク達成において体系的な向上を実現しています。これにより、動画基盤モデルがデジタルコンテンツ制作の枠を超え、具現化された知能へと進化するための新たなオープンソース基盤を提供します。
北京大学とByteDanceが共同開発したRBenchベンチマークにおいて、LingBot-Videoは0.620のスコアを記録し、Wan2.6(0.607)、Seedance1.5Pro(0.584)、Cosmos3Super(0.581)を上回りました。 ロボットの操作動画に対する包括的な評価ベンチマークであるRBenchは、モデルが現実世界の物理法則に従ったロボットの挙動を生成できるかどうかを具体的に評価するものです。この結果は、LingBot-Videoがロボット関連の動画を生成する際、動作の合理性とタスク実行の整合性をよりよく維持できることを示しています。

(図のキャプション:LingBot-VideoはRBenchで最高の性能を達成)
物理世界における変化をモデル化するLingBot-Videoの能力をさらに検証するため、Ant Groupは、一般的な品質と具現化されたドメインという2つの次元にわたる社内ベンチマークを用いて評価を行った。 その結果、NVIDIA Cosmos3、Wan2.2A14B、LongCat-Video、Hunyuan Video1.5、LTX-2.3の5つのオープンソースモデルと比較して、LingBot-Videoは「具現化ドメイン」において主要なベースラインモデルを上回る性能を示した。

(図のキャプション:包括的な評価により、LingBot-Videoが具現化シナリオにおいて、より優れた物理的理解と動作の一貫性を示していることが明らかになった)
近年、動画生成モデルは、視覚的な品質、滑らかさ、創造的な表現において急速に進歩している。しかし、具現化された知能においては、見た目がリアルで滑らかに動く動画であっても、実際の物理法則を反映していない場合があり、ロボットによる継続的な予測、計画、タスク実行をサポートすることが困難となる。 同時に、具現化された知能には、リアルタイムの相互作用や制御ループに適応するための、より高い推論効率も求められます。
このことが、動画生成を2つの異なる道へと進化させる原動力となっています。1つはコンテンツ制作を目的とした映画分野への道、もう1つは物理世界への理解、予測、および相互作用を目的としたロボット分野への道です。LingBot-Videoは、身体化された知能に特化した動画生成の新たな道筋に向けた、Ant Groupによる重要な探求の成果です。
LingBot-Videoは、アーキテクチャ、データ、および学習において体系的な革新をもたらしています。
アーキテクチャの面では、LingBot-Video は DiT + MoE 設計を採用し、従来の密なアーキテクチャを MoE に置き換えています。これにより、推論コストを管理可能な範囲に抑えつつ、モデルの容量を拡張することが可能になります。 300億のパラメータを持つこのモデルは、生成時に約30億のみを活性化させるため、同規模の密なアーキテクチャに比べて推論効率が約3倍高くなります。この設計により、大規模なパラメータから視覚的な表現力を得つつ、具現化された知能が求める効率性の要件をより適切に満たすことができます。
データに関しては、LingBot-Videoはデータプロファイリングエンジンを構築し、膨大なインターネット動画に加え、VLA、VLN、Egoなどのロボット関連データを組み込みました。これにより、巧みな操作、ロボットの移動、一人称視点での相互作用などのシナリオを網羅し、合計7万時間分の体現データが収集されました。 このデータにより、モデルは動画の表面的な質感や視覚的スタイルだけでなく、行動と環境変化との関係を学習できるようになる。

学習において、LingBot-Videoは多次元強化学習報酬システムを導入した。美的評価、プロンプトの遵守、動作の一貫性といった従来の評価指標に加え、モデルは物理的な妥当性やタスクの完了度にも整合性を図ることで、生成結果を現実世界の物理法則とより整合させ、現実世界でタスクを実行するロボットのニーズにより近づけている。
関連記事
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン
カリフォルニア州の自動運転車規制:違反切符、ジオフェンス、そして100万マイルという新たな時代
Guident社は南フロリダでAuveTechのシャトルを運行しており、同社の遠隔監視技術を活用して、ウェストパームビーチでの4マイルのルートとボカラトンでの1マイルのルートを管理している。 | 提供:Guidentカリフォルニア州は、自動運転車の規制環境を再定義しつつあり、テクノロジー業界の「迅速に動き、失敗を恐れない」という考え方から、厳格な説明責任と厳しい走行距離要件へと移行している。Gui
関連特集おすすめ
コメント (0)
0/500
7月9日、アント・グループは、Mixture-of-Experts(MoE)アーキテクチャを基盤とし、体現知能向けに特別に設計された世界初のオープンソース動画生成基盤モデル「LingBot-Video」をオープンソース化しました。 このモデルは、ロボットと具現化された知能の中核的なニーズに焦点を当てることで、動画の事前学習を再定義し、推論効率、物理的妥当性、行動理解、およびタスク達成において体系的な向上を実現しています。これにより、動画基盤モデルがデジタルコンテンツ制作の枠を超え、具現化された知能へと進化するための新たなオープンソース基盤を提供します。
北京大学とByteDanceが共同開発したRBenchベンチマークにおいて、LingBot-Videoは0.620のスコアを記録し、Wan2.6(0.607)、Seedance1.5Pro(0.584)、Cosmos3Super(0.581)を上回りました。 ロボットの操作動画に対する包括的な評価ベンチマークであるRBenchは、モデルが現実世界の物理法則に従ったロボットの挙動を生成できるかどうかを具体的に評価するものです。この結果は、LingBot-Videoがロボット関連の動画を生成する際、動作の合理性とタスク実行の整合性をよりよく維持できることを示しています。

(図のキャプション:LingBot-VideoはRBenchで最高の性能を達成)
物理世界における変化をモデル化するLingBot-Videoの能力をさらに検証するため、Ant Groupは、一般的な品質と具現化されたドメインという2つの次元にわたる社内ベンチマークを用いて評価を行った。 その結果、NVIDIA Cosmos3、Wan2.2A14B、LongCat-Video、Hunyuan Video1.5、LTX-2.3の5つのオープンソースモデルと比較して、LingBot-Videoは「具現化ドメイン」において主要なベースラインモデルを上回る性能を示した。

(図のキャプション:包括的な評価により、LingBot-Videoが具現化シナリオにおいて、より優れた物理的理解と動作の一貫性を示していることが明らかになった)
近年、動画生成モデルは、視覚的な品質、滑らかさ、創造的な表現において急速に進歩している。しかし、具現化された知能においては、見た目がリアルで滑らかに動く動画であっても、実際の物理法則を反映していない場合があり、ロボットによる継続的な予測、計画、タスク実行をサポートすることが困難となる。 同時に、具現化された知能には、リアルタイムの相互作用や制御ループに適応するための、より高い推論効率も求められます。
このことが、動画生成を2つの異なる道へと進化させる原動力となっています。1つはコンテンツ制作を目的とした映画分野への道、もう1つは物理世界への理解、予測、および相互作用を目的としたロボット分野への道です。LingBot-Videoは、身体化された知能に特化した動画生成の新たな道筋に向けた、Ant Groupによる重要な探求の成果です。
LingBot-Videoは、アーキテクチャ、データ、および学習において体系的な革新をもたらしています。
アーキテクチャの面では、LingBot-Video は DiT + MoE 設計を採用し、従来の密なアーキテクチャを MoE に置き換えています。これにより、推論コストを管理可能な範囲に抑えつつ、モデルの容量を拡張することが可能になります。 300億のパラメータを持つこのモデルは、生成時に約30億のみを活性化させるため、同規模の密なアーキテクチャに比べて推論効率が約3倍高くなります。この設計により、大規模なパラメータから視覚的な表現力を得つつ、具現化された知能が求める効率性の要件をより適切に満たすことができます。
データに関しては、LingBot-Videoはデータプロファイリングエンジンを構築し、膨大なインターネット動画に加え、VLA、VLN、Egoなどのロボット関連データを組み込みました。これにより、巧みな操作、ロボットの移動、一人称視点での相互作用などのシナリオを網羅し、合計7万時間分の体現データが収集されました。 このデータにより、モデルは動画の表面的な質感や視覚的スタイルだけでなく、行動と環境変化との関係を学習できるようになる。

学習において、LingBot-Videoは多次元強化学習報酬システムを導入した。美的評価、プロンプトの遵守、動作の一貫性といった従来の評価指標に加え、モデルは物理的な妥当性やタスクの完了度にも整合性を図ることで、生成結果を現実世界の物理法則とより整合させ、現実世界でタスクを実行するロボットのニーズにより近づけている。
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン





家






