美団(Meituan)、視覚と音声のアーキテクチャを統合したAIモデル「LongCat-Next」を発表

4月3日、MiTiチームはネイティブ型マルチモーダル大規模モデル「LongCat-Next」を正式にリリースしました。このモデルは、画像、音声、テキストを統一された離散トークンのストリームに変換することで、従来の「言語基盤+プラグイン」というアプローチを超越しています。これにより、AIは物理世界をネイティブに「見る」ことや「聞く」ことが可能となり、テキストと同様にこれらの入力を処理できるようになります。
技術的核:DiNAアーキテクチャが実現する「モダリティの内部化」
異なるデータタイプ間の障壁を取り除くため、MiTiはDiNA(Discrete Native Autoregressive)アーキテクチャを開発し、マルチモーダルモデリングにおける深い統合を実現しました:
完全なモダリティ統合:このモデルは、テキスト、画像、音声に対して同一のパラメータ、アテンション機構、損失関数を使用します。
理解と生成の対称性:単一の数学的枠組みにおいて、次のテキストトークンの予測は「理解」を構成し、画像トークンの予測は「生成」を構成します。両プロセスは、トレーニング中に著しい相乗効果を発揮します。
極端な圧縮:dNaViTビジュアルトークナイザーを活用し、あらゆる解像度の入力を処理します。8層の残差ベクトル量子化プロセスを通じて、OCRや金融文書分析などのタスクに必要な重要な詳細情報を保持しつつ、ピクセル空間で最大28倍の圧縮を実現します。
実証的な性能:離散モデリングに固有の限界はない
LongCat-Nextは、複数のベンチマークにおいて専用モデルを上回る性能を発揮し、「離散化は必然的に情報損失を招く」という従来の通念に効果的に異議を唱えています:
きめ細かな認識:高密度テキストシナリオ向けのOmniDocBenchにおいて、Qwen3-Omniだけでなく、専門のビジョンモデルであるQwen3-VLをも上回る性能を発揮しました。
視覚的推論:MathVistaで83.1という高いスコアを記録し、堅牢で産業レベルの論理的推論能力を実証しました。
クロスモーダル連携:最先端の言語能力(C-Eval 86.80)を維持しつつ、テキストと音声の低遅延並列生成に加え、カスタマイズ可能なボイスクローニングをサポートします。
業界インサイト:実世界AIの基盤
大規模言語モデルは、長らくテキスト中心でした。LongCat-Nextの画期的な点は、物理世界の情報も言語と同様に離散化・モデル化できることを実証したことです。AIが統一された「ネイティブ言語」を保有すれば、ツールの使用、コードの記述、複雑な図表の解釈において、より知的かつ直感的な動作が可能になります。
MiTiは現在、LongCat-NextモデルとdNaViTトークナイザーをオープンソース化しています。この効率的で可能性に満ちたネイティブ離散アーキテクチャは、現実世界を認識し、それと対話できるAIを構築するために、開発者に不可欠なツールを提供します。
関連記事
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日、AIアプリケーション開発プラットフォームのLovableは、デンマークのハードウェアスタートアップであるAtechの80万ドルのシード資金調達ラウンドへの参加を発表した。Lovableがリードするこのラウンドには、a16zスカウトファンド、シークイアスカウトファンド、Nordic Makersなど、トップクラスのベンチャーキャピタル企業が参加した。この投資は、Lovableが「Vibeコーディング」の概念を純粋なソフトウェア開発からハードウェアエンジニアリングの領域へと戦略
Anthropic、ClaudeのAIコーディングツールを日本に拡大し、海外成長を促進
Anthropic、米国の主要な人工知能企業は、グローバルな展開を強化している。水曜日、同社は東京で「Code with Claude」と題された大規模な開発者向けイベントを開催し、約500人のソフトウェアエンジニアが集まった。この取り組みは、Claude AIツールおよび関連製品を日本市場に積極的に導入することを目的としており、自律的なコーディング機能による企業生産性の向上という中核的な利点を強調している。自動化されたコード生成への重点本イベントにおいて、Anthropicは複雑なプログラ
インドのソフトウェア大手が採用を縮小し、AI エージェントの拡大に伴い解雇はないと約束
人工知能が従来の労働集約型ビジネスモデルを再構築する中、インドを代表するソフトウェアアウトソーシング企業であるタタ・コンサルテーション・サービスズ(TCS)は、その戦略的対応を明らかにしました。火曜日の定時株主総会において、会長は人間と機械の協働に関するビジョンを提示し、AI時代における同社の workforce 戦略を明確にしました。人員整理は行わないが、採用は鈍化TCSの会長は、AI導入により人員整理を行う計画はないものの、全体的な採用ペースは鈍化すると明確に述べました。TCSは以前、1
関連特集おすすめ
コメント (1)
0/500
Interesting approach! Unifying vision and speech into a single stream sounds like a step towards more 'native' multimodal understanding, unlike just bolting on separate modules. Makes me wonder how this affects real-time processing efficiency for delivery robots or AR navigation apps. Could be a game-changer for Meituan's on-demand services if it works smoothly in the wild. 🧐

4月3日、MiTiチームはネイティブ型マルチモーダル大規模モデル「LongCat-Next」を正式にリリースしました。このモデルは、画像、音声、テキストを統一された離散トークンのストリームに変換することで、従来の「言語基盤+プラグイン」というアプローチを超越しています。これにより、AIは物理世界をネイティブに「見る」ことや「聞く」ことが可能となり、テキストと同様にこれらの入力を処理できるようになります。
技術的核:DiNAアーキテクチャが実現する「モダリティの内部化」
異なるデータタイプ間の障壁を取り除くため、MiTiはDiNA(Discrete Native Autoregressive)アーキテクチャを開発し、マルチモーダルモデリングにおける深い統合を実現しました:
完全なモダリティ統合:このモデルは、テキスト、画像、音声に対して同一のパラメータ、アテンション機構、損失関数を使用します。
理解と生成の対称性:単一の数学的枠組みにおいて、次のテキストトークンの予測は「理解」を構成し、画像トークンの予測は「生成」を構成します。両プロセスは、トレーニング中に著しい相乗効果を発揮します。
極端な圧縮:dNaViTビジュアルトークナイザーを活用し、あらゆる解像度の入力を処理します。8層の残差ベクトル量子化プロセスを通じて、OCRや金融文書分析などのタスクに必要な重要な詳細情報を保持しつつ、ピクセル空間で最大28倍の圧縮を実現します。
実証的な性能:離散モデリングに固有の限界はない
LongCat-Nextは、複数のベンチマークにおいて専用モデルを上回る性能を発揮し、「離散化は必然的に情報損失を招く」という従来の通念に効果的に異議を唱えています:
きめ細かな認識:高密度テキストシナリオ向けのOmniDocBenchにおいて、Qwen3-Omniだけでなく、専門のビジョンモデルであるQwen3-VLをも上回る性能を発揮しました。
視覚的推論:MathVistaで83.1という高いスコアを記録し、堅牢で産業レベルの論理的推論能力を実証しました。
クロスモーダル連携:最先端の言語能力(C-Eval 86.80)を維持しつつ、テキストと音声の低遅延並列生成に加え、カスタマイズ可能なボイスクローニングをサポートします。
業界インサイト:実世界AIの基盤
大規模言語モデルは、長らくテキスト中心でした。LongCat-Nextの画期的な点は、物理世界の情報も言語と同様に離散化・モデル化できることを実証したことです。AIが統一された「ネイティブ言語」を保有すれば、ツールの使用、コードの記述、複雑な図表の解釈において、より知的かつ直感的な動作が可能になります。
MiTiは現在、LongCat-NextモデルとdNaViTトークナイザーをオープンソース化しています。この効率的で可能性に満ちたネイティブ離散アーキテクチャは、現実世界を認識し、それと対話できるAIを構築するために、開発者に不可欠なツールを提供します。
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日、AIアプリケーション開発プラットフォームのLovableは、デンマークのハードウェアスタートアップであるAtechの80万ドルのシード資金調達ラウンドへの参加を発表した。Lovableがリードするこのラウンドには、a16zスカウトファンド、シークイアスカウトファンド、Nordic Makersなど、トップクラスのベンチャーキャピタル企業が参加した。この投資は、Lovableが「Vibeコーディング」の概念を純粋なソフトウェア開発からハードウェアエンジニアリングの領域へと戦略
Anthropic、ClaudeのAIコーディングツールを日本に拡大し、海外成長を促進
Anthropic、米国の主要な人工知能企業は、グローバルな展開を強化している。水曜日、同社は東京で「Code with Claude」と題された大規模な開発者向けイベントを開催し、約500人のソフトウェアエンジニアが集まった。この取り組みは、Claude AIツールおよび関連製品を日本市場に積極的に導入することを目的としており、自律的なコーディング機能による企業生産性の向上という中核的な利点を強調している。自動化されたコード生成への重点本イベントにおいて、Anthropicは複雑なプログラ
インドのソフトウェア大手が採用を縮小し、AI エージェントの拡大に伴い解雇はないと約束
人工知能が従来の労働集約型ビジネスモデルを再構築する中、インドを代表するソフトウェアアウトソーシング企業であるタタ・コンサルテーション・サービスズ(TCS)は、その戦略的対応を明らかにしました。火曜日の定時株主総会において、会長は人間と機械の協働に関するビジョンを提示し、AI時代における同社の workforce 戦略を明確にしました。人員整理は行わないが、採用は鈍化TCSの会長は、AI導入により人員整理を行う計画はないものの、全体的な採用ペースは鈍化すると明確に述べました。TCSは以前、1
Interesting approach! Unifying vision and speech into a single stream sounds like a step towards more 'native' multimodal understanding, unlike just bolting on separate modules. Makes me wonder how this affects real-time processing efficiency for delivery robots or AR navigation apps. Could be a game-changer for Meituan's on-demand services if it works smoothly in the wild. 🧐





家






