LPM1.0モデルは、単一の画像からリアルタイムでインタラクティブなデジタルヒューマンビデオを生成します。

研究者たちは、単一の参照画像から人々が話したり聞いたり歌ったりする様子をリアルタイムで映像化することを目的としたLPM1.0モデルを正式に公開しました。このモデルの大きな突破口はマルチモーダル処理にあり、テキスト、音声、画像の入力を同期させることで、正確な唇の動きや微妙な表情、自然な感情の移行が表現されたダイナミックなシーンを生成します。このモデルはChatGPTやDoubaoといった主要な音声AIプラットフォームと直接連携し、従来の音声会話を視覚的フィードバックを伴うリアルタイムのインタラクティブ体験へと変えています。
技術的には、LPM1.0は「マルチグレインサイズのアイデンティティ条件付け」を用いて、さまざまな角度や表情から参照素材から詳細な特徴を抽出します。そのため、歯やしわ、側面の輪郭といった複雑な要素をモデルが独自に生成する必要がなくなります。これにより再学習なしで写実的な顔やアニメーション、3Dゲームキャラクターへの即時変換が可能となり、異なるスタイル間の処理能力が大幅に向上します。また、このモデルはストリーミング伝送にも対応しており、45分程度の長さの映像を生成してもシステムの安定性が保たれます。
インタラクションロジックに関しては、LPM1.0は会話の3つの状態を正確に検出します。聞いている間は頷きや視線の移動といった反応的な表情を生成し、話している間は音声に基づいて身体や唇の動きを制御し、アイドル状態ではテキストの指示に従って自然な休息時の行動を作り出します。プロジェクトマネージャーの曾艾玲氏によると、LPM1.0はリアルタイム会話だけでなく、オフラインで音声駆動型の映像生成にも適しており、ポッドキャストや映画制作において技術的な冗長性を提供するとのことです。
このモデルが持つ高い応用可能性にもかかわらず、開発チームはLPM1.0が依然として研究段階のプロジェクトであり、現時点ではコードや重みを公開する計画はないと強調しています。研究者たちは生成される映像と実際の映像との間に質的な差が存在し、ディープフェイク特有のリスクも無視できないと認めています。この研究の意義は、単一の論理的インタラクションから感情反応やアイコンタクト、視覚的表現を含む多次元的なインタラクションへとAIシステムが進化していく将来像を示した点にあります。
関連記事
韓国、国家AI計算センターの起工式を実施、2.5兆ウォンを投資し2028年の完成を目指す
韓国のアウトレッツ、EtNewsの報道によると、全羅南道順天のソラーシティデータセンターパークで、8月3日に韓国AI計算センター(KOACC)の起工式が行われた。総投資額2.5兆ウォン(約118億3800万元)を背景に、この施設は2028年の運用開始を目指しており、これまでに韓国がAIインフラに対して行った国家投資の中で最も大規模なものの一つとなっている。プロジェクトの株式配分は、政府と企業の深い連携を推進する戦略的な取り組みを示している。サムスンSDSが30%の株式を持つ最大株主として主導し
Linux財団を支援する6つのテックジャイアント、AI脆弱性のノイズに対処するために1,250万ドルを拠出
AI自動化ツールによって生成される低品質なセキュリティレポートの洪水に対処するため、Anthropic、Amazon(AWS)、GitHub、Google、Microsoft、OpenAIの6大テック企業が、Linux Foundationのイニシアチブに対して総額1250万ドルの資金を提供しました。この投資は、オープンソースソフトウェア(FOSS)のメンテナーが手動でのスクリーニングという負担から解放され、本格的なセキュリティ脅威に集中できることを目的としています。AI技術が脆弱性発見のハー
アルトマン証言の中で、マスクはOpenAIを子供たちに譲ることを検討した
今朝、OpenAIのCEOサム・アルトマン氏は、同社の企業構造に異議を唱える元共同創設者エロン・マスク氏の訴訟に対応するため証言台に立った。「営利子会社を設立してAI搭載製品を市場に出すことで、他の創設者たちが『慈善団体を盗んだ』」というマスク氏の主張について問われると、アルトマン氏は明らかなためらいを示して応答した。「その枠組みを処理するのは難しい」と、アルトマン氏は一時の間を置いて語った。「私たちは世界最大の慈善団体の一つを設立した。財団は素晴らしい活動を行っており、今後もさらに多くのこ
関連特集おすすめ
コメント (0)
0/500

研究者たちは、単一の参照画像から人々が話したり聞いたり歌ったりする様子をリアルタイムで映像化することを目的としたLPM1.0モデルを正式に公開しました。このモデルの大きな突破口はマルチモーダル処理にあり、テキスト、音声、画像の入力を同期させることで、正確な唇の動きや微妙な表情、自然な感情の移行が表現されたダイナミックなシーンを生成します。このモデルはChatGPTやDoubaoといった主要な音声AIプラットフォームと直接連携し、従来の音声会話を視覚的フィードバックを伴うリアルタイムのインタラクティブ体験へと変えています。
技術的には、LPM1.0は「マルチグレインサイズのアイデンティティ条件付け」を用いて、さまざまな角度や表情から参照素材から詳細な特徴を抽出します。そのため、歯やしわ、側面の輪郭といった複雑な要素をモデルが独自に生成する必要がなくなります。これにより再学習なしで写実的な顔やアニメーション、3Dゲームキャラクターへの即時変換が可能となり、異なるスタイル間の処理能力が大幅に向上します。また、このモデルはストリーミング伝送にも対応しており、45分程度の長さの映像を生成してもシステムの安定性が保たれます。
インタラクションロジックに関しては、LPM1.0は会話の3つの状態を正確に検出します。聞いている間は頷きや視線の移動といった反応的な表情を生成し、話している間は音声に基づいて身体や唇の動きを制御し、アイドル状態ではテキストの指示に従って自然な休息時の行動を作り出します。プロジェクトマネージャーの曾艾玲氏によると、LPM1.0はリアルタイム会話だけでなく、オフラインで音声駆動型の映像生成にも適しており、ポッドキャストや映画制作において技術的な冗長性を提供するとのことです。
このモデルが持つ高い応用可能性にもかかわらず、開発チームはLPM1.0が依然として研究段階のプロジェクトであり、現時点ではコードや重みを公開する計画はないと強調しています。研究者たちは生成される映像と実際の映像との間に質的な差が存在し、ディープフェイク特有のリスクも無視できないと認めています。この研究の意義は、単一の論理的インタラクションから感情反応やアイコンタクト、視覚的表現を含む多次元的なインタラクションへとAIシステムが進化していく将来像を示した点にあります。
韓国、国家AI計算センターの起工式を実施、2.5兆ウォンを投資し2028年の完成を目指す
韓国のアウトレッツ、EtNewsの報道によると、全羅南道順天のソラーシティデータセンターパークで、8月3日に韓国AI計算センター(KOACC)の起工式が行われた。総投資額2.5兆ウォン(約118億3800万元)を背景に、この施設は2028年の運用開始を目指しており、これまでに韓国がAIインフラに対して行った国家投資の中で最も大規模なものの一つとなっている。プロジェクトの株式配分は、政府と企業の深い連携を推進する戦略的な取り組みを示している。サムスンSDSが30%の株式を持つ最大株主として主導し
Linux財団を支援する6つのテックジャイアント、AI脆弱性のノイズに対処するために1,250万ドルを拠出
AI自動化ツールによって生成される低品質なセキュリティレポートの洪水に対処するため、Anthropic、Amazon(AWS)、GitHub、Google、Microsoft、OpenAIの6大テック企業が、Linux Foundationのイニシアチブに対して総額1250万ドルの資金を提供しました。この投資は、オープンソースソフトウェア(FOSS)のメンテナーが手動でのスクリーニングという負担から解放され、本格的なセキュリティ脅威に集中できることを目的としています。AI技術が脆弱性発見のハー
アルトマン証言の中で、マスクはOpenAIを子供たちに譲ることを検討した
今朝、OpenAIのCEOサム・アルトマン氏は、同社の企業構造に異議を唱える元共同創設者エロン・マスク氏の訴訟に対応するため証言台に立った。「営利子会社を設立してAI搭載製品を市場に出すことで、他の創設者たちが『慈善団体を盗んだ』」というマスク氏の主張について問われると、アルトマン氏は明らかなためらいを示して応答した。「その枠組みを処理するのは難しい」と、アルトマン氏は一時の間を置いて語った。「私たちは世界最大の慈善団体の一つを設立した。財団は素晴らしい活動を行っており、今後もさらに多くのこ





家






