Google DeepMindのTIPSv2:画像を「一瞥する」だけでなく、真に理解するAI
現在のAIによる画像理解には、根本的な限界があります。
「この写真には何が写っていますか?」と尋ねれば、詳細な回答が得られます。しかし、「パンダの左後ろ足はどこにありますか?」と尋ねると、曖昧な回答になってしまいます。これは特定のモデルの欠陥ではなく、視覚言語大規模モデル分野全体に共通する根深い課題、すなわち「全体的な理解力は高いが、局所的な位置特定能力は低い」という問題です。
Google DeepMindは最新の論文で、この難題に対処するために特別に設計された「TIPSv2」を発表した。

研究チームは、直感に反する発見をしました。それは、きめ細かいセグメンテーションタスクにおいて、小型の「生徒」モデルが大型の「教師」モデルよりも優れた性能を発揮することが頻繁にあるということです。これは、ディスティレーション(知識の蒸留)によってマスキング機構が取り除かれ、モデルが画像全体の細部まで学習することを余儀なくされるためであり、一種の「全領域監督」が生まれるからです。この知見に基づき、TIPSv2では3つの重要な改良が導入されました。
第一に、iBOT++です。従来の事前学習では、マスクされた領域に対してのみ損失を計算するため、可視領域は放置された状態となり、局所的な意味論がずれてしまいます。iBOT++では、モデルがすべての可視領域に対して正確な監督を行うことを要求し、タスクを「パズルゲーム」から「テキスト全体を注意深く読むこと」へと効果的に昇華させます。この単一の改善により、ゼロショットセグメンテーションの性能が14.1ポイント向上しました。
第二に、Head-only EMAです。従来の自己教師付き学習では、ほぼ同一の2つの大規模モデルをメモリに保持する必要があり、リソースを大量に消費します。TIPSv2は、画像-テキスト対比損失だけでバックボーンネットワークを安定化できることを発見しました。そのため、EMAは最終的な投影ヘッドにのみ適用すればよく、バックボーンを複製する必要がなくなります。これにより、学習パラメータ数が約42%削減され、性能の低下をほとんど伴わずに高速化が実現しました。
第三に、多粒度テキストペアリングです。トレーニング中、Geminiによって生成された短いWeb説明文、中程度の詳細説明文、および長い説明文をランダムに混合し、モデルに入力します。これにより、易しいタスクと難しいタスクを交互に処理します。これにより、モデルが単純なタスクで手を抜くことを防ぎつつ、詳細が見落とされることもありません。
最終的な結果は極めて説得力のあるものです。TIPSv2は、9つのタスクと20の権威あるデータセットにおいてフローズン評価を受けました。ゼロショットセマンティックセグメンテーションでは業界の新たなベンチマークを達成し、画像テキスト検索および分類では、パラメータ数が56%多い比較モデルを上回る性能を示しました。純粋な視覚タスクにおいても、トップクラスの性能を発揮しました。
TIPSv2のコードとモデル重みは完全にオープンソース化されています。医療画像、自動運転、産業用検査、および高精度な画像理解が求められるその他の分野に取り組むチームにとって、このソリューションは注目に値するものです。
論文:https://www.alphaxiv.org/abs/2604.12012
関連記事
インドのテック億万長者がマイクロソフトOfficeの競合他社に3,000万ドルを投資
直営企業家であるBhavin Turakhiaは、自身の資金から3,000万ドルを投資しており、エンタープライズAI分野にはまだ新規参入者の余地があると見なしている。彼の最新スタートアップ「Neo」は、以下の核心的な信念に基づいて運営されている:既存の職場用ソフトウェアをチャットボットで単純に補完するだけでは不十分であり、完全なアーキテクチャの再設計が必要である。46歳のTurakhia氏は、野心のあるエンタープライズテック企業への支援の歴史を持つ。過去20年間、彼はDirecti、Radix
元OpenAIのチーフサイエンティストであるイリヤによるSSIが初のモデルを公開
AIは新たな主要なマイルストーンを達成した。OpenAIを去った後、元チーフサイエンティストのイリヤ・スツケルはSafe Superintelligence Inc.(SSI)を設立し、同社は最近、初代モデルに関する詳細を明らかにした。海外のソーシャルメディアからの報告によれば、チームはTTT(Testing While Training)を活用したコンパクトな推論エンジンを開発中であり、これは安全なスーパーインテリジェンス追求における重要な進展である。この新しいアーキテクチャは、モデルが「学
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日、AIアプリケーション開発プラットフォームのLovableは、デンマークのハードウェアスタートアップであるAtechの80万ドルのシード資金調達ラウンドへの参加を発表した。Lovableがリードするこのラウンドには、a16zスカウトファンド、シークイアスカウトファンド、Nordic Makersなど、トップクラスのベンチャーキャピタル企業が参加した。この投資は、Lovableが「Vibeコーディング」の概念を純粋なソフトウェア開発からハードウェアエンジニアリングの領域へと戦略
関連特集おすすめ
コメント (0)
0/500
現在のAIによる画像理解には、根本的な限界があります。
「この写真には何が写っていますか?」と尋ねれば、詳細な回答が得られます。しかし、「パンダの左後ろ足はどこにありますか?」と尋ねると、曖昧な回答になってしまいます。これは特定のモデルの欠陥ではなく、視覚言語大規模モデル分野全体に共通する根深い課題、すなわち「全体的な理解力は高いが、局所的な位置特定能力は低い」という問題です。
Google DeepMindは最新の論文で、この難題に対処するために特別に設計された「TIPSv2」を発表した。

研究チームは、直感に反する発見をしました。それは、きめ細かいセグメンテーションタスクにおいて、小型の「生徒」モデルが大型の「教師」モデルよりも優れた性能を発揮することが頻繁にあるということです。これは、ディスティレーション(知識の蒸留)によってマスキング機構が取り除かれ、モデルが画像全体の細部まで学習することを余儀なくされるためであり、一種の「全領域監督」が生まれるからです。この知見に基づき、TIPSv2では3つの重要な改良が導入されました。
第一に、iBOT++です。従来の事前学習では、マスクされた領域に対してのみ損失を計算するため、可視領域は放置された状態となり、局所的な意味論がずれてしまいます。iBOT++では、モデルがすべての可視領域に対して正確な監督を行うことを要求し、タスクを「パズルゲーム」から「テキスト全体を注意深く読むこと」へと効果的に昇華させます。この単一の改善により、ゼロショットセグメンテーションの性能が14.1ポイント向上しました。
第二に、Head-only EMAです。従来の自己教師付き学習では、ほぼ同一の2つの大規模モデルをメモリに保持する必要があり、リソースを大量に消費します。TIPSv2は、画像-テキスト対比損失だけでバックボーンネットワークを安定化できることを発見しました。そのため、EMAは最終的な投影ヘッドにのみ適用すればよく、バックボーンを複製する必要がなくなります。これにより、学習パラメータ数が約42%削減され、性能の低下をほとんど伴わずに高速化が実現しました。
第三に、多粒度テキストペアリングです。トレーニング中、Geminiによって生成された短いWeb説明文、中程度の詳細説明文、および長い説明文をランダムに混合し、モデルに入力します。これにより、易しいタスクと難しいタスクを交互に処理します。これにより、モデルが単純なタスクで手を抜くことを防ぎつつ、詳細が見落とされることもありません。
最終的な結果は極めて説得力のあるものです。TIPSv2は、9つのタスクと20の権威あるデータセットにおいてフローズン評価を受けました。ゼロショットセマンティックセグメンテーションでは業界の新たなベンチマークを達成し、画像テキスト検索および分類では、パラメータ数が56%多い比較モデルを上回る性能を示しました。純粋な視覚タスクにおいても、トップクラスの性能を発揮しました。
TIPSv2のコードとモデル重みは完全にオープンソース化されています。医療画像、自動運転、産業用検査、および高精度な画像理解が求められるその他の分野に取り組むチームにとって、このソリューションは注目に値するものです。
論文:https://www.alphaxiv.org/abs/2604.12012
インドのテック億万長者がマイクロソフトOfficeの競合他社に3,000万ドルを投資
直営企業家であるBhavin Turakhiaは、自身の資金から3,000万ドルを投資しており、エンタープライズAI分野にはまだ新規参入者の余地があると見なしている。彼の最新スタートアップ「Neo」は、以下の核心的な信念に基づいて運営されている:既存の職場用ソフトウェアをチャットボットで単純に補完するだけでは不十分であり、完全なアーキテクチャの再設計が必要である。46歳のTurakhia氏は、野心のあるエンタープライズテック企業への支援の歴史を持つ。過去20年間、彼はDirecti、Radix
元OpenAIのチーフサイエンティストであるイリヤによるSSIが初のモデルを公開
AIは新たな主要なマイルストーンを達成した。OpenAIを去った後、元チーフサイエンティストのイリヤ・スツケルはSafe Superintelligence Inc.(SSI)を設立し、同社は最近、初代モデルに関する詳細を明らかにした。海外のソーシャルメディアからの報告によれば、チームはTTT(Testing While Training)を活用したコンパクトな推論エンジンを開発中であり、これは安全なスーパーインテリジェンス追求における重要な進展である。この新しいアーキテクチャは、モデルが「学
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日、AIアプリケーション開発プラットフォームのLovableは、デンマークのハードウェアスタートアップであるAtechの80万ドルのシード資金調達ラウンドへの参加を発表した。Lovableがリードするこのラウンドには、a16zスカウトファンド、シークイアスカウトファンド、Nordic Makersなど、トップクラスのベンチャーキャピタル企業が参加した。この投資は、Lovableが「Vibeコーディング」の概念を純粋なソフトウェア開発からハードウェアエンジニアリングの領域へと戦略





家






