Googleは、ネイティブなコンピュータ操作をGemini 3.5 Flashに統合することで、マルチモーダル切り替えの障壁を打ち破った。

Google DeepMindチームは、Gemini 3.5 Flashモデルにコンピュータ操作機能を直接統合するという大きなブレークスルーを発表しました。開発者はこれにより、単一のモデルを使用して、ブラウザ、モバイルデバイス、デスクトップ上の画面を自律的に閲覧し、操作を行うAIエージェントを構築できるようになります。
これまではこの機能は別途用意されたモデルとしてのみ利用可能で、開発者は異なるモデル間での複雑な切り替えやコンテキストの移行を自ら処理する必要がありました。しかしネイティブ統合により、長時間にわたるクロスプラットフォームタスクを実行する際にAIが手動で情報を渡す必要がなくなり、開発プロセスが大幅に簡素化されます。
コンテキストの損失を排除し、エージェントの信頼性を向上させる
Googleのチームは、AIエージェントの核心的なボトルネックは個々のツールの制約ではなく、複数のツール間で切り替える際に生じるコンテキスト情報の損失だと考えています。検索機能、地図機能、コンピュータ操作を単一のモデルアーキテクチャ内で統合することで、コンテキストが継続的に流れるようになり、複雑なタスクでの失敗リスクが大幅に低減されます。
この「マルチツール統合」の設計は、内部で接続された単一の建物を構築することに例えられ、別々の建物間で行われる時間のかかる上にエラーが発生しやすい通信を不要にします。このアーキテクチャ上の変更により、エージェントベースのタスクの信頼性や応答遅延が大幅に向上する可能性があります。
複数層のセキュリティ対策を備えた3つの主要なシナリオへの焦点
このネイティブ機能は主に、数時間から数日間にわたって連続して動作する必要がある自動化タスク、UIの一貫性を自動的に確認するための継続的なソフトウェアテスト、複数のアプリケーションにまたがる知識集約型の作業といった3つの主要なシナリオで活用されます。これらのシナリオはタスク間でのコンテキストの連続性に大きく依存しており、繰り返し作業や負荷の高い業務を人間に代わって効果的にこなすことが可能です。
セキュリティ面では、Googleはターゲットを絞った敵対的トレーニング、機密性の高い処理向けの企業向けセキュリティ対策、間接的なプロンプト注入検出など、複数層にわたる防御戦略を採用しています。これらの仕組みが一体となって、オープンで管理されていないコンピュータ環境においても企業ユーザーが比較的完全なセキュリティ境界を構築するのに役立ちます。
関連記事
中国、大規模モデルとIPv6の特別キャンペーンを開始:生成AIアプリケーションは次世代ネットワークの完全な採用が義務付けられる
雄安新区で、知能時代に向けたネットワークインフラのアップグレードに関する主要なイニシアチブの第一段階が正式に開始された。中国国家インターネット情報弁公室(CAC)は、北京、上海、浙江、深圳の地域インターネット情報弁公室および5つの主要な大規模モデル開発企業と連携し、「人工知能大規模モデルIPv6機能強化特別行動」を立ち上げた。この協調的な取り組みは、生成系大規模モデルアプリケーションに対するIPv6の包括的なサポートを確保し、未来の知能のための堅牢なネットワーク基盤を構築することを目的としている
グローバルなAI規制は、リリース前の必須テストへ移行する
大規模なAIモデルの急速な進展に伴い、世界の規制枠組みは自主的なガイドラインから政府主導のエビデンスに基づく義務付けへと移行している。この移行は、実用的なAI規制の新時代の到来を告げるものである。1. 新しい基準:誰がAIモデルを監査するのか?以前、開発者は内部のレッドチーム演習や自己公開されたセキュリティレポートに依存していた。この自己評価アプローチは、もはや国家安全保障の要件を満たすものではない。この移行を牽引しているのは、英国のAIセキュリティ研究所(AISI)と米国商務省のAI基準
アリババの馬雲、曹興信:AIは目に見えないインフラとなり、知識労働者のTAMは50兆ドルに達する
アリババグループ会長のジャック・マー氏は、イタリアのテクノロジーおよび投資サミット「Wave by Vento 2026」で最近講演を行い、人工知能(AI)が今後5年以内に個別の話題から各業界に組み込まれたインフラへと移行すると予測した。マー氏は、現在のAIは時間節約において優れているものの、私たちが時間を過ごす方法を向上させる可能性はほとんど活用されていないと指摘した。彼は、知識労働者の生産性向上が最も実現可能な応用分野であると特定し、総可能市場規模は50兆ドルに達すると見積もった。さらに、
関連特集おすすめ
コメント (0)
0/500

Google DeepMindチームは、Gemini 3.5 Flashモデルにコンピュータ操作機能を直接統合するという大きなブレークスルーを発表しました。開発者はこれにより、単一のモデルを使用して、ブラウザ、モバイルデバイス、デスクトップ上の画面を自律的に閲覧し、操作を行うAIエージェントを構築できるようになります。
これまではこの機能は別途用意されたモデルとしてのみ利用可能で、開発者は異なるモデル間での複雑な切り替えやコンテキストの移行を自ら処理する必要がありました。しかしネイティブ統合により、長時間にわたるクロスプラットフォームタスクを実行する際にAIが手動で情報を渡す必要がなくなり、開発プロセスが大幅に簡素化されます。
コンテキストの損失を排除し、エージェントの信頼性を向上させる
Googleのチームは、AIエージェントの核心的なボトルネックは個々のツールの制約ではなく、複数のツール間で切り替える際に生じるコンテキスト情報の損失だと考えています。検索機能、地図機能、コンピュータ操作を単一のモデルアーキテクチャ内で統合することで、コンテキストが継続的に流れるようになり、複雑なタスクでの失敗リスクが大幅に低減されます。
この「マルチツール統合」の設計は、内部で接続された単一の建物を構築することに例えられ、別々の建物間で行われる時間のかかる上にエラーが発生しやすい通信を不要にします。このアーキテクチャ上の変更により、エージェントベースのタスクの信頼性や応答遅延が大幅に向上する可能性があります。
複数層のセキュリティ対策を備えた3つの主要なシナリオへの焦点
このネイティブ機能は主に、数時間から数日間にわたって連続して動作する必要がある自動化タスク、UIの一貫性を自動的に確認するための継続的なソフトウェアテスト、複数のアプリケーションにまたがる知識集約型の作業といった3つの主要なシナリオで活用されます。これらのシナリオはタスク間でのコンテキストの連続性に大きく依存しており、繰り返し作業や負荷の高い業務を人間に代わって効果的にこなすことが可能です。
セキュリティ面では、Googleはターゲットを絞った敵対的トレーニング、機密性の高い処理向けの企業向けセキュリティ対策、間接的なプロンプト注入検出など、複数層にわたる防御戦略を採用しています。これらの仕組みが一体となって、オープンで管理されていないコンピュータ環境においても企業ユーザーが比較的完全なセキュリティ境界を構築するのに役立ちます。
中国、大規模モデルとIPv6の特別キャンペーンを開始:生成AIアプリケーションは次世代ネットワークの完全な採用が義務付けられる
雄安新区で、知能時代に向けたネットワークインフラのアップグレードに関する主要なイニシアチブの第一段階が正式に開始された。中国国家インターネット情報弁公室(CAC)は、北京、上海、浙江、深圳の地域インターネット情報弁公室および5つの主要な大規模モデル開発企業と連携し、「人工知能大規模モデルIPv6機能強化特別行動」を立ち上げた。この協調的な取り組みは、生成系大規模モデルアプリケーションに対するIPv6の包括的なサポートを確保し、未来の知能のための堅牢なネットワーク基盤を構築することを目的としている
グローバルなAI規制は、リリース前の必須テストへ移行する
大規模なAIモデルの急速な進展に伴い、世界の規制枠組みは自主的なガイドラインから政府主導のエビデンスに基づく義務付けへと移行している。この移行は、実用的なAI規制の新時代の到来を告げるものである。1. 新しい基準:誰がAIモデルを監査するのか?以前、開発者は内部のレッドチーム演習や自己公開されたセキュリティレポートに依存していた。この自己評価アプローチは、もはや国家安全保障の要件を満たすものではない。この移行を牽引しているのは、英国のAIセキュリティ研究所(AISI)と米国商務省のAI基準
アリババの馬雲、曹興信:AIは目に見えないインフラとなり、知識労働者のTAMは50兆ドルに達する
アリババグループ会長のジャック・マー氏は、イタリアのテクノロジーおよび投資サミット「Wave by Vento 2026」で最近講演を行い、人工知能(AI)が今後5年以内に個別の話題から各業界に組み込まれたインフラへと移行すると予測した。マー氏は、現在のAIは時間節約において優れているものの、私たちが時間を過ごす方法を向上させる可能性はほとんど活用されていないと指摘した。彼は、知識労働者の生産性向上が最も実現可能な応用分野であると特定し、総可能市場規模は50兆ドルに達すると見積もった。さらに、





家






