Дом
Google преодолевает барьер мультимодального переключения, объединяя стандартные операции компьютера в модель Gemini 3.5 Flash.

Команда Google DeepMind объявила о значительном прорыве, позволяющем непосредственно встроить функции работы с компьютером в модель Gemini 3.5 Flash. Теперь разработчики могут создавать ИИ-агентов, способных автономно просматривать содержимое экранов и выполнять действия на них в браузерах, мобильных устройствах и настольных ПК с использованием одной и той же модели.
Ранее такая возможность была доступна только в виде отдельной модели, что требовало от разработчиков решения сложных задач по переключению между различными моделями и передаче контекста. Благодаря нативному интегрированию ИИ больше не нуждается в ручной передаче информации при выполнении длительных задач, работающих на разных платформах, что значительно упрощает процесс разработки.
Устранение потери контекста для повышения надежности агентов
Команда Google считает, что основным барьером для ИИ-агентов является не ограниченность отдельных инструментов, а потеря информации о контексте при переключении между различными инструментами. Объединив поиск, карты и операции с компьютером в единую архитектуру модели, удается обеспечить непрерывный поток контекста, что существенно снижает вероятность сбоев при выполнении сложных задач.
Такой подход к «интеграции нескольких инструментов» аналогичен строительству единого здания с внутренними соединениями, что исключает длительную и ошибочную коммуникацию между отдельными зданиями. Такая архитектурная трансформация способна привести к значительному улучшению надежности и скорости реагирования задач, основанных на использовании агентов.
Фокус на трех ключевых сценариях с многоуровневыми мерами безопасности
Эта нативная функция будет в первую очередь применяться в трех основных сценариях: автоматизированные задачи, требующие непрерывной работы в течение часов или дней, постоянные тесты программного обеспечения для проверки единообразия интерфейса, а также работа, требующая больших знаний и выполняемая в нескольких приложениях. Во всех этих случаях критически важна непрерывность контекста между задачами, что позволяет эффективно заменять людей при выполнении повторяющихся и трудоемких операций.
Что касается безопасности, Google применила многоуровневую стратегию защиты, включающую целенаправленное обучение на противоречивых данных, меры безопасности для конфиденциальных операций и выявление косвенного внедрения команд. Все эти механизмы в совокупности помогают корпоративным пользователям создать относительно полную защиту в открытых и неконтролируемых компьютерных средах.
Связанная статья
Китай запускает специальную кампанию по развитию больших моделей и IPv6: приложения на основе генеративного искусственного интеллекта должны будут полностью поддерживать сеть нового поколения
В Новом районе Сюнган официально стартовал первый этап масштабной инициативы по модернизации сетевой инфраструктуры для эры интеллектуальных технологий. Киберпространственное управление Китая (CAC) совместно с региональными органами по делам киберпро
Глобальное регулирование ИИ переходит к обязательному тестированию до выпуска
По мере стремительного развития крупных моделей искусственного интеллекта глобальные нормативные рамки смещаются от добровольных руководящих принципов к государственным предписаниям, основанным на доказательствах. Этот переход сигнализирует о наступл
Джек Ма и Цао Синсин из Alibaba: ИИ станет невидимой инфраструктурой, объем рынка знаний работников достигнет 50 триллионов долларов
Председатель Alibaba Group Джек Ма недавно выступил на итальянском технологическом и инвестиционном саммите Wave by Vento 2026, предсказав, что искусственный интеллект в течение пяти лет перейдет от статуса отдельной темы к встроенной инфраструктуре
Рекомендации по связанным специальным темам
Комментарии (0)

Команда Google DeepMind объявила о значительном прорыве, позволяющем непосредственно встроить функции работы с компьютером в модель Gemini 3.5 Flash. Теперь разработчики могут создавать ИИ-агентов, способных автономно просматривать содержимое экранов и выполнять действия на них в браузерах, мобильных устройствах и настольных ПК с использованием одной и той же модели.
Ранее такая возможность была доступна только в виде отдельной модели, что требовало от разработчиков решения сложных задач по переключению между различными моделями и передаче контекста. Благодаря нативному интегрированию ИИ больше не нуждается в ручной передаче информации при выполнении длительных задач, работающих на разных платформах, что значительно упрощает процесс разработки.
Устранение потери контекста для повышения надежности агентов
Команда Google считает, что основным барьером для ИИ-агентов является не ограниченность отдельных инструментов, а потеря информации о контексте при переключении между различными инструментами. Объединив поиск, карты и операции с компьютером в единую архитектуру модели, удается обеспечить непрерывный поток контекста, что существенно снижает вероятность сбоев при выполнении сложных задач.
Такой подход к «интеграции нескольких инструментов» аналогичен строительству единого здания с внутренними соединениями, что исключает длительную и ошибочную коммуникацию между отдельными зданиями. Такая архитектурная трансформация способна привести к значительному улучшению надежности и скорости реагирования задач, основанных на использовании агентов.
Фокус на трех ключевых сценариях с многоуровневыми мерами безопасности
Эта нативная функция будет в первую очередь применяться в трех основных сценариях: автоматизированные задачи, требующие непрерывной работы в течение часов или дней, постоянные тесты программного обеспечения для проверки единообразия интерфейса, а также работа, требующая больших знаний и выполняемая в нескольких приложениях. Во всех этих случаях критически важна непрерывность контекста между задачами, что позволяет эффективно заменять людей при выполнении повторяющихся и трудоемких операций.
Что касается безопасности, Google применила многоуровневую стратегию защиты, включающую целенаправленное обучение на противоречивых данных, меры безопасности для конфиденциальных операций и выявление косвенного внедрения команд. Все эти механизмы в совокупности помогают корпоративным пользователям создать относительно полную защиту в открытых и неконтролируемых компьютерных средах.
Китай запускает специальную кампанию по развитию больших моделей и IPv6: приложения на основе генеративного искусственного интеллекта должны будут полностью поддерживать сеть нового поколения
В Новом районе Сюнган официально стартовал первый этап масштабной инициативы по модернизации сетевой инфраструктуры для эры интеллектуальных технологий. Киберпространственное управление Китая (CAC) совместно с региональными органами по делам киберпро
Глобальное регулирование ИИ переходит к обязательному тестированию до выпуска
По мере стремительного развития крупных моделей искусственного интеллекта глобальные нормативные рамки смещаются от добровольных руководящих принципов к государственным предписаниям, основанным на доказательствах. Этот переход сигнализирует о наступл
Джек Ма и Цао Синсин из Alibaba: ИИ станет невидимой инфраструктурой, объем рынка знаний работников достигнет 50 триллионов долларов
Председатель Alibaba Group Джек Ма недавно выступил на итальянском технологическом и инвестиционном саммите Wave by Vento 2026, предсказав, что искусственный интеллект в течение пяти лет перейдет от статуса отдельной темы к встроенной инфраструктуре











