구글은 기본적인 컴퓨터 작업 기능을 Gemini 3.5 Flash에 통합함으로써 멀티모달 전환의 장벽을 허물었습니다.

Google DeepMind 팀은 Gemini 3.5 Flash 모델에 원생적인 컴퓨터 사용 기능을 직접 통합하는 중대한 돌파구를 발표했습니다. 이제 개발자들은 단일 모델만을 활용해 브라우저, 모바일 기기, 데스크톱에 있는 화면을 자동으로 확인하고 조작할 수 있는 AI 에이전트를 구축할 수 있습니다.
이전에는 이러한 기능이 별도의 모델로만 제공되어, 개발자들은 서로 다른 모델 간의 복잡한 전환 과정과 컨텍스트 이관 작업을 처리해야 했습니다. 하지만 원생적인 통합 덕분에 AI는 장시간에 걸친 크로스플랫폼 작업을 수행할 때 더 이상 정보를 수동으로 전달할 필요가 없어져 개발 과정이 훨씬 간소화되었습니다.
컨텍스트 손실 제거로 에이전트의 신뢰성 향상
Google 팀은 AI 에이전트의 핵심 병목 현상이 개별 도구의 한계가 아니라, 여러 도구 간 전환 시 발생하는 컨텍스트 정보의 손실에 있다고 보고 있습니다. 검색, 지도, 컴퓨터 작업을 단일 모델 아키텍처 내에서 통합함으로써 컨텍스트가 연속적으로 유지되어, 복잡한 작업에서 발생할 수 있는 실패 가능성이 크게 줄어듭니다.
이러한 “멀티 도구 통합” 설계는 내부 연결 구조를 갖춘 단일 건물을 짓는 것과 유사하여, 별도의 건물들 간에 발생하던 길고 오류가 잦은 커뮤니케이션을 없애줍니다. 이러한 아키텍처 변화는 에이전트 기반 작업의 신뢰성과 응답 지연 시간을 상당히 개선할 잠재력을 가지고 있습니다.
다층적 보안 방어 체계로 세 가지 핵심 시나리오에 집중
이 원생적인 기능은 주로 세 가지 핵심 시나리오에 적용될 예정입니다. 바로 수시간 또는 수일 동안 지속적으로 작동해야 하는 자동화된 작업, UI 일관성을 자동으로 검증하기 위한 지속적인 소프트웨어 테스트, 그리고 여러 애플리케이션에 걸쳐 이루어지는 지식 집약적인 작업들입니다. 이러한 시나리오들은 작업 간의 컨텍스트 연속성에 크게 의존하며, 반복적이고 에너지 소모가 많은 작업을 수행하는 데 있어 인간을 효과적으로 대체할 수 있습니다.
보안 측면에서 Google은 목표 지향형 적대적 학습, 민감한 작업을 위한 기업용 보안 장치, 간접적인 프롬프트 주입 탐지 등 다층적인 방어 전략을 도입했습니다. 이러한 메커니즘들은 공개되고 통제가 되지 않는 컴퓨터 환경에서 기업 사용자들이 비교적 완전한 보안 경계를 구축하는 데 도움을 줍니다.
관련 기사
글로벌 AI 규제, 출시 전 필수 테스트로 전환
대규모 AI 모델이 급속히 발전함에 따라 전 세계의 규제 프레임워크는 자발적 가이드라인에서 정부 주도의 증거 기반 의무 규정으로 전환되고 있습니다. 이 전환은 실용적인 AI 규제의 새로운 시대를 알립니다.1. 새로운 표준: AI 모델은 누가 감사하는가?과거 개발자들은 내부 레드 팀링이나 자체 발행 보안 보고서에 의존했습니다. 이러한 자가 평가 방식은 이제 국가 안보 요구사항을 충족하기에 충분하지 않습니다.이러한 변화를 주도하는 것은 영국의
알리바바의 마윈, 쯔아오 싱신: AI는 보이지 않는 인프라가 될 것이며, 지식 근로자의 TAM은 50조 달러에 도달할 것이다
알리바바 그룹 회장 마윈은 최근 이탈리아 기술 및 투자 정상회의인 ‘Wave by Vento 2026’에서 연설하며, 인공지능(AI)이 향후 5년 내에 독립된 화두에서 산업 전반에 내재된 인프라로 전환될 것이라고 예측했습니다.마윈은 현재 AI가 시간 절약 측면에서는 뛰어나지만, 우리가 시간을 보내는 방식을 개선하는 잠재력은 아직 대부분 활용되지 않았다고 지적했습니다. 그는 지식 노동자의 생산성 향상을 가장 실현 가능한 응용 분야로 꼽았으며,
관련 특별 주제 추천
의견 (0)
0/500

Google DeepMind 팀은 Gemini 3.5 Flash 모델에 원생적인 컴퓨터 사용 기능을 직접 통합하는 중대한 돌파구를 발표했습니다. 이제 개발자들은 단일 모델만을 활용해 브라우저, 모바일 기기, 데스크톱에 있는 화면을 자동으로 확인하고 조작할 수 있는 AI 에이전트를 구축할 수 있습니다.
이전에는 이러한 기능이 별도의 모델로만 제공되어, 개발자들은 서로 다른 모델 간의 복잡한 전환 과정과 컨텍스트 이관 작업을 처리해야 했습니다. 하지만 원생적인 통합 덕분에 AI는 장시간에 걸친 크로스플랫폼 작업을 수행할 때 더 이상 정보를 수동으로 전달할 필요가 없어져 개발 과정이 훨씬 간소화되었습니다.
컨텍스트 손실 제거로 에이전트의 신뢰성 향상
Google 팀은 AI 에이전트의 핵심 병목 현상이 개별 도구의 한계가 아니라, 여러 도구 간 전환 시 발생하는 컨텍스트 정보의 손실에 있다고 보고 있습니다. 검색, 지도, 컴퓨터 작업을 단일 모델 아키텍처 내에서 통합함으로써 컨텍스트가 연속적으로 유지되어, 복잡한 작업에서 발생할 수 있는 실패 가능성이 크게 줄어듭니다.
이러한 “멀티 도구 통합” 설계는 내부 연결 구조를 갖춘 단일 건물을 짓는 것과 유사하여, 별도의 건물들 간에 발생하던 길고 오류가 잦은 커뮤니케이션을 없애줍니다. 이러한 아키텍처 변화는 에이전트 기반 작업의 신뢰성과 응답 지연 시간을 상당히 개선할 잠재력을 가지고 있습니다.
다층적 보안 방어 체계로 세 가지 핵심 시나리오에 집중
이 원생적인 기능은 주로 세 가지 핵심 시나리오에 적용될 예정입니다. 바로 수시간 또는 수일 동안 지속적으로 작동해야 하는 자동화된 작업, UI 일관성을 자동으로 검증하기 위한 지속적인 소프트웨어 테스트, 그리고 여러 애플리케이션에 걸쳐 이루어지는 지식 집약적인 작업들입니다. 이러한 시나리오들은 작업 간의 컨텍스트 연속성에 크게 의존하며, 반복적이고 에너지 소모가 많은 작업을 수행하는 데 있어 인간을 효과적으로 대체할 수 있습니다.
보안 측면에서 Google은 목표 지향형 적대적 학습, 민감한 작업을 위한 기업용 보안 장치, 간접적인 프롬프트 주입 탐지 등 다층적인 방어 전략을 도입했습니다. 이러한 메커니즘들은 공개되고 통제가 되지 않는 컴퓨터 환경에서 기업 사용자들이 비교적 완전한 보안 경계를 구축하는 데 도움을 줍니다.
글로벌 AI 규제, 출시 전 필수 테스트로 전환
대규모 AI 모델이 급속히 발전함에 따라 전 세계의 규제 프레임워크는 자발적 가이드라인에서 정부 주도의 증거 기반 의무 규정으로 전환되고 있습니다. 이 전환은 실용적인 AI 규제의 새로운 시대를 알립니다.1. 새로운 표준: AI 모델은 누가 감사하는가?과거 개발자들은 내부 레드 팀링이나 자체 발행 보안 보고서에 의존했습니다. 이러한 자가 평가 방식은 이제 국가 안보 요구사항을 충족하기에 충분하지 않습니다.이러한 변화를 주도하는 것은 영국의
알리바바의 마윈, 쯔아오 싱신: AI는 보이지 않는 인프라가 될 것이며, 지식 근로자의 TAM은 50조 달러에 도달할 것이다
알리바바 그룹 회장 마윈은 최근 이탈리아 기술 및 투자 정상회의인 ‘Wave by Vento 2026’에서 연설하며, 인공지능(AI)이 향후 5년 내에 독립된 화두에서 산업 전반에 내재된 인프라로 전환될 것이라고 예측했습니다.마윈은 현재 AI가 시간 절약 측면에서는 뛰어나지만, 우리가 시간을 보내는 방식을 개선하는 잠재력은 아직 대부분 활용되지 않았다고 지적했습니다. 그는 지식 노동자의 생산성 향상을 가장 실현 가능한 응용 분야로 꼽았으며,





집







