
Google AI Developers 공식 변경 로그에 따르면 Google은 2026년 6월 24일 Gemini API에서 Computer Use 도구의 공개 프리뷰 지원을 시작했다. 이번 기능은 Gemini 3.5 Flash에서 브라우저, 모바일, 데스크톱 환경을 제어하는 에이전트를 만들 수 있도록 하는 개발자 도구다.
Computer Use는 모델이 화면 스크린샷을 보고 다음 UI 동작을 제안하는 방식으로 작동한다. Google 문서는 이 도구가 마우스 클릭, 키보드 입력, 스크롤 같은 구체적인 사용자 인터페이스 동작을 생성할 수 있다고 설명한다. 다만 실제 실행은 모델이 직접 하는 것이 아니라, 개발자가 구현한 클라이언트 측 실행 환경이 모델의 제안을 받아 처리해야 한다.
이번 공개 프리뷰에서 Google은 Gemini 3.5 Flash를 Computer Use의 권장 모델로 제시했다. 새 기능에는 브라우저뿐 아니라 모바일과 데스크톱 환경 지원, 각 단계의 의도를 설명하는 간소화된 액션, 정책 범주와 오버라이드를 설정할 수 있는 안전 정책, 스크린샷 기반 프롬프트 인젝션 탐지 기능이 포함된다.
개발자는 이 구조를 웹 사이트의 반복 입력 자동화, 사용자 흐름 테스트, 여러 웹 페이지를 오가며 제품 정보와 가격을 모으는 조사 업무 등에 적용할 수 있다. 특히 화면 상태를 다시 캡처해 모델에 전달하는 반복 루프를 구성하면, 모델은 현재 화면과 사용자의 목표를 바탕으로 다음 행동을 계속 제안한다.
기술적으로는 에이전트 개발의 책임 경계가 분명하다. Google 문서는 개발자가 안전한 실행 환경을 준비하고, 좌표와 입력 동작을 처리하는 클라이언트 측 액션 핸들러를 구현해야 한다고 안내한다. 예제는 Playwright 기반 브라우저 자동화를 보여주지만, Google은 프로덕션 환경에서는 호스트 시스템과 격리된 샌드박스 VM이나 컨테이너를 사용할 것을 권고한다.
보안 주의도 함께 제시됐다. Google은 Computer Use가 프리뷰 기능이므로 오류와 보안 취약점을 포함할 수 있다고 설명한다. 중요한 작업은 면밀히 감독하고, 중대한 오류가 복구되기 어려운 행동이나 민감한 데이터가 포함된 작업에는 사용을 피하라는 권고도 문서에 포함됐다.
이번 발표는 AI 에이전트 개발 경쟁이 단순한 텍스트 응답을 넘어 실제 사용자 인터페이스 조작으로 이동하고 있음을 보여준다. OpenAI, Anthropic, Google 등 주요 AI 기업이 에이전트 실행 환경과 안전장치를 동시에 강조하는 이유도 여기에 있다. 모델이 화면을 보고 행동을 제안하는 순간, 개발자는 자동화 편의성과 함께 권한, 로그, 격리, 사람의 승인 절차를 제품 설계의 기본 요소로 다뤄야 한다.
출처: Google AI Developers(https://ai.google.dev/gemini-api/docs/changelog), Gemini API Computer Use 문서(https://ai.google.dev/gemini-api/docs/computer-use)









