
Google 공식 블로그는 2026년 6월 3일 Gemma 4 12B를 공개했다고 밝혔다. Gemma 4 12B는 노트북 등 개인용 하드웨어에서 구동 가능한 중형 멀티모달 모델을 목표로 설계됐다.
Google은 이 모델이 기존의 별도 멀티모달 인코더 의존을 줄이고, 시각·오디오 입력을 LLM 백본에 직접 연결하는 구조를 사용한다고 설명했다. 회사는 Gemma 4 12B가 Gemma 4 계열의 엣지 지향 모델과 더 큰 26B 혼합전문가 모델 사이를 잇는 선택지라고 소개했다.
이번 모델의 주요 특징은 네이티브 오디오 입력 지원, 고급 추론 성능, 16GB VRAM 또는 통합 메모리 환경에서의 로컬 실행 가능성이다. Google은 Gemma 4 12B가 Apache 2.0 라이선스로 공개되며 LM Studio, Ollama, Google AI Edge Gallery App, LiteRT-LM CLI 등 개발자 도구 생태계에서 사용할 수 있다고 밝혔다.
개발자 관점에서 주목되는 부분은 로컬 에이전트 활용 가능성이다. 클라우드 API 호출이 어려운 환경이나 지연시간·비용·데이터 통제 요구가 큰 워크플로에서 중형 멀티모달 모델의 선택지가 넓어질 수 있다. 다만 실제 성능과 안정성은 각 실행 환경, 양자화 방식, 애플리케이션 요구사항에 따라 달라질 수 있다.
Google은 Gemma 4 모델 누적 다운로드가 1억5천만 건을 넘어섰다고 밝혔다. 이 수치는 Google 공식 블로그 기준이며, 독립적인 외부 검증 수치는 별도로 확인되지 않았다.
출처: Google 공식 블로그, “Introducing Gemma 4 12B: a unified, encoder-free multimodal model” https://blog.google/innovation-and-ai/technology/developers-tools/introducing-gemma-4-12b/









