TL;DR

  • Google DeepMind가 텍스트·이미지·오디오·동영상·코드를 단일 임베딩 공간으로 매핑하는 7억 4,000만 파라미터 온디바이스 멀티모달 모델 EmbeddingGemma 2를 공개함.
  • Gemma 4 아키텍처를 기반으로 하며, 상업적 이용이 허용되는 Apache 2.0 라이선스로 제공됨.
  • 텍스트 전용 모델은 최소 2억 7,000만 파라미터로 구동되며, 선택형 비전·오디오 인코더를 더해 멀티모달 기능을 구성함.
  • Matryoshka Representation Learning(MRL)으로 임베딩 차원을 768에서 128까지 줄일 수 있고, 양자화 적용 시 Pixel 11 Pro에서 전체 멀티모달 모델의 활성 메모리는 약 567MB임.
  • 8K 토큰 문맥 창으로 최대 5.5분 오디오, 이미지 29장, 동영상 프레임 58개 또는 이들의 혼합 입력을 처리하며, 코드 벤치마크 점수는 이전 모델보다 9.92점 높음.

EmbeddingGemma 2: 개방형 경량 멀티모달 임베딩 모델

  • EmbeddingGemma는 소비자 하드웨어에서 앱이 정보를 정리하고 검색하며 연결할 수 있도록 고품질 텍스트 임베딩을 제공하는 경량 모델로 처음 소개됐으며, 2,000만 회 이상 다운로드됨.
  • 개발자들은 이를 온디바이스 검색 도구와 개인정보 보호 중심의 검색 증강 생성(RAG) 파이프라인에 활용함.
  • EmbeddingGemma 2는 텍스트를 넘어 코드, 이미지, 동영상, 오디오를 공유 임베딩 공간으로 통합하며, 음성 메모로 특정 동영상 장면을 찾거나 텍스트 질의로 여러 시간 분량의 오디오 녹음을 검색하는 작업을 단일 네이티브 멀티모달 모델로 처리함.
  • Gemma 4 아키텍처를 기반으로 하며, 파라미터 수는 7억 4,000만 개, 라이선스는 상업적 이용에 제한이 적은 Apache 2.0임.
  • Gemini Embedding 모델과 동일한 기술을 기반으로 하며, 모델의 주요 특성은 다음과 같음.
  • 규모 대비 최고 수준 성능: 10억 개 미만 멀티모달 임베딩 모델 가운데 MTEB Code와 MAEB 등 벤치마크에서 선도적인 점수를 기록하며, 텍스트·비전·오디오 작업에서 다수의 더 큰 모델과 대등하거나 앞서는 성능임.
  • 모듈형 설계: 텍스트 전용 작업은 최소 2억 7,000만 파라미터로 구성되며, 완전한 멀티모달 지원을 위한 선택형 비전 인코더는 1억 7,000만, 오디오 인코더는 3억 파라미터임.
  • 저장 공간 효율: Matryoshka Representation Learning(MRL)을 적용해 출력 벡터를 768차원에서 512·256·128차원으로 동적으로 자를 수 있으며, 로컬 벡터 데이터베이스와 메모리 사용량을 최대 6배 줄임.
  • 온디바이스 성능 최적화: 제한된 자원 환경에서 효율적으로 실행됨. 양자화 적용 시 Google Pixel 11 Pro에서 텍스트 전용 가중치의 활성 메모리는 최소 약 191MB, 전체 멀티모달 모델은 약 567MB임.
  • 확장된 문맥 처리: 8K 토큰 문맥 창을 지원하며, 이는 EmbeddingGemma 1보다 4배 큼. 로컬 하드웨어에서 오디오 최대 5.5분, 이미지 29장, 동영상 프레임 58개 또는 이들의 혼합 입력을 처리함.

코드·비전·오디오에서 최상위 수준의 품질

  • EmbeddingGemma 2는 EmbeddingGemma의 강력한 다국어 텍스트 성능을 유지하면서 코드 성능을 크게 높임.
  • MTEB Code 점수는 68.76에서 78.68로 9.92점 상승했으며, 로컬 코드베이스 색인화, 의미 기반 코드 검색, 코딩 에이전트 검색에 적합함.
  • 이미지, 동영상, 문서, 오디오 전반에서 10억 파라미터 미만 모델의 파라미터당 품질 기준을 새로 세우며, 크기가 두 배를 넘는 일부 전문 모델보다도 높은 성능을 보임.
  • 전체 평가 지표와 모델 정보는 EmbeddingGemma 2 모델 카드에서 확인할 수 있음.

온디바이스 의미 검색·라우팅·검색 증강

  • EmbeddingGemma 2는 엣지 하드웨어에서 강력한 기능을 제공함. 임베딩을 로컬에서 생성하면 데이터 개인정보 보호를 돕고 파이프라인 지연을 줄이며, 완전히 오프라인으로 작동하는 크로스모달 검색·검색 증강 시스템을 구축할 수 있음.
  • Gemma 4 같은 생성 모델과 함께 사용하면 복잡한 멀티모달 데이터를 이해하는 온디바이스 RAG 파이프라인을 구성할 수 있음.
  • EmbeddingGemma 2는 Gemma 4를 기반으로 하며 텍스트 토크나이저와 오디오 인코더를 공유하므로, 두 모델을 통합 파이프라인에서 실행해 전체 메모리 사용량을 줄일 수 있음.
  • 텍스트나 이미지로 미디어 라이브러리에서 의미 유사도가 높은 항목을 찾는 기능은 Google AI Edge Gallery의 Instant Media Search에서 체험할 수 있음.
  • 텍스트 또는 오디오 질의로 동영상의 특정 순간을 찾는 기능은 Google AI Edge Gallery의 Video Moments Finder에서 체험할 수 있음.
  • 로컬 파일 검색에 EmbeddingGemma 2를, 문맥 추론에 Gemma 4를 결합하는 기능은 Google AI Edge Foresight 앱에서 체험할 수 있음.
  • MediaPipe Decision Task API를 통해 멀티모달 문맥을 활용한 분류·라우팅·예측 기능의 실시간 의사결정 엔진을 구축할 수 있음.
  • LiteRT로 온디바이스 검색 및 RAG 시스템을 만드는 방법은 Google AI Edge 블로그 게시물에서 확인할 수 있음.

EmbeddingGemma 2 시작하기

  • Google DeepMind는 개발자가 작업하는 환경에서 EmbeddingGemma 2를 바로 사용할 수 있도록 다음 파트너와 협력함.
  • 모델 다운로드: 모델 가중치는 Hugging Face와 Kaggle에서 제공되며, Gemini Enterprise Agent Platform Model Garden에서도 곧 이용할 수 있음. 온디바이스 최적화 모델은 Hugging Face의 LiteRT Community에서 확인할 수 있음.
  • 온디바이스 배포: 임베딩·검색·의사결정 작업을 바로 사용할 수 있는 Google AI Edge MediaPipe 또는 사용자 정의 모델 통합을 위한 LiteRT로 크로스 플랫폼 앱을 개발할 수 있음. 브라우저용 앱은 transformers.js 또는 WebGPU로 구축할 수 있음.
  • 개발 도구: transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama, LMStudio로 모델을 효율적으로 제공할 수 있으며, 임베딩 벡터 저장에는 Qdrant를 사용할 수 있음.
  • 미세 조정: 사용 사례에 맞춰 EmbeddingGemma 2를 미세 조정하는 방법은 Unsloth 안내를 따를 수 있음.
  • 개발 가이드와 문서, 추론 및 미세 조정 가이드를 제공함.