TL;DR

  • EmbeddingGemma 2는 Apache 2.0 라이선스로 공개된 10억 개 미만 파라미터의 개방형 모델로, 텍스트·코드·이미지·동영상·오디오를 공통 벡터 공간에 매핑함.
  • Gemma 4 기반 모델로, 모든 입력 형식을 768차원 공간에 표현하며 규모에 비해 높은 다중 모달 성능을 제공함.
  • 모듈형 구조로 필요한 인코더만 불러오며, 텍스트·코드용 2억 7천만, 텍스트·비전용 4억 4천만, 텍스트·오디오용 5억 7천만, 전체 다중 모달용 7억 4천만 파라미터 구성을 지원함.
  • EmbeddingGemma 1보다 코드 검색과 기술 정보 검색 성능이 크게 높으며, 로컬 코드베이스 색인과 에이전트형 코드 검색에 적합함.
  • Matryoshka Representation Learning(MRL)으로 벡터를 768차원에서 128차원까지 줄일 수 있으며, 256차원에서도 텍스트·코드는 원래 품질 대부분을, 이미지·동영상·음성 검색은 약 95%의 품질을 유지함.

다중 형식 검색을 위한 소형 모델

  • 현대 검색 및 검색 증강 생성(RAG) 애플리케이션은 기술 문서와 소스 코드부터 이미지, 동영상 클립, 오디오 녹음까지 다양한 콘텐츠 형식을 처리해야 하는 경우가 늘고 있음.
  • 대규모 연산 인프라를 실행과 색인에 요구하지 않으면서 모든 형식에서 낮은 지연 시간과 높은 검색 정확도를 제공하는 모델을 찾는 일이 과제임.
  • EmbeddingGemma 2는 단일 소형 개방형 모델로 이러한 요구를 겨냥하며, 모델 크기에 비해 뛰어난 다중 모달 성능을 제공하도록 설계됨.
  • Gemma 4를 기반으로 하는 10억 개 미만 파라미터 모델이며, 텍스트·코드·이미지·동영상·오디오를 통합된 768차원 공간으로 매핑함.

주요 기능

  • 네이티브 다중 모달 검색: 텍스트·코드·이미지·동영상·오디오를 공유 768차원 벡터 공간에서 직접 검색함.
  • 향상된 코드 이해: 코드 검색과 기술 정보 검색에서 EmbeddingGemma 1보다 크게 높은 성능을 제공하며, 로컬 코드베이스 색인과 에이전트형 코드 검색에 적합함.
  • 모듈형 메모리 사용량: 실행 시 필요한 인코더만 선택해 불러오며, 각 구성은 호환되는 동일 벡터 공간으로 투영됨.
  • 텍스트·코드: 2억 7천만 파라미터
  • 텍스트·비전: 4억 4천만 파라미터
  • 텍스트·오디오: 5억 7천만 파라미터
  • 전체 다중 모달: 7억 4천만 파라미터
  • 유연한 벡터 저장: Matryoshka Representation Learning(MRL)을 통해 벡터를 768차원에서 128차원까지 동적으로 자를 수 있어, 원래 품질의 상당 부분을 유지하면서 벡터 데이터베이스의 저장 요구량을 줄임.
  • 256차원 설정에서는 텍스트와 코드 임베딩의 원래 품질 대부분을 유지하며, 이미지·동영상·음성 검색에서는 약 95%를 유지함.

내부 작동 방식

  • EmbeddingGemma 2는 연쇄적으로 연결된 모델 대신 모듈형 인코더를 사용하며, 각 인코더의 출력을 공유 768차원 공간으로 투영함.