Hugging Face
공식 google/embeddinggemma-2 체크포인트. sentence-transformers로 가장 빠르게 시작하며, TEI·vLLM은 고처리량 서버 옵션입니다.
EmbeddingGemma 2는 텍스트·코드·이미지·영상·오디오를 같은 768차원 공간에 배치하는 온디바이스 임베딩 모델입니다. 검색과 RAG를 작게, 로컬에서, 멀티모달로 만들 때 특히 강합니다.
개인정보를 외부로 보내지 않는 검색, 로컬 코드베이스 RAG, 텍스트로 사진·음성·영상을 찾는 기능.
텍스트, 코드, 이미지, 영상, 오디오 및 교차 입력
사전학습은 140개 이상 언어를 포함
512 / 256 / 128차원으로 앞부분 절단 가능
130M transformer + 140M embedder
필요한 인코더만 선택적으로 로드
웹 문서·코드·이미지·영상·오디오
| 항목 | EmbeddingGemma 1 | EmbeddingGemma 2 |
|---|---|---|
| 모달리티 | 텍스트 | 텍스트·코드·이미지·영상·오디오 |
| 컨텍스트 | 2,048 토큰 | 8,192 토큰 |
| 파라미터 | 308M | 740M 전체 / 270M 텍스트 전용 |
| 라이선스 | Gemma Terms | Apache 2.0 |
| MTEB Code | 68.76 | 78.68 (+9.92p) |
가장 단순하고 공식 문서와 가까운 경로는 Hugging Face의 sentence-transformers입니다. 아래 예시는 모델 카드 패턴을 바탕으로 하며, 환경별 dtype 동작은 직접 확인해야 합니다. [1]
sentence-transformers와 transformers를 최신 버전으로 준비합니다.
텍스트 검색이라면 비전·오디오 설정을 꺼 270M 백본만 올립니다.
질문은 SearchQuery, 문서는 Document를 쓰고 L2 정규화합니다.
pip install -U sentence-transformers transformersfrom sentence_transformers import SentenceTransformer
import torch
model = SentenceTransformer(
"google/embeddinggemma-2",
config_kwargs={"vision_config": None, "audio_config": None},
model_kwargs={"torch_dtype": torch.bfloat16
if torch.cuda.is_bf16_supported() else torch.float32},
)
query = "오로라는 왜 생기나요?"
docs = [
"태양의 하전 입자가 지구 자기장과 상호작용해 오로라가 생깁니다.",
"에펠탑은 프랑스 파리에 있습니다.",
]
q = model.encode(query, prompt_name="SearchQuery",
truncate_dim=256, normalize_embeddings=True)
d = model.encode(docs, prompt_name="Document",
truncate_dim=256, normalize_embeddings=True)
scores = q @ d.T
best = int(scores.argmax())
print(docs[best], float(scores[best]))embedding = model.encode({
"text": "방수 러닝화. <|image|> 젖은 바위 접지 테스트: <|video|>",
"image": ["shoe.jpg"],
"video": "demo.mp4",
})기능 목록보다 중요한 것은 ‘왜 이 모델이어야 하는가’입니다. 시나리오를 눌러 적합성, 구현 포인트, 대안을 비교해 보세요.
MRL(Matryoshka Representation Learning)은 768차원 벡터의 앞부분만 잘라 써도 의미 구조를 최대한 보존하도록 학습합니다. 아래 수치는 전체 대비 저장량입니다. [1]
| 차원 | 다국어 | 코드 | 이미지 | MMEB | 오디오 검색 |
|---|---|---|---|---|---|
| 768 | 61.36 | 78.68 | 64.64 | 59.01 | 69.54 |
| 512 | 61.17 | 77.24 | 64.32 | 58.38 | 69.18 |
| 256SWEET SPOT | 60.41 | 76.18 | 63.13 | 56.24 | 66.76 |
| 128 | 57.89 | 71.41 | 59.06 | 45.65 | 56.71 |
검색은 질문과 문서의 역할이 다르므로 비대칭 프롬프트를 씁니다. 이미지·영상·오디오에는 프리픽스를 붙이지 않습니다. [1]
| 용도 | prompt_name | 질문 형식 | 문서 형식 |
|---|---|---|---|
| 문서 검색 | SearchQuery / Document | task: search result | query: {query} | title: {title} | text: {content} |
| 질의응답 | QuestionAnswering | task: question answering | query: … | title: … | text: … |
| 팩트체크 | FactChecking | task: fact checking | query: … | title: … | text: … |
| 코드 검색 | CodeRetrieval | task: code retrieval | query: … | title: {filename} | text: {code} |
| 분류·군집·유사도 | Classification / Clustering / SentenceSimilarity | 동일한 대칭 프리픽스 | 동일한 대칭 프리픽스 |
prompt_name="Document"는 title: none을 자동 적용합니다. 실제 제목이 있으면 title: {title} | text: {document}를 직접 구성하세요.
프리픽스는 임베딩 시점에만 사용하고, RAG의 LLM 컨텍스트나 BM25 색인에는 원문을 넣으세요.
직접 실행, 관리형 API, 로컬 런타임 중 운영 요구에 맞춰 선택하세요. 2026년 10월 6~7일 조사 시점의 상태입니다.
공식 google/embeddinggemma-2 체크포인트. sentence-transformers로 가장 빠르게 시작하며, TEI·vLLM은 고처리량 서버 옵션입니다.
EmbeddingGemma 2 자체는 AI Studio/Gemini API에 없습니다. 관리형 멀티모달이 필요하면 gemini-embedding-2를 사용합니다.
공식 Ollama 라이브러리에는 v1 embeddinggemma만 확인됐습니다. v2 공식 엔트리·GGUF 변환은 아직 확인되지 않았습니다.
| 입력 | 토큰 사용 | 8,192 토큰에서의 대략적 범위 | 준비 |
|---|---|---|---|
| 이미지 | 기본 280 / 장 | 약 29장 | 비전 예산 70–1120 조절 가능 |
| 영상 | 기본 140 / 프레임 | 약 58프레임 | 기본 1 fps |
| 오디오 | 25 / 초 | 약 327초(5.5분) | mono 16 kHz |
EmbeddingGemma 2의 장점은 ‘최대 점수’보다 작은 로컬 풋프린트와 통합된 멀티모달 파이프라인에 있습니다.
독립 벤치마크, v2 전용 파인튜닝 가이드, 공식 Ollama/GGUF, Gemini 관리형 경로의 최신 가격·한도, v2의 실제 지연시간·처리량 수치는 조사 시점에 확인되지 않았습니다. Google 제공 벤치마크는 방향성 지표로 보고, 실제 데이터셋에서 리콜·정확도·지연시간을 검증하세요.
핵심 사양과 코드는 공식 모델 카드·Google 개발자 문서를 우선했습니다. 외부 비교 자료는 대안의 성격을 파악하는 보조 자료로만 사용했습니다.
조사 기준: 2026년 10월 6–7일. EmbeddingGemma 2 출시 직후이므로 배포 런타임과 독립 평가 상황은 빠르게 바뀔 수 있습니다.