EmbeddingGemma 2 공개: 7억 4천만 파라미터의 개방형 경량 멀티모달 임베딩 모델

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Google DeepMind가 EmbeddingGemma 2를 공개했다. Gemma 4 기반, Apache 2.0, 7억 4천만 파라미터로 텍스트, 코드, 이미지, 오디오, 비디오를 한 임베딩 공간에 매핑해 기기에서 실행된다. 양자화 시 Pixel 11 Pro에서 약 191MB. MRL로 768차원을 128차원까지 줄여 저장 공간을 최대 6배 절감한다. 수치는 Google 발표 기준이다.

2026년 10월 6일 Google DeepMind는 EmbeddingGemma 2를 공개했다. 개방형이며 가볍고, 처음부터 멀티모달을 지원하는 임베딩 모델이다. 텍스트, 코드, 이미지, 오디오, 비디오를 하나의 공유 임베딩 공간에 매핑한다. Gemma 4 아키텍처를 기반으로 하며, 상업적 사용이 가능한 Apache 2.0 라이선스로 배포된다. 파라미터는 7억 4천만 개이고, 기기 내 추론을 주된 대상으로 삼는다. 하나, 무엇이 발표되었나

지난해 나온 첫 EmbeddingGemma는 텍스트 전용이었다. 소비자용 하드웨어에서 고품질 텍스트 임베딩을 제공하는 것이 목표였다. Google에 따르면 다운로드는 2,000만 회를 넘었다. 개발자들은 이를 기기 내 검색 도구와 개인정보를 중시하는 검색 증강 생성(RAG) 파이프라인에 사용했다. EmbeddingGemma 2는 입력을 코드, 이미지, 비디오, 오디오로 넓힌다. 여러 전문 모델을 이어 붙이지 않고 단일 모델이 기본적으로 처리한다. Google이 든 예는 음성 메모로 특정 비디오 클립을 찾는 것, 그리고 몇 시간 분량의 녹음을 텍스트 질의로 검색하는 것이다. 이 모델은 Gemini Embedding 모델과 같은 기술에서 나왔다.

둘, 모듈형 구조

설계는 모듈형이다. 텍스트 전용 작업에는 2억 7천만 파라미터만 있으면 된다. 1억 7천만 파라미터의 비전 인코더와 3억 파라미터의 오디오 인코더는 선택 사항이다. 세 부분을 합치면 7억 4천만 파라미터의 전체 멀티모달 모델이 된다. 개발자는 필요한 부분만 불러오면 된다. 텍스트만 다루는 검색 앱이 쓰지 않는 비전과 오디오 가중치 때문에 메모리를 쓸 필요가 없다. 셋, 마트료시카 표현 학습과 저장 비용

모델은 마트료시카 표현 학습(MRL)을 사용한다. 출력 벡터는 기본 768차원이다. 개발자는 실행 중에 512, 256, 128차원으로 줄일 수 있다. Google은 이를 통해 로컬 벡터 데이터베이스의 저장 공간과 메모리 사용량을 최대 6배 줄일 수 있다고 밝혔다. 휴대폰이나 노트북에 많은 벡터를 보관하는 앱에는 직접적인 비용 절감 수단이다. 다만 차원을 줄이면 정확도와 크기 사이의 절충이 생긴다. 발표문은 차원별 정확도 손실을 수치로 제시하지 않았으므로, 자체 데이터로 측정해야 한다.

넷, 기기 내 자원 사용량과 컨텍스트 길이

양자화를 적용하면 Google Pixel 11 Pro에서 텍스트 전용 가중치는 활성 RAM이 최소 약 191MB, 전체 멀티모달 모델은 약 567MB가 필요하다. 컨텍스트 창은 8K 토큰으로, 첫 모델의 4배다. Google에 따르면 한 번의 입력에 최대 5.5분의 오디오, 이미지 29장, 비디오 프레임 58개 또는 이들의 교차 조합을 담을 수 있다. 모든 처리는 로컬 하드웨어에서 이루어진다. 다섯, 벤치마크

Google은 1B 미만 멀티모달 임베딩 모델 가운데 이 크기로는 최고 수준의 점수를 얻었다고 밝혔다. 언급된 벤치마크에는 MTEB Code와 MAEB(대규모 오디오 임베딩 벤치마크)가 있다. 텍스트, 비전, 오디오 작업에서는 더 큰 여러 모델과 비슷하거나 앞선다고 한다. 다국어 텍스트 성능은 첫 모델과 같은 수준이다. 가장 뚜렷한 향상은 코드에서 나왔다. MTEB Code 점수는 68.76에서 78.68로 9.92점 올랐다. 이미지, 비디오, 문서, 오디오 작업에서는 자기 크기의 두 배가 넘는 일부 전문 모델보다 낫다고도 한다. 전체 지표는 모델 카드에 있다. 이 수치는 제공사가 직접 밝힌 것이며, 독립적인 재현은 아직 확인되지 않았다.

여섯, 개발자와 기업에 주는 의미

첫째는 개인정보다. 임베딩을 로컬에서 만들면 데이터가 기기를 떠나지 않는다. 개인 메모, 법률 문서, 의료 기록 같은 민감한 자료에 알맞다. 둘째는 지연 시간과 비용이다. 로컬 추론은 네트워크 왕복이 필요 없고 호출당 API 요금도 없다. 셋째는 작업 흐름의 단순화다. 기존의 교차 모달 검색은 텍스트, 이미지, 오디오마다 모델을 두고 벡터 공간을 맞춰야 했다. 이제는 모델 하나로 충분하다. 넷째는 코드 용도다. MTEB Code의 향상으로 로컬 코드베이스 색인, 의미 기반 코드 검색, 코딩 에이전트의 검색이 더 실용적이 된다. 다섯째, Apache 2.0은 상업적 사용을 허용하므로 기업이 도입할 때 법적 장벽이 낮다.

일곱, 전망과 과제

기기 내 멀티모달 임베딩은 개인의 사진, 녹음, 비디오, 코드를 한곳에서 의미 기반으로 검색하는 기능을 보편화할 것이다. 과제도 분명하다. 8K 창은 긴 비디오와 긴 녹음에는 여전히 짧아서 분할과 집계 전략이 필요하다. 양자화 방식에 따라 검색 품질이 달라질 수 있어 실제 데이터로 측정해야 한다. 벡터 데이터베이스, 검색 프레임워크, 모바일 런타임도 멀티모달 임베딩 지원을 따라가야 한다. 벤치마크 점수가 곧 업무 성과는 아니므로 각 팀은 자신의 코퍼스로 평가해야 한다. 종합하면 EmbeddingGemma 2는 작고, 멀티모달이며, 상업적으로 쓸 수 있다는 세 가지를 한 번의 출시에 담았다. AI 도구 개발자가 눈여겨볼 만하다.

Sources