EmbeddingGemma 2, 사진과 소리까지 기기 안에서 검색하는 AI 모델

구글 딥마인드가 10월 6일 EmbeddingGemma 2를 공개했다. 글과 코드, 사진, 영상, 소리를 검색에 사용할 수 있는 숫자 정보로 바꾸는 AI 모델이다. 사진에 설명을 일일이 붙이지 않아도 문장으로 원하는 장면을 찾거나, 녹음 파일에서 질문과 관련된 내용을 검색하는 앱을 만들 수 있다. 휴대폰과 노트북 안에서 실행하도록 설계했으며 모델 파일도 공개했다. 공식 발표

단어가 아니라 의미로 찾는 검색

일반적인 파일 검색은 이름이나 본문에 입력한 단어가 있는지 확인한다. 반면 의미 검색은 표현이 달라도 내용이 가까운 자료를 찾는다. 예를 들어 ‘바닷가에서 노는 강아지’라는 질문을 사진과 비교하려면, 문장과 이미지의 내용을 같은 기준으로 표현할 방법이 필요하다.

그 역할을 하는 것이 임베딩이다. 모델이 입력의 특징을 여러 숫자로 나타내면 검색 프로그램이 그 숫자들의 유사도를 비교해 관련 자료를 앞에 놓는다. EmbeddingGemma 2는 서로 다른 형식의 입력을 공통된 768개 숫자로 표현한다. 사진을 먼저 글로 설명하거나 음성을 받아쓴 다음 검색하는 단계를 거치지 않고, 이미지와 소리도 직접 비교 대상으로 만들 수 있다. 모델 구조와 검색 방식

개발자는 우선 사진·문서·영상 구간을 임베딩으로 변환해 검색용 목록을 만든다. 이후 사용자가 질문을 입력하면 같은 방식으로 숫자로 바꾸고, 목록에서 가까운 항목을 찾는다. 목록을 만드는 초기 처리와 질문마다 수행하는 검색은 서로 다른 작업이다. 자료를 새로 추가하면 해당 자료도 처리해야 한다.

사진·영상 검색과 자료를 참고하는 답변

구글은 Google AI Edge Gallery 앱에 Instant Media Search와 Video Moments Finder를 추가했다고 밝혔다. 전자는 문장이나 예시 이미지로 기기 안의 사진·영상을 찾고, 후자는 영상에서 원하는 장면이 있는 시점을 찾는 기능이다. 공식 소개에서는 ‘생일 케이크의 촛불을 끄는 사람’ 같은 설명으로 관련 시점을 검색하는 예를 들었다. 검색용 숫자와 자료 목록은 기기 안에서 처리·저장하며 인터넷 없이도 검색할 수 있다는 설명이다. 공식 앱의 활용 예

개발 도구에서는 ‘파일을 저장하는 함수’처럼 기능을 설명해 관련 코드를 찾는 데 사용할 수 있다. 함수 이름을 모르는 상태에서도 후보를 좁혀주는 방식이다. 상품 검색이라면 제품 설명과 사진을 함께 하나의 임베딩으로 만들어 ‘방수되는 등산화’라는 질문과 비교할 수도 있다. 이는 개발자가 구성할 수 있는 검색 흐름이며, 모델 자체가 완성된 쇼핑 앱을 제공한다는 뜻은 아니다. 코드 검색과 혼합 입력 예제

EmbeddingGemma 2의 출력은 답변 문장이 아니라 숫자다. 검색한 자료를 읽고 설명까지 만들려면 Gemma 4 같은 생성 모델을 별도로 연결한다. 질문과 관련된 파일을 먼저 찾고 그 내용을 생성 모델에 전달하는 구성이 RAG, 즉 검색 증강 생성이다. 모든 파일을 매번 통째로 입력하는 부담을 줄일 수 있지만, 처음 검색에서 필요한 자료를 놓치면 답변에도 영향을 준다. 생성 모델과의 연결

기기에 맞춰 줄일 수 있는 모델

전체 모델의 매개변수는 7억 4,000만 개다. 매개변수는 학습한 정보를 담는 수치이며, 글을 처리하는 부분에 이미지·영상과 소리를 처리하는 부분을 더한 구성이다. 글과 코드만 다룰 때는 필요 없는 부분을 제외해 2억 7,000만 개 규모로 실행할 수 있다. 사진 검색에 음성 처리 부분까지 모두 불러올 필요는 없는 셈이다. 선택적으로 불러오는 구조

구글은 모델의 수치를 더 적은 비트로 저장하는 양자화를 적용한 Pixel 11 Pro에서 글 전용 모델 가중치에 약 191MB, 전체 모델에 약 567MB의 활성 메모리가 필요하다고 안내했다. 특정 기기와 설정에서의 가중치 메모리 수치이므로 앱 전체가 이 용량만으로 실행된다는 뜻은 아니다. 검색 목록과 입력 처리에도 자원이 필요하다. 메모리 측정 조건

검색용 숫자의 길이도 768개에서 256개나 128개로 줄일 수 있다. 같은 자료 수라면 저장 공간이 줄고 비교 연산도 가벼워지지만, 정보를 줄인 만큼 품질이 떨어질 수 있다. 구글은 128개 설정을 주로 글 전용 작업에 권하며, 이미지·음성까지 쓰는 검색에서는 실제 자료로 품질을 확인하도록 안내한다. 길이별 평가와 권장 설정

코드 검색 점수는 올랐고, 글 검색 점수는 비슷하다

구글이 공개한 평가에서 코드 관련 MTEB 점수는 이전 모델의 68.76에서 78.68로 올랐다. 이 평가는 관련 코드가 검색 결과 상위에 얼마나 잘 배치되는지 등을 측정한다. 높은 점수가 코드를 직접 작성하거나 실행하는 능력까지 뜻하지는 않는다.

MTEB 코드 평가 점수 · 높을수록 좋음
EmbeddingGemma 1 · 68.76

EmbeddingGemma 2 · 78.68

구글 모델 카드의 MTEB code v1 평균 점수(NDCG@10)를 재구성했다. 양자화하지 않은 모델과 768개 숫자로 구성된 출력 기준이며 막대 범위는 0~100이다. 평가 원자료

다국어 글 평가 점수는 61.15에서 61.36으로 차이가 작다. 기존 글 검색만 쓰는 서비스라면 이 점수만으로 큰 개선을 기대하기는 어렵고, 이번 모델의 핵심 변화는 사진·영상·음성까지 검색 대상을 넓힌 데 있다. 두 결과 모두 구글이 공개한 평가이며, 앞의 양자화 메모리 측정과 동일한 실행 조건은 아니다. 언어별 성능이 같다는 보장도 없으므로 한국어 자료에서의 검색 정확도는 별도로 확인해야 한다. 평가 조건과 언어별 한계

지금 어떻게 사용할 수 있나?

모델 가중치는 Hugging Face와 Kaggle에서 내려받을 수 있고, Apache 2.0 라이선스로 공개됐다. 개발자는 SentenceTransformers 라이브러리로 모델을 불러와 검색 기능을 만들 수 있다. 모델 다운로드와 실행 환경 준비는 필요하지만, 이후 로컬 검색을 위해 매번 클라우드 API에 자료를 보낼 필요는 없다. 기기 안에서 처리되는 모델을 사용해도 앱이 별도로 자료를 전송하도록 만들면 개인정보 처리 방식은 달라진다. 모델 다운로드와 이용 안내

한 번에 처리하는 입력 한도는 8,192토큰이다. 토큰은 모델이 입력을 처리하기 위해 나눈 작은 단위다. 기본 설정에서 음성만 넣으면 약 5.5분, 영상은 약 58프레임을 처리할 수 있으며, 글·영상·소리를 함께 넣으면 같은 입력 한도를 나눠 쓴다. 긴 녹음이나 영상 전체를 검색하려면 구간을 나누고 각 결과에 원래 시점을 연결해야 한다. 구글은 Android의 ML Kit를 통한 제공과 AI 연산용 칩인 NPU를 활용한 가속도 수주 내 도입할 계획이라고 밝혔지만, 이는 현재 내려받을 수 있는 모델과 구분되는 후속 제공 계획이다. 입력 한도 · Android 후속 계획

Donghun Ryou



Search the website


today visits :

135

total visits :

121567


Comments

답글 남기기