임베딩 모델은 물리량을 잘 재지 못한다: 24개 모델 시험
Opitz와 Michail의 논문은 24개 임베딩 모델이 길이, 질량, 부피, 시간을 반영하는지 시험했다. 정렬은 약하다. PhysScore 최고 tau는 53.23이고 54를 넘는 모델은 없다. 유사도는 수치보다 문자열 형태를 따르며, 선형 프로브 재보정도 평균 tau를 3.0만 올렸다.
논문이 보고한 내용
2026년 9월 17일, 취리히 대학교 전산언어학과의 Juri Opitz와 Andrianos Michail이 논문 "Embedding Models Measure in Peculiar Ways"(arXiv 2609.20821, cs.CL)를 공개했다. 질문은 좁고 검증하기 쉽다. 텍스트 임베딩(embedding)은 질량, 거리, 시간, 부피 같은 물리량을 반영하는가? 이런 양에는 하나뿐인 객관적인 '동등'과 '거리'의 개념이 있다. "1 meter"와 "100 centimeters"는 같은 양을 가리킨다. "105 centimeters"는 "15 kilometers"보다 물리적으로 "1 meter"에 더 가깝다. 임베딩 유사도가 정말로 의미를 잰다면, 이를 존중해야 한다.
저자들의 답은 '아니오'다. 시험한 24개 임베딩 모델 모두에서 물리적 측정은 약하게만 모델링되었고, 저자들이 "꽤 독특하다"고 부르는 측정 패턴이 나타났다. 또한 측정 문자열 사이의 유사도는 표면적인 문자열 유사성과 강하게 연관되어 있으며, 유사도 함수를 다시 보정해도 문제가 풀리지 않는다고 보고한다. 코드는 github.com/flipz357/embed-and-measure에 공개되어 있다.
실험 방식
설정은 단순하다. 임베딩 모델은 텍스트를 벡터로 바꾼다. 저자들은 숫자와 단위로 "10 kilometers"나 "1 meter" 같은 문자열을 만들고, 둘을 임베딩한 뒤 표준 코사인 유사도를 계산한다. 어떤 범위의 모든 값 쌍에 대해 이를 반복하고 히트맵으로 그린다. 이상적인 히트맵에서는 두 값의 물리적 거리가 커질수록 유사도가 매끄럽게 떨어진다.
대상 물리량은 길이(미터), 질량(킬로그램), 부피(리터), 시간(초)이다. 값의 범위는 다섯 가지다. local(0에서 10), medium(0에서 1,000), log(최대 100,000), sign(-100에서 100, 음수 포함), scientific(지수 표기)이다. 각 범위는 대략 20단계로 나뉜다. local 범위는 0부터 10까지의 모든 정수와 one-hundred에 대해 "five meters"처럼 단어로도 쓰여서, 숫자 표기와 단어 표기를 비교할 수 있다.
24개 모델은 오래된 BERT 계열 인코더부터 최근의 LLM 기반 디코더까지 걸쳐 있다. 임베딩 차원은 384(MiniLM)에서 4096(Qwen3-Embedding-8B)까지다. 자세한 분석에는 all-mpnet-base-v2(인코더)와 Qwen3-Embedding-0.6B(디코더)를 골랐다. 둘 다 가장 많이 내려받는 임베딩 모델에 속하기 때문이다. 나머지 모델의 결과는 부록에 있다.
논문의 주요 발견
히트맵이 불규칙하다. 동일한 문자열이 당연히 일치하는 대각선을 빼면 패턴은 대체로 불규칙하다. 저자들은 단조롭지 않은 아티팩트, 가로줄과 세로줄 띠, 물리적 거리를 따르지 않는 국소적 이웃을 지적한다. 두 예시 모델은 음수와 양수를 대략 구분할 수 있다. local 범위에는 "체커 무늬"가 나타난다. 정수끼리의 쌍은 맞지만 정수와 소수의 쌍은 맞지 않는다. 두 모델 모두에서 어떤 단위의 2.5는 3보다 7.5와 더 비슷하다. 이는 물리적 순서와 반대다. 숫자와 단어. 임베딩은 "one"과 "1"이 같다는 사실을 거의 포착하지 못한다. Qwen은 one과 1에 높은 유사도를 주지만 one과 0에도 높은 유사도를 주며, 리터와 킬로그램에서 가장 두드러진다. mpnet은 one과 1에, one과 다른 어떤 수보다 뚜렷이 높은 유사도를 준다. Qwen은 "nine liters"를 숫자로 쓴 모든 리터 양과 비슷하지 않다고 평가하며, nine/9와 ten/10의 자기 비교도 상대적으로 약하다. one-hundred/100을 제외하면, 더 오래된 mpnet이 Qwen보다 단어와 숫자를 더 잘 맞춘다. 단위 환산은 흐릿하다. 저자들은 1 meter를 100 centimeters, 1000 millimeters, 0.001 kilometers와 비교했고, 다른 물리량에도 비슷한 묶음을 썼다. 이상은 1.0에 가까운 수평선이다. 결과적으로 수평이면서 1.0에 가까운 선은 하나도 없었다. Qwen의 선은 조금 더 높고, mpnet은 양이 커지면 급격히 떨어진다. 가장 좋은 경우는 Qwen에서 초와 밀리초로, 0.9를 넘고 계속 높게 유지되는 유일한 선이었다. 작은 벤치마크 PhysScore. 저자들은 임베딩 유사도와 물리적 거리 사이의 Kendall tau, 그리고 쌍별 정확도(PAC = 50 + tau/2)로 각 모델을 채점했다. 무작위 기준선은 tau 0, PAC 50이다. 모든 모델이 이를 넘지만 tau가 54를 넘는 모델은 없다. 최고는 multilingual-e5-large-instruct로 tau 53.23(PAC 76.61)이고, 그다음은 LaBSE 51.31과 e5-large-v2 47.35다. 가장 약한 것은 nomic-embed-text-v1.5의 18.57과 embeddinggemma-300m의 24.40이다. 평균은 37.59다. 규모는 도움이 되지 않는다. Qwen3-Embedding-0.6B는 40.47, 4B는 34.22, 8B는 32.27이다. 저자들은 이 결과도 여전히 낙관적이라고 밝힌다. 모든 모델이 당연히 맞히는 대각선 때문에 무작위 기준선이 불리하기 때문이다.
가장 어려운 측정. 질량이 가장 어렵고 모델 평균 tau는 34.54다. 부피는 37.03, 길이는 38.48, 시간은 40.30이다. 일부 모델과 범위의 조합은 0 아래로 떨어지는데, 이는 모델이 값을 반대 방향으로 정렬한다는 뜻이다. 평균적으로는 medium 범위가 가장 어렵다. 재보정으로는 구할 수 없다. 한 가지 반론은 단순 코사인이 모든 차원에 같은 가중치를 주어 유용한 정보를 흐릴 수 있다는 것이다. 저자들은 선형 프로브로 이를 시험했다. 두 임베딩 벡터의 절대 차이에 대한 선형 회귀이며, 훈련과 테스트 분할을 쓴다. 평균 tau는 33.4에서 36.4로 3.0만큼 올랐다. 가장 큰 향상은 e5-large-v2의 +12.3이고, 그래도 54 아래에 머문다. 나빠진 모델도 있다. 예를 들어 granite-embedding-107m-multilingual(-8.9)과 embeddinggemma-300m(-7.3)이다. 더 큰 Qwen 모델은 작은 모델보다 더 많이 좋아졌지만, 전체 정렬은 여전히 낮다. 문자열 유사성이 유력한 원인이다. 저자들은 -1000에서 1000 사이의 무작위 정수와 소수를 만들어 짝짓고, 임베딩 유사도를 세 기준과 상관시켰다. 문자 수준 Levenshtein 거리, 토큰 수준 Levenshtein 거리, 실제 수치 거리다. 표 4에서 임베딩 유사도는 값보다 텍스트 형태를 더 따른다. Qwen3-Embedding-0.6B는 전체 쌍에서 상관이 문자 기준 47.6, 수치 근접도 기준 11.7이다. embeddinggemma-300m은 51.6 대 3.3이다. 논문은 embeddinggemma의 결과를 문자열 유사성과의 연결이 가장 강하고 수치 거리와의 연결이 가장 약한 것 중 하나라고 부른다.
배경과 중요성
대조 학습은 비슷한 텍스트를 가깝게, 비슷하지 않은 텍스트를 멀게 만든다. 얻어진 벡터는 분류, 검색, 군집화에 쓰인다. MTEB 같은 벤치마크는 여러 과제를 한꺼번에 채점하지만, 이 논문은 하나의 속성에 "미시적 렌즈"를 댄다. 같은 벡터가 의미 표현으로 제시되기 때문에 이것이 중요하다. "2 kilometers"가 "2 meters"보다 "2000 meters"에 더 가깝지 않다면, 양에 민감한 용도에는 숨은 약점이 있다.
우리의 해석
주장이 정확하고, 세 가지 서로 다른 조사 방법, 즉 히트맵, 순위 벤치마크, 문자열 중복 분석에서 증거가 일관된다. 더 크거나 더 새로운 모델이 뚜렷이 낫지 않다는 결과는 저자들 자신의 설명과 맞는다. 학습 목표가 수치 순서를 요구하지 않는다면, 용량이 늘어도 표면 형태를 더 꼼꼼히 배울 뿐일 수 있다. 저자들도 그렇게 말한다. 대조 학습은 물리적 구조에 가하는 압력이 너무 약할 수 있고, 그런 정렬은 창발적 능력이거나 명시적인 벤치마크 목표여야 한다. 또한 임베딩 크기에 따른 추세가 보이지 않으므로 차원 한계설에는 반대한다.
저자들은 반대편에 대해서도 균형 잡혀 있다. 많은 검색과 군집화 작업에서 양은 크게 중요하지 않고, 어휘적 유사성은 식별자, 버전 번호, 날짜, 제품 코드에 유용한 편향이다. 그들의 논점은 의미적 유사도를 약속하는 모델이라면 그래도 "2 kilometers"를 "2 meters"보다 "2000 meters"에 더 가깝다고 판단해야 한다는 것이다.
한계와 열린 질문
저자들은 시험한 모델의 범위가 필연적으로 제한적이라고 밝힌다. 표 4의 상관은 연관성이지 인과의 증명이 아니며, 논문도 설명을 증거와 그럴듯한 이유로 서술한다. 우리는 논문 본문만 읽었고, 코드와 부록 표는 읽지 않았다. 본문에서 표 3은 분할 실험의 코사인 점수를 표 1과 다르게 제시하고(예를 들어 e5-large-v2), 본문은 최고 프로브 결과를 47 tau라고 쓰지만 표에는 48.1이 있다. 본문은 이 차이를 설명하지 않으므로 작은 수치는 조심해서 다뤄야 한다. 논문의 테스트 문자열은 짧고 깔끔한 영어식 표현이다. 어수선한 실제 텍스트에서 모델이 어떻게 행동하는지, 그리고 양에 대한 명시적 지도를 넣은 학습 목표가 격차를 줄일 수 있는지는 열려 있다.
독자를 위한 실용적 제안
사양서, 로그, 레시피, 실험 데이터를 임베딩으로 검색하는 개발자는 수치의 근접성이나 단위의 동등성이 임베딩 뒤에도 유지된다고 가정하면 안 된다. 확인은 저렴하다. 자신의 모델로 "2 kilometers", "2000 meters", "2 meters"를 임베딩하고 비교하면 된다. 순서가 틀리다면 임베딩 전에 단위와 숫자를 정규화하거나, 임베딩을 구조화된 필터와 결합한다. 에이전트형 또는 과학용 시스템을 만드는 팀은 이를 드문 예외가 아니라 알려진 사각지대로 다뤄야 한다. 모델 개발자도 이 논문의 아이디어를 빌려 물리적 측정을 작은 추가 품질 지표로 쓸 수 있다.
Sources
FAQ
논문 'Embedding Models Measure in Peculiar Ways'는 무엇을 시험했나요?
24개 임베딩 모델이 길이, 질량, 부피, 시간 같은 물리량을 반영하는지 시험했습니다. 예를 들어 '1 meter'가 '15 kilometers'보다 '105 centimeters'에 더 가까운지 봅니다. 저자들은 정렬이 약하다고 보고합니다.
가장 좋은 모델의 점수는 어느 정도인가요?
PhysScore에서 가장 좋은 모델은 multilingual-e5-large-instruct이며 Kendall tau는 53.23(PAC 76.61)입니다. tau가 54를 넘는 모델은 없고, 모델 평균은 37.59입니다.
문제가 단지 유사도 함수의 보정 부족인가요?
저자들은 선형 프로브로 이를 시험했고 뒷받침하는 증거가 거의 없다고 봅니다. 평균 tau는 33.4에서 36.4로만 올랐고, 재보정 후에도 54를 넘는 모델은 없습니다.