埋め込みモデルは物理量を正しく測れない:24モデルの検証
OpitzとMichailの論文は、24の埋め込みモデルが長さ、質量、体積、時間を反映するかを検証した。整合は弱く、PhysScoreの最良tauは53.23で、54を超えるモデルはない。類似度は数値より文字列の形に沿い、線形プローブによる再調整も平均で3.0しか改善しなかった。著者は、対照学習が量の構造への圧力として弱いのではないかと考えている。
論文の内容
2026年9月17日、チューリッヒ大学計算言語学科の Juri Opitz 氏と Andrianos Michail 氏が、論文「Embedding Models Measure in Peculiar Ways」(arXiv 2609.20821、cs.CL)を公開した。問いは狭く、検証しやすい。テキスト埋め込み(embedding)は、質量、距離、時間、体積といった物理量を反映しているか。これらの量には、唯一で客観的な「等価」と「距離」の概念がある。「1 meter」と「100 centimeters」は同じ量を表す。「105 centimeters」は、「15 kilometers」よりも物理的に「1 meter」に近い。埋め込みの類似度が本当に意味を測るなら、これを尊重するはずだ。
著者らの答えは「していない」である。テストした24の埋め込みモデルすべてで、物理的な測定は弱くしかモデル化されておらず、著者が「かなり奇妙な」と呼ぶ測定パターンが現れた。さらに、測定文字列どうしの類似度は表層的な文字列の類似性と強く結びついており、類似度関数を再調整しても改善しないと報告している。コードは github.com/flipz357/embed-and-measure で公開されている。
実験の仕組み
設定は単純だ。埋め込みモデルはテキストをベクトルに写す。著者らは数値と単位から「10 kilometers」や「1 meter」のような文字列を作り、両方を埋め込み、標準的なコサイン類似度を計算する。ある範囲の値のすべての組でこれを繰り返し、ヒートマップにする。理想的なヒートマップでは、二つの値の物理的な距離が広がるほど、類似度がなめらかに下がる。
対象の量は、長さ(メートル)、質量(キログラム)、体積(リットル)、時間(秒)である。値の範囲は五種類ある。local(0から10)、medium(0から1,000)、log(最大100,000)、sign(-100から100、負の数を含む)、scientific(指数表記)だ。各範囲は約20ステップに分けられる。local の範囲は、0から10までの各整数と one-hundred について、「five meters」のように単語でも書かれ、数字表記と単語表記を比べられるようにしてある。
24のモデルは、古い BERT 系エンコーダーから、最近の LLM ベースのデコーダーまで幅がある。埋め込みの次元数は384(MiniLM)から4096(Qwen3-Embedding-8B)までだ。詳しい分析には、all-mpnet-base-v2(エンコーダー)と Qwen3-Embedding-0.6B(デコーダー)が選ばれた。どちらも最もダウンロードされている埋め込みモデルに数えられるからだ。他のモデルの結果は付録にある。
論文の主な発見
ヒートマップは不規則である。 同一文字列が自明に一致する対角線を除くと、模様はおおむね不規則だ。著者らは、単調でないアーティファクト、横縞と縦縞、物理的な距離に沿わない局所的な近傍を挙げている。二つの例示モデルは、負の値と正の値をおおまかに区別できる。local の範囲では「市松模様」が現れる。整数どうしの組は合うが、整数と小数の組は合わない。両モデルで、ある単位の 2.5 は、3 よりも 7.5 に類似度が高い。これは物理的な順序と逆である。 数字と単語。 埋め込みは「one」と「1」が等しいことをほとんど捉えていない。Qwen は one と 1 に高い類似度を与えるが、one と 0 にも高い類似度を与える。リットルとキログラムで特に顕著だ。mpnet は、one と 1 に、one と他のどの数よりも明らかに高い類似度を与える。Qwen は「nine liters」を、数字で書かれたすべてのリットル量と似ていないと評価し、nine/9 と ten/10 の自己比較も比較的弱い。one-hundred/100 を除けば、古い mpnet の方が Qwen より単語と数字をよく揃える。 単位換算はあいまいである。 著者らは、1 meter を 100 centimeters、1000 millimeters、0.001 kilometers と比べ、他の量でも同様の組を使った。理想は 1.0 に近い水平線だ。結果として、水平で 1.0 に近い線は一本もなかった。Qwen の線はやや高く、mpnet は量が大きくなると急に落ちる。最良の例は Qwen での秒とミリ秒で、0.9 を超えて高いまま保つ唯一の線だった。 小さなベンチマーク PhysScore。 著者らは、埋め込み類似度と物理的距離の Kendall の tau、およびペアワイズ精度(PAC = 50 + tau/2)で各モデルを採点した。ランダムのベースラインは tau が 0、PAC が 50 である。全モデルがこれを上回るが、tau が 54 を超えるモデルはない。最良は multilingual-e5-large-instruct で tau 53.23(PAC 76.61)、次が LaBSE の 51.31、e5-large-v2 の 47.35 である。最も弱いのは nomic-embed-text-v1.5 の 18.57 と embeddinggemma-300m の 24.40 だ。平均は 37.59。規模は助けにならない。Qwen3-Embedding-0.6B は 40.47、4B は 34.22、8B は 32.27 である。著者は、この結果もまだ楽観的だと述べる。全モデルが自明に正解する対角線のせいで、ランダムのベースラインが不利になるからだ。
どの測定が最も難しいか。 質量が最も難しく、モデル平均の tau は 34.54 である。体積は 37.03、長さは 38.48、時間は 40.30 だった。一部のモデルと範囲の組み合わせはゼロを下回り、これは値を逆の順序に並べていることを意味する。平均では medium の範囲が最も難しい。 再調整では救えない。 一つの反論は、素のコサインは全次元に同じ重みを与えるため、有用な情報がぼやけるのではないか、というものだ。著者らは線形プローブでこれを試した。二つの埋め込みベクトルの絶対差に対する線形回帰で、訓練とテストの分割を使う。平均 tau は 33.4 から 36.4 へ、3.0 だけ上がった。最大の改善は e5-large-v2 の +12.3 で、それでも 54 を下回る。悪化したモデルもあり、例えば granite-embedding-107m-multilingual(-8.9)と embeddinggemma-300m(-7.3)である。大きな Qwen モデルは小さなモデルより多く改善したが、全体の整合は低いままだ。 文字列の類似性が有力な要因。 著者らは、-1000 から 1000 の間でランダムな整数と小数を作って対にし、埋め込み類似度を三つの基準と相関させた。文字レベルの Levenshtein 距離、トークンレベルの Levenshtein 距離、真の数値距離である。表 4 では、埋め込み類似度は数値より文字列の形に沿っている。Qwen3-Embedding-0.6B では、全ペアでの相関が、文字では 47.6、数値の近さでは 11.7 である。embeddinggemma-300m では 51.6 対 3.3 だった。論文は、embeddinggemma の結果を、文字列類似度との結びつきが最も強く、数値距離との結びつきが最も弱いものの一つとしている。
背景と重要性
対照学習は、似たテキストを近づけ、似ていないテキストを遠ざける。得られたベクトルは、分類、検索、クラスタリングに使われる。
MTEB のようなベンチマークは多数のタスクを一度に採点するが、この論文は一つの性質に「ミクロのレンズ」を向けている。これが重要なのは、同じベクトルが意味表現として提示されているからだ。「2 kilometers」が「2 meters」より「2000 meters」に近くないなら、量に敏感な用途には隠れた弱点がある。
私たちの読み
主張は明確で、三つの異なる調べ方、つまりヒートマップ、順位づけのベンチマーク、文字列の重なりの分析で、証拠が一貫している。大きいモデルや新しいモデルが明確に良くはならないという結果は、著者自身の説明と合う。学習目標が数値の順序を求めないなら、容量が増えても表層の形をより丁寧に学ぶだけかもしれない。著者もそう述べている。対照学習は物理的な構造への圧力が弱すぎる可能性があり、そのような整合は創発的な能力か、明示的なベンチマーク目標でなければならない。また、埋め込みの次元数との傾向が見られないため、次元の限界説には反対している。
著者は反対側の見方にも公平である。多くの検索やクラスタリングの仕事では量はあまり重要でなく、語彙的な類似性は、識別子、バージョン番号、日付、製品コードにとって有用な偏りだ。彼らの論点は、意味的類似度をうたうモデルは、それでも「2 kilometers」を「2 meters」より「2000 meters」に近いと判定すべきだ、というものである。
限界と未解決の問い
著者は、テストしたモデルの範囲は必然的に限られていると述べている。表 4 の相関は関連であり、因果の証明ではない。論文も説明を証拠と有力な理由として述べている。私たちが読んだのは論文の本文だけで、コードも付録の表も読んでいない。
本文では、表 3 が示す分割実験のコサイン値が表 1 と異なり(例えば e5-large-v2)、本文は最良のプローブ結果を 47 tau と書くが、表では 48.1 である。本文はこれらの違いを説明していないので、小さな数字は慎重に扱うべきだ。論文のテスト文字列は、短く、整った、英語風の句である。雑然とした実際のテキストでモデルがどう振る舞うか、また明示的な量の教師信号を持つ学習目標が差を縮められるかは、未解決のままだ。
読者への実用的な示唆
仕様書、ログ、レシピ、実験データを埋め込みで検索する開発者は、数値の近さや単位の等価が埋め込み後も保たれると考えてはいけない。確認は安価だ。自分のモデルで「2 kilometers」「2000 meters」「2 meters」を埋め込み、類似度を比べればよい。
順序が違うなら、埋め込みの前に単位と数値を正規化するか、埋め込みと構造化フィルターを組み合わせる。エージェント型や科学向けのシステムを作るチームは、これをまれな例外ではなく、既知の盲点として扱うべきだ。モデル開発者も、この論文の考え方を借りて、物理測定を小さな追加の品質指標にできる。
Sources
FAQ
論文「Embedding Models Measure in Peculiar Ways」は何を検証したのですか。
24の埋め込みモデルが、長さ、質量、体積、時間といった物理量を反映するかを検証しました。例えば「1 meter」が「15 kilometers」より「105 centimeters」に近いかどうかです。著者は整合が弱いと報告しています。
最も良いモデルのスコアはどれくらいですか。
PhysScoreで最良なのは multilingual-e5-large-instruct で、Kendall の tau は53.23(PAC 76.61)です。tau が54を超えるモデルはなく、モデル平均は37.59です。
問題は類似度関数の再調整不足にすぎないのですか。
著者は線形プローブで検証し、その説を支持する証拠はほとんどないとしています。平均 tau は33.4から36.4にしか上がらず、再調整後も54を超えるモデルはありません。