嵌入模型量不準物理量:24 個模型的測量測試
Opitz 與 Michail 的論文測試 24 個嵌入模型能否反映長度、質量、體積和時間。結果是只有很弱的對齊:最好的 PhysScore tau 為 53.23,沒有模型超過 54。嵌入相似度更貼近字串形式而非數值,線性探針重新校準也僅平均提高 3.0。作者認為對比訓練可能對數量結構的施壓不足。
论文说了什么
2026 年 9 月 17 日,苏黎世大学计算语言学系的 Juri Opitz 和 Andrianos Michail 在 arXiv 上发布了论文《Embedding Models Measure in Peculiar Ways》(arXiv 2609.20821,cs.CL)。论文的问题很窄,也很好检验:文本嵌入(embedding)是否反映了质量、距离、时间和体积这类物理量?这些物理量有唯一的、客观的“等价”与“距离”概念。“1 meter”和“100 centimeters”是同一个量。“105 centimeters”在物理上比“15 kilometers”更接近“1 meter”。如果嵌入相似度真的在度量语义,它就应该尊重这一点。
作者的回答是:做不到。在他们测试的全部 24 个嵌入模型上,物理测量只被很弱地建模,并且出现了作者所说的“相当奇特”的测量模式。论文还报告,测量字符串之间的相似度与表面字符串相似度强相关,而重新校准相似度函数也不能解决问题。代码公开在 github.com/flipz357/embed-and-measure。
实验怎么做
设置很简单。嵌入模型把文本映射成向量。作者用数字加单位拼出字符串,例如“10 kilometers”和“1 meter”,分别嵌入,再计算标准的余弦相似度。对某个范围内的每一对数值重复这一步,画成热力图。理想的热力图应当是:两个数值的物理距离越大,相似度越平滑地下降。
测试的物理量是长度(米)、质量(千克)、体积(升)和时间(秒)。数值范围有五类:local(0 到 10)、medium(0 到 1,000)、log(最大到 100,000)、sign(-100 到 100,包含负数)和 scientific(科学计数法)。每个范围大约切成 20 步。local 范围还用英文单词写出(如“five meters”),覆盖 0 到 10 的每个整数以及一百,用来对比数字写法和文字写法。
24 个模型既有较老的 BERT 类编码器,也有较新的基于 LLM 的解码器。嵌入维度从 384(MiniLM)到 4096(Qwen3-Embedding-8B)。细读时,作者选了 all-mpnet-base-v2(编码器)和 Qwen3-Embedding-0.6B(解码器),因为两者都是下载量最高的嵌入模型之一。其他模型的结果放在附录。
论文中的关键发现
热力图杂乱无章。 除了相同字符串必然匹配的对角线,图案大多不规则。作者指出了非单调的伪影、横向和纵向的条带,以及与物理距离不一致的局部邻域。两个示例模型大致能区分正数和负数。在 local 范围上出现“棋盘格”图案:整数对整数能对齐,整数对小数则不能。对两个模型来说,某单位的 2.5 与 7.5 的相似度,高于与 3 的相似度。这与物理顺序相反。 数字与文字。 嵌入几乎抓不住“one”和“1”相等这件事。Qwen 给 one 和 1 很高的相似度,但也给 one 和 0 很高的相似度,在升和千克上最明显。mpnet 则给 one 和 1 明显更高的相似度,高于 one 和其他任何数字。Qwen 认为“nine liters”与所有用数字写的升数量都不相似,nine/9 和 ten/10 的自我比较也相对较弱。除了 one-hundred/100,较老的 mpnet 在文字与数字对齐上好于 Qwen。 单位换算很模糊。 作者把 1 meter 与 100 centimeters、1000 millimeters、0.001 kilometers 比较,其他物理量也有类似的组合。理想情况是一条接近 1.0 的水平线。结果没有一条线是水平且接近 1.0 的。Qwen 的线略高,而 mpnet 在数值变大时急剧下滑。最好的情形是 Qwen 中的秒对毫秒,这是唯一超过 0.9 并保持较高的线。 一个小基准 PhysScore。 作者用嵌入相似度与物理距离之间的 Kendall tau,以及成对准确率(PAC = 50 + tau/2)给每个模型打分。随机基线的 tau 为 0,PAC 为 50。所有模型都胜过随机基线,但没有模型的 tau 超过 54。最好的是 multilingual-e5-large-instruct,tau 为 53.23(PAC 76.61),其后是 LaBSE 的 51.31 和 e5-large-v2 的 47.35。最弱的是 nomic-embed-text-v1.5(18.57)和 embeddinggemma-300m(24.40)。平均值为 37.59。规模没有帮助:Qwen3-Embedding-0.6B 得 40.47,4B 得 34.22,8B 得 32.27。作者指出,这个结果其实仍偏乐观,因为随机基线吃亏于所有模型都能答对的对角线。
哪些测量最难。 质量最难,各模型平均 tau 为 34.54,体积为 37.03,长度为 38.48,时间为 40.30。个别模型与范围的组合低于零,意味着模型把数值排成了相反的顺序。平均而言,medium 范围最难。 重新校准救不了它。 一种质疑是:普通余弦对每个维度一视同仁,可能模糊了有用信息。作者用线性探针来检验:在训练集与测试集划分下,对两个嵌入向量的绝对差做线性回归。平均 tau 从 33.4 升到 36.4,只增加 3.0。最大的提升是 e5-large-v2 的 +12.3,最终仍低于 54。有些模型反而变差,例如 granite-embedding-107m-multilingual(-8.9)和 embeddinggemma-300m(-7.3)。较大的 Qwen 模型比小的收益更多,但总体对齐程度仍然很低。 字符串相似度可能是主因。 作者生成 -1000 到 1000 之间的随机整数和小数,两两配对,把嵌入相似度与三种参照做相关:字符级 Levenshtein 距离、词元级 Levenshtein 距离和真实数值距离。表 4 显示,嵌入相似度更贴近文本形式,而不是数值。对 Qwen3-Embedding-0.6B,全部数对上的相关在字符级为 47.6,在数值上只有 11.7。embeddinggemma-300m 为 51.6 对 3.3。论文称 embeddinggemma 的结果是与字符串相似度关联最强、与数值距离关联最弱的之一。
背景:这为什么重要
对比学习把相似文本拉近,把不相似文本推远。得到的向量被用于分类、检索和聚类。
MTEB 这样的基准一次评估多种任务,而这篇论文用“显微镜”式的窄视角看一个属性。这很重要,因为同样的向量被当作语义表示。如果“2 kilometers”离“2000 meters”并不比离“2 meters”更近,那么对数量敏感的用法就藏着一个弱点。
我们的解读
论文的主张很精确,三种不同的探测方式,即热力图、排名基准和字符串重叠分析,证据彼此一致。更大或更新的模型没有明显更好,这与作者自己的解释相吻合:如果训练目标从不要求数值顺序,更多的容量可能只是把表面形式学得更透。作者自己也这样说:对比训练对物理结构的压力可能太小,这种对齐要么是一种涌现能力,要么必须成为明确的基准目标。他们也反对“维度限制”的说法,因为没有看到与嵌入维度相关的趋势。
作者对另一面也很平衡。对很多检索和聚类任务来说,数量关系作用不大,而词面相似对标识符、版本号、日期和产品编码是有用的偏置。他们的论点是:一个宣称度量语义相似度的模型,仍应当判定“2 kilometers”与“2000 meters”比与“2 meters”更接近。
局限与未解问题
作者明确说,所测模型的范围必然有限。表 4 的相关只是关联,不是因果证明,论文也把解释表述为证据和一种合理的原因。我们只读了论文正文,没有读代码,也没有读附录表格。
在正文里,表 3 给出的拆分实验余弦分数与表 1 不同(例如 e5-large-v2),文字里把最好的探针结果写成 47 tau,而表中是 48.1。正文没有解释这些差异,所以对较小的数字要谨慎。论文里的测试字符串是短小、干净、英文风格的短语。模型面对杂乱的真实文本会怎样,以及带有明确数量监督的训练目标能否缩小差距,仍是开放问题。
给读者的实用建议
如果开发者用嵌入去检索规格、日志、食谱或实验数据,不要假设数值接近或单位等价在嵌入后仍然成立。检查成本很低:用你的模型嵌入“2 kilometers”“2000 meters”和“2 meters”,再比较相似度。
若顺序不对,就在嵌入前统一单位和数字,或者把嵌入与结构化过滤结合起来。构建智能体或科学系统的团队,应把这当作已知盲区,而不是罕见的边角情况。模型开发者也可以借用论文的思路,把物理测量当作一个额外的小型质量指标。
Sources
FAQ
这篇论文《Embedding Models Measure in Peculiar Ways》测试了什么?
它测试 24 个嵌入模型是否反映长度、质量、体积和时间等物理量,例如“1 meter”是否比“15 kilometers”更接近“105 centimeters”。作者发现对齐程度很弱。
表现最好的模型得分如何?
PhysScore 上最好的是 multilingual-e5-large-instruct,Kendall tau 为 53.23(PAC 76.61)。没有模型的 tau 超过 54,各模型平均为 37.59。
问题只是相似度函数校准不好吗?
作者用线性探针检验,发现支持这一说法的证据很少。平均 tau 只从 33.4 升到 36.4,重新校准后也没有模型超过 54。