Les plongements peinent à mesurer : test de 24 modèles

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Un article d'Opitz et Michail teste 24 modèles de plongement sur des mesures physiques : longueur, masse, volume et temps. L'alignement est faible. Le meilleur tau PhysScore est de 53,23, aucun modèle ne dépasse 54. La similarité suit la forme des chaînes plus que la valeur, et une sonde linéaire ne gagne que 3,0 points en moyenne.

Ce que rapporte l'article

Le 17 septembre 2026, Juri Opitz et Andrianos Michail, du département de linguistique computationnelle de l'Université de Zurich, ont publié « Embedding Models Measure in Peculiar Ways » (arXiv 2609.20821, cs.CL). La question posée est étroite et testable : les plongements de texte (embeddings) reflètent-ils les mesures physiques de masse, de distance, de temps et de volume ? Ces grandeurs ont une notion unique et objective d'équivalence et de distance. « 1 meter » et « 100 centimeters » désignent la même quantité. « 105 centimeters » est physiquement plus proche de « 1 meter » que ne l'est « 15 kilometers ». Si la similarité entre plongements mesure vraiment le sens, elle devrait respecter cela.

La réponse des auteurs est négative. Sur les 24 modèles testés, la mesure physique n'est modélisée que faiblement, et les modèles présentent ce que les auteurs appellent des motifs de mesure « assez singuliers ». L'article rapporte aussi que la similarité entre chaînes de mesure est fortement associée à la ressemblance superficielle des chaînes, et qu'un réétalonnage de la fonction de similarité ne règle pas le problème. Le code est public sur github.com/flipz357/embed-and-measure.

Comment fonctionne le test

Le dispositif est simple. Un modèle de plongement associe un vecteur à un texte. Les auteurs construisent une chaîne à partir d'un nombre et d'une unité, par exemple « 10 kilometers » et « 1 meter », plongent les deux, puis calculent la similarité cosinus standard. Ils répètent l'opération pour chaque paire de valeurs d'une plage et tracent le résultat sous forme de carte de chaleur. Sur une carte idéale, la similarité décroît en douceur quand la distance physique entre les deux valeurs augmente.

Les grandeurs sont la longueur (mètres), la masse (kilogrammes), le volume (litres) et le temps (secondes). Les plages sont : local (de 0 à 10), medium (de 0 à 1 000), log (jusqu'à 100 000), sign (de -100 à 100, avec des nombres négatifs) et scientific (notation exponentielle). Chaque plage est découpée en environ 20 pas. La plage locale est aussi écrite en toutes lettres (« five meters ») pour chaque entier de zéro à dix, plus one-hundred, afin de comparer chiffres et mots.

Les 24 modèles vont des anciens encodeurs de type BERT aux décodeurs récents fondés sur des LLM. Les dimensions des plongements vont de 384 (MiniLM) à 4096 (Qwen3-Embedding-8B). Pour l'examen détaillé, les auteurs retiennent all-mpnet-base-v2 (un encodeur) et Qwen3-Embedding-0.6B (un décodeur), car tous deux figurent parmi les modèles de plongement les plus téléchargés. Les résultats des autres modèles se trouvent en annexe.

Principaux résultats

Les cartes de chaleur semblent erratiques. Hormis la diagonale, où des chaînes identiques coïncident trivialement, les motifs sont surtout irréguliers. Les auteurs signalent des artefacts non monotones, des bandes horizontales et verticales, et des voisinages locaux qui ne suivent pas la distance physique. Les deux modèles d'exemple séparent grosso modo les valeurs négatives des positives. Sur la plage locale apparaît un « motif en damier » : les paires entier-entier s'alignent, les paires entier-décimal non. Pour les deux modèles, 2,5 d'une unité est plus proche de 7,5 de cette unité que de 3 de cette unité. C'est l'inverse de l'ordre physique. Chiffres contre mots. Les plongements saisissent à peine que « one » et « 1 » sont égaux. Qwen donne une similarité élevée entre one et 1, mais aussi entre one et 0, surtout pour les litres et les kilogrammes. mpnet donne à one et 1 une similarité nettement plus haute qu'à one et tout autre nombre. Qwen juge « nine liters » dissemblable de toutes les quantités en litres écrites en chiffres, et sa comparaison de nine/9 et ten/10 avec eux-mêmes est relativement faible. À l'exception de one-hundred/100, le plus ancien mpnet aligne mieux mots et chiffres que Qwen. La conversion d'unités est floue. Les auteurs comparent 1 meter à 100 centimeters, 1000 millimeters et 0.001 kilometers, et des séries analogues pour les autres grandeurs. L'idéal serait une droite horizontale proche de 1,0. Aucune courbe n'est horizontale ni proche de 1,0. Les courbes de Qwen sont un peu plus hautes, et mpnet chute fortement quand les quantités grandissent. Le meilleur cas est celui des secondes contre les millisecondes chez Qwen, la seule courbe qui dépasse 0,9 et reste haute. Un petit banc d'essai, PhysScore. Les auteurs notent chaque modèle avec le tau de Kendall entre similarité de plongement et distance physique, et avec la précision par paires (PAC = 50 + tau/2). La référence aléatoire a un tau de 0 et un PAC de 50. Tous les modèles la dépassent, mais aucun n'atteint un tau de 54. Le meilleur est multilingual-e5-large-instruct avec un tau de 53,23 (PAC 76,61), suivi de LaBSE à 51,31 et de e5-large-v2 à 47,35. Les plus faibles sont nomic-embed-text-v1.5 à 18,57 et embeddinggemma-300m à 24,40. La moyenne est de 37,59. L'échelle n'aide pas : Qwen3-Embedding-0.6B obtient 40,47, le modèle 4B 34,22 et le modèle 8B 32,27. Les auteurs notent que ce résultat reste optimiste, car la référence aléatoire est pénalisée par la diagonale triviale que tous les modèles réussissent.

Quelles mesures sont les plus difficiles. La masse est la plus difficile, avec un tau moyen de 34,54 sur les modèles, contre 37,03 pour le volume, 38,48 pour la longueur et 40,30 pour le temps. Certaines combinaisons de modèle et de plage passent sous zéro, ce qui signifie que le modèle ordonne les valeurs en sens inverse. La plage medium est la plus difficile en moyenne. Le réétalonnage ne sauve rien. Une objection possible : le cosinus simple donne le même poids à toutes les dimensions et peut brouiller une information utile. Les auteurs testent cela avec une sonde linéaire, une régression linéaire sur la différence absolue des deux vecteurs, avec une séparation entre apprentissage et test. Le tau moyen passe de 33,4 à 36,4, soit un gain de 3,0. Le plus grand gain est de +12,3 pour e5-large-v2, qui reste sous 54. Certains modèles se dégradent, par exemple granite-embedding-107m-multilingual (-8,9) et embeddinggemma-300m (-7,3). Les plus grands modèles Qwen gagnent davantage que le petit, mais l'alignement global reste faible. La ressemblance des chaînes est le moteur probable. Les auteurs génèrent des entiers et des décimaux aléatoires entre -1000 et 1000, les apparient, et corrèlent la similarité de plongement avec trois références : la distance de Levenshtein au niveau des caractères, la distance de Levenshtein au niveau des tokens, et la vraie distance numérique. Dans le tableau 4, la similarité suit davantage la forme du texte que la valeur. Pour Qwen3-Embedding-0.6B, la corrélation sur toutes les paires est de 47,6 avec les caractères et de 11,7 avec la proximité numérique. Pour embeddinggemma-300m, elle est de 51,6 contre 3,3. L'article présente le résultat d'embeddinggemma comme l'un des liens les plus forts avec la similarité de chaînes et l'un des plus faibles avec la distance numérique.

Contexte et enjeux

L'entraînement contrastif rapproche les textes similaires et éloigne les textes dissemblables. Les vecteurs obtenus servent à la classification, à la recherche et au regroupement.

Des bancs d'essai comme MTEB évaluent les modèles sur de nombreuses tâches à la fois, alors que cet article prend une « loupe » étroite sur une seule propriété. L'enjeu tient à ce que les mêmes vecteurs sont présentés comme des représentations sémantiques. Si « 2 kilometers » n'est pas plus proche de « 2000 meters » que de « 2 meters », les usages sensibles aux quantités ont un point faible caché.

Notre lecture

L'affirmation est précise, et les preuves concordent entre trois sondes différentes : les cartes de chaleur, un banc d'essai de classement et une analyse du recouvrement de chaînes. Le fait que les modèles plus grands ou plus récents ne fassent pas nettement mieux cadre avec l'explication des auteurs. Si l'objectif d'entraînement ne demande jamais l'ordre numérique, une capacité accrue peut simplement apprendre plus finement la forme de surface. Les auteurs le disent eux-mêmes : l'entraînement contrastif exerce peut-être trop peu de pression sur la structure physique, et un tel alignement devrait être une capacité émergente ou un objectif explicite des bancs d'essai. Ils écartent aussi une limite due à la dimension, faute de tendance liée à la taille des plongements.

Les auteurs restent nuancés sur l'autre face. Pour beaucoup de tâches de recherche et de regroupement, les quantités comptent peu, et la similarité lexicale est un biais utile pour les identifiants, les numéros de version, les dates et les codes produit. Leur point est qu'un modèle qui promet une similarité sémantique devrait tout de même juger « 2 kilometers » plus proche de « 2000 meters » que de « 2 meters ».

Limites et questions ouvertes

Les auteurs précisent que leur ensemble de modèles est forcément limité. Les corrélations du tableau 4 montrent une association, non une preuve de cause, et l'article formule son explication comme un indice et une raison plausible. Nous n'avons lu que le texte de l'article, ni le code ni les tableaux de l'annexe.

Dans le texte principal, le tableau 3 donne pour l'expérience avec séparation des scores cosinus qui diffèrent du tableau 1 (par exemple e5-large-v2), et le texte cite le meilleur résultat de sonde comme 47 tau alors que le tableau indique 48,1. Le texte n'explique pas ces écarts, il faut donc traiter les petits chiffres avec prudence. Les chaînes de test de l'article sont des expressions courtes, propres et de style anglais. Reste ouvert le comportement des modèles sur des textes réels et désordonnés, et la question de savoir si un objectif d'entraînement avec supervision explicite des quantités comblerait l'écart.

Conseils pratiques

Les développeurs qui utilisent des plongements pour chercher dans des spécifications, des journaux, des recettes ou des données de laboratoire ne devraient pas supposer que la proximité numérique ou l'équivalence d'unités survit au plongement. Le contrôle est peu coûteux : plongez « 2 kilometers », « 2000 meters » et « 2 meters » avec votre modèle, puis comparez.

Si l'ordre est faux, normalisez les unités et les nombres avant le plongement, ou combinez les plongements avec des filtres structurés. Les équipes qui bâtissent des systèmes agentiques ou scientifiques devraient y voir un angle mort connu, non un cas marginal rare. Les concepteurs de modèles peuvent reprendre l'idée de l'article et utiliser la mesure physique comme petite métrique de qualité supplémentaire.

Sources

FAQ

Que teste l'article « Embedding Models Measure in Peculiar Ways » ?

Il teste si 24 modèles de plongement reflètent des mesures physiques de longueur, de masse, de volume et de temps, par exemple si « 1 meter » est plus proche de « 105 centimeters » que de « 15 kilometers ». Les auteurs constatent un alignement faible.

Quel score obtient le meilleur modèle ?

Le meilleur sur PhysScore est multilingual-e5-large-instruct, avec un tau de Kendall de 53,23 (PAC 76,61). Aucun modèle ne dépasse un tau de 54, et la moyenne des modèles est de 37,59.

Le problème vient-il seulement d'une fonction de similarité mal étalonnée ?

Les auteurs testent cette idée avec une sonde linéaire et trouvent peu d'appui. Le tau moyen ne passe que de 33,4 à 36,4, et aucun modèle ne dépasse 54 après réétalonnage.