Embeddings messen schlecht: Test von 24 Modellen
Eine Arbeit von Opitz und Michail prüft 24 Embedding-Modelle an physikalischen Messwerten: Länge, Masse, Volumen und Zeit. Die Übereinstimmung ist schwach. Das beste PhysScore-Tau liegt bei 53,23, kein Modell übersteigt 54. Die Ähnlichkeit folgt eher der Zeichenkettenform als dem Wert, und eine lineare Sonde hebt das mittlere Tau nur um 3,0.
Was die Arbeit berichtet
Am 17. September 2026 haben Juri Opitz und Andrianos Michail von der Abteilung für Computerlinguistik der Universität Zürich die Arbeit "Embedding Models Measure in Peculiar Ways" veröffentlicht (arXiv 2609.20821, cs.CL). Die Frage ist eng gefasst und lässt sich prüfen: Spiegeln Text-Embeddings physikalische Messwerte für Masse, Entfernung, Zeit und Volumen wider? Diese Größen haben einen eindeutigen, objektiven Begriff von Gleichheit und Abstand. "1 meter" und "100 centimeters" bezeichnen dieselbe Größe. "105 centimeters" liegt physikalisch näher an "1 meter" als "15 kilometers". Wenn die Embedding-Ähnlichkeit wirklich Bedeutung misst, sollte sie das beachten.
Die Antwort der Autoren lautet: nein. Über alle 24 getesteten Embedding-Modelle hinweg wird physikalisches Messen nur schwach abgebildet, und die Modelle zeigen, wie die Autoren es nennen, "recht eigentümliche" Messmuster. Die Arbeit berichtet außerdem, dass die Ähnlichkeit zwischen Messzeichenketten stark mit oberflächlicher Zeichenkettenähnlichkeit zusammenhängt und dass eine Neukalibrierung der Ähnlichkeitsfunktion das Problem nicht behebt. Der Code ist öffentlich unter github.com/flipz357/embed-and-measure.
Wie der Test funktioniert
Der Aufbau ist einfach. Ein Embedding-Modell bildet einen Text auf einen Vektor ab. Die Autoren bauen aus einer Zahl und einer Einheit eine Zeichenkette, zum Beispiel "10 kilometers" und "1 meter", betten beide ein und berechnen die übliche Kosinus-Ähnlichkeit. Das wiederholen sie für jedes Wertepaar eines Bereichs und stellen das Ergebnis als Heatmap dar. In einer idealen Heatmap sinkt die Ähnlichkeit gleichmäßig, wenn der physikalische Abstand der beiden Werte wächst.
Die Größen sind Länge (Meter), Masse (Kilogramm), Volumen (Liter) und Zeit (Sekunden). Die Bereiche sind: local (0 bis 10), medium (0 bis 1.000), log (bis 100.000), sign (-100 bis 100, also mit negativen Zahlen) und scientific (Exponentialschreibweise). Jeder Bereich wird in etwa 20 Schritte geteilt. Der lokale Bereich wird außerdem in Worten geschrieben ("five meters"), für jede ganze Zahl von null bis zehn sowie für one-hundred, damit sich Ziffern und Wörter vergleichen lassen.
Die 24 Modelle reichen von älteren Encodern im BERT-Stil bis zu neuen, LLM-basierten Decodern. Die Embedding-Dimensionen liegen zwischen 384 (MiniLM) und 4096 (Qwen3-Embedding-8B). Für die genaue Betrachtung wählen die Autoren all-mpnet-base-v2 (ein Encoder) und Qwen3-Embedding-0.6B (ein Decoder), weil beide zu den am häufigsten heruntergeladenen Embedding-Modellen gehören. Die Ergebnisse der übrigen Modelle stehen im Anhang.
Zentrale Befunde
Die Heatmaps wirken unregelmäßig. Abgesehen von der Diagonale, auf der identische Zeichenketten trivial übereinstimmen, sind die Muster meist unregelmäßig. Die Autoren nennen nicht-monotone Artefakte, waagerechte und senkrechte Bänder sowie lokale Nachbarschaften, die dem physikalischen Abstand nicht folgen. Beide Beispielmodelle können negative und positive Werte grob trennen. Im lokalen Bereich zeigt sich ein "Schachbrettmuster": Paare aus zwei ganzen Zahlen passen zusammen, Paare aus ganzer Zahl und Dezimalzahl nicht. Bei beiden Modellen ist 2,5 einer Einheit 7,5 dieser Einheit ähnlicher als 3 dieser Einheit. Das ist die Umkehrung der physikalischen Ordnung. Ziffern gegen Wörter. Die Embeddings erfassen kaum, dass "one" und "1" gleich sind. Qwen gibt one und 1 eine hohe Ähnlichkeit, aber auch one und 0, am stärksten bei Litern und Kilogramm. mpnet gibt one und 1 eine deutlich höhere Ähnlichkeit als one und jeder anderen Zahl. Qwen bewertet "nine liters" als unähnlich zu allen mit Ziffern geschriebenen Litermengen, und der Selbstvergleich von nine/9 und ten/10 fällt vergleichsweise schwach aus. Mit Ausnahme von one-hundred/100 richtet das ältere mpnet Wörter und Ziffern besser aus als Qwen. Die Umrechnung von Einheiten ist unscharf. Die Autoren vergleichen 1 meter mit 100 centimeters, 1000 millimeters und 0.001 kilometers, und entsprechende Reihen für die anderen Größen. Ideal wäre eine waagerechte Linie nahe 1,0. Keine Linie ist waagerecht und nahe 1,0. Die Qwen-Linien liegen etwas höher, und mpnet fällt stark ab, wenn die Mengen wachsen. Der beste Fall sind Sekunden gegen Millisekunden bei Qwen, die einzige Linie, die über 0,9 liegt und hoch bleibt. Ein kleiner Benchmark, PhysScore. Die Autoren bewerten jedes Modell mit Kendalls Tau zwischen Embedding-Ähnlichkeit und physikalischem Abstand sowie mit der paarweisen Genauigkeit (PAC = 50 + Tau/2). Die Zufallsbasis hat Tau 0 und PAC 50. Alle Modelle schlagen sie, aber keines erreicht ein Tau über 54. Am besten ist multilingual-e5-large-instruct mit Tau 53,23 (PAC 76,61), gefolgt von LaBSE mit 51,31 und e5-large-v2 mit 47,35. Am schwächsten sind nomic-embed-text-v1.5 mit 18,57 und embeddinggemma-300m mit 24,40. Der Durchschnitt liegt bei 37,59. Größe hilft nicht: Qwen3-Embedding-0.6B erreicht 40,47, das 4B-Modell 34,22 und das 8B-Modell 32,27. Die Autoren merken an, dass auch dieses Ergebnis noch optimistisch ist, weil die Zufallsbasis unter der trivialen Diagonalen leidet, die jedes Modell richtig löst.
Welche Messungen am schwersten sind. Masse ist am schwersten, mit einem mittleren Tau von 34,54 über alle Modelle, gegenüber 37,03 beim Volumen, 38,48 bei der Länge und 40,30 bei der Zeit. Manche Kombinationen aus Modell und Bereich fallen unter null, das heißt, das Modell ordnet die Werte in umgekehrter Richtung. Der Bereich medium ist im Mittel am schwersten. Neukalibrierung rettet es nicht. Ein Einwand lautet: Der einfache Kosinus gewichtet jede Dimension gleich und könnte nützliche Information verwischen. Die Autoren prüfen das mit einer linearen Sonde, einer linearen Regression auf der absoluten Differenz der beiden Embedding-Vektoren, mit einer Aufteilung in Trainings- und Testdaten. Das mittlere Tau steigt von 33,4 auf 36,4, ein Gewinn von 3,0. Der größte Gewinn ist +12,3 bei e5-large-v2, das damit immer noch unter 54 bleibt. Manche Modelle werden schlechter, etwa granite-embedding-107m-multilingual (-8,9) und embeddinggemma-300m (-7,3). Die größeren Qwen-Modelle gewinnen mehr als das kleine, doch die Gesamtübereinstimmung bleibt niedrig. Zeichenkettenähnlichkeit ist der wahrscheinliche Treiber. Die Autoren erzeugen zufällige ganze Zahlen und Dezimalzahlen zwischen -1000 und 1000, bilden Paare und korrelieren die Embedding-Ähnlichkeit mit drei Referenzen: der Levenshtein-Distanz auf Zeichenebene, der Levenshtein-Distanz auf Token-Ebene und dem wahren numerischen Abstand. In Tabelle 4 folgt die Embedding-Ähnlichkeit eher der Textform als dem Wert. Für Qwen3-Embedding-0.6B beträgt die Korrelation über alle Paare 47,6 mit Zeichen und 11,7 mit numerischer Nähe. Bei embeddinggemma-300m sind es 51,6 gegenüber 3,3. Die Arbeit nennt das Ergebnis von embeddinggemma eine der stärksten Bindungen an Zeichenkettenähnlichkeit und eine der schwächsten an den numerischen Abstand.
Hintergrund und Bedeutung
Kontrastives Training zieht ähnliche Texte zusammen und schiebt unähnliche auseinander. Die entstehenden Vektoren dienen der Klassifikation, der Suche und dem Clustering.
Benchmarks wie MTEB bewerten Modelle über viele Aufgaben zugleich, während diese Arbeit ein enges "Mikroskop" auf eine einzige Eigenschaft richtet. Das ist wichtig, weil dieselben Vektoren als semantische Darstellungen angeboten werden. Wenn "2 kilometers" nicht näher an "2000 meters" liegt als an "2 meters", haben mengenempfindliche Anwendungen eine versteckte Schwachstelle.
Unsere Einschätzung
Die Aussage ist präzise, und die Belege stimmen über drei verschiedene Sonden hinweg überein: Heatmaps, ein Ranking-Benchmark und eine Analyse der Zeichenüberlappung. Dass größere oder neuere Modelle nicht klar besser abschneiden, passt zur Erklärung der Autoren. Verlangt das Trainingsziel nie eine numerische Ordnung, lernt zusätzliche Kapazität vielleicht nur gründlicher die Oberflächenform. Die Autoren sagen das selbst: Kontrastives Training übt womöglich zu wenig Druck auf physikalische Struktur aus, und eine solche Ausrichtung müsste eine emergente Fähigkeit oder ein ausdrückliches Benchmark-Ziel sein. Sie sprechen sich auch gegen eine Grenze durch die Dimension aus, weil sie keinen Trend mit der Embedding-Größe sehen.
Die Autoren bleiben bei der Gegenseite ausgewogen. Für viele Such- und Clustering-Aufgaben spielen Mengen kaum eine Rolle, und lexikalische Ähnlichkeit ist ein nützlicher Bias für Kennungen, Versionsnummern, Daten und Produktcodes. Ihr Punkt ist, dass ein Modell, das semantische Ähnlichkeit verspricht, "2 kilometers" dennoch näher an "2000 meters" einordnen sollte als an "2 meters".
Grenzen und offene Fragen
Die Autoren geben an, dass ihre Modellauswahl notwendigerweise begrenzt ist. Die Korrelationen in Tabelle 4 zeigen einen Zusammenhang, keinen Kausalbeweis, und die Arbeit formuliert ihre Erklärung als Indiz und plausiblen Grund. Wir haben nur den Text der Arbeit gelesen, weder den Code noch die Tabellen im Anhang.
Im Haupttext nennt Tabelle 3 für das Experiment mit Aufteilung Kosinus-Werte, die von Tabelle 1 abweichen (zum Beispiel e5-large-v2), und der Text nennt das beste Sonden-Ergebnis als 47 Tau, während die Tabelle 48,1 zeigt. Der Text erklärt diese Abweichungen nicht, daher sind die kleinen Zahlen mit Vorsicht zu behandeln. Die Teststrings der Arbeit sind kurze, saubere Ausdrücke im englischen Stil. Offen bleibt, wie sich die Modelle bei unordentlichem, echtem Text verhalten und ob ein Trainingsziel mit ausdrücklicher Mengenaufsicht die Lücke schließen würde.
Praktische Hinweise
Entwickler, die Embeddings für die Suche in Spezifikationen, Logs, Rezepten oder Labordaten nutzen, sollten nicht davon ausgehen, dass numerische Nähe oder Einheitengleichheit die Einbettung übersteht. Die Prüfung ist billig: Betten Sie "2 kilometers", "2000 meters" und "2 meters" mit Ihrem Modell ein und vergleichen Sie.
Ist die Reihenfolge falsch, normalisieren Sie Einheiten und Zahlen vor der Einbettung oder kombinieren Sie Embeddings mit strukturierten Filtern. Teams, die agentische oder wissenschaftliche Systeme bauen, sollten dies als bekannte Schwachstelle behandeln, nicht als seltenen Randfall. Modellentwickler können die Idee der Arbeit aufgreifen und physikalisches Messen als kleine zusätzliche Qualitätskennzahl nutzen.
Sources
FAQ
Was untersucht die Arbeit "Embedding Models Measure in Peculiar Ways"?
Sie prüft, ob 24 Embedding-Modelle physikalische Messwerte für Länge, Masse, Volumen und Zeit abbilden, etwa ob "1 meter" näher an "105 centimeters" als an "15 kilometers" liegt. Die Autoren finden nur eine schwache Übereinstimmung.
Wie gut schneidet das beste Modell ab?
Am besten liegt bei PhysScore multilingual-e5-large-instruct mit einem Kendall-Tau von 53,23 (PAC 76,61). Kein Modell übersteigt ein Tau von 54, der Durchschnitt aller Modelle beträgt 37,59.
Liegt das Problem nur an einer schlecht kalibrierten Ähnlichkeitsfunktion?
Die Autoren prüfen das mit einer linearen Sonde und finden wenig Stützung. Das mittlere Tau steigt nur von 33,4 auf 36,4, und auch nach der Neukalibrierung übersteigt kein Modell 54.