La primitive manquante : diagnostiquer et réparer le raisonnement mathématique des LLM

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Cet article introduit la notion de « primitive mathématique » pour diagnostiquer la compréhension réelle des LLM en mathématiques, au-delà de la seule exactitude de la réponse finale. Les auteurs construisent un benchmark à quatre dimensions, découverte, génération, digestion, exécution, et montrent que la découverte, c'est-à-dire identifier quelle primitive utiliser, constitue le goulot d'étranglement dominant, tandis que fournir explicitement la bonne primitive libère fortement une capacité d'exécution latente. Ils proposent ensuite un cadre d'auto-distillation à primitive privilégiée qui transfère sélectivement ce raisonnement guidé, surpassant systématiquement les méthodes de référence sur plusieurs échelles de modèles.

Contexte et définition du problème

Les grands modèles de langage affichent des scores impressionnants sur les benchmarks mathématiques les plus exigeants, des problèmes de niveau olympique à l'assistance à la démonstration en plusieurs étapes. Pourtant, la seule exactitude des réponses finales ne permet pas de savoir si un modèle possède réellement une compréhension mathématique structurelle, ou s'il assemble simplement des motifs mémorisés qui aboutissent, par chance, au bon résultat.

Cet article introduit la notion de « primitive mathématique » : l'unité structurelle minimale de connaissance sur laquelle repose une solution, par exemple un lemme précis, une technique de transformation, ou une construction intermédiaire décisive. À partir de cette notion, les auteurs proposent un benchmark diagnostique qui décompose le raisonnement mathématique selon quatre dimensions distinctes : la découverte (Discovery, identifier quelle primitive le problème requiert), la génération (Generation, construire cette primitive à partir de rien), la digestion (Digestion, intérioriser correctement une primitive une fois fournie), et l'exécution (Execution, mener à bien le calcul restant une fois la bonne primitive en main). Cette décomposition s'attaque directement à un angle mort persistant du domaine : une évaluation fondée uniquement sur le résultat final regroupe quatre modes d'échec très différents en un seul signal binaire, ce qui conduit les équipes de post-entraînement à ajouter des données indifférenciées sans savoir quelle étape cognitive est réellement défaillante.

Cœur architectural et principes techniques

La méthodologie diagnostique se déroule en deux étapes. La première, le profilage des capacités, teste le même ensemble de problèmes dans deux conditions : sans aide, puis avec la primitive correcte explicitement fournie, et compare l'écart de précision obtenu. Cela permet d'isoler deux modes d'échec de nature différente : un modèle qui ne possède véritablement pas la primitive requise, contre un modèle qui y a accès mais ne peut pas l'exécuter correctement. La seconde étape, la localisation du goulot d'étranglement, mesure la contribution marginale de chacune des quatre dimensions à la précision finale en maintenant les autres constantes.

Trois résultats se dégagent. Premièrement, la précision globale des réponses masque un profil de capacités fortement différencié : deux modèles ayant une précision finale quasi identique peuvent présenter des scores très différents en découverte, génération, digestion et exécution. Deuxièmement, dès que la primitive correcte est explicitement fournie, les modèles affichent un bond soudain de leur capacité d'exécution démontrée, ce qui suggère qu'une grande part de la capacité de calcul latente est retenue non par une incapacité à calculer, mais par un échec à identifier quel outil mobiliser en premier lieu. Troisièmement, parmi les quatre dimensions, la découverte constitue le goulot d'étranglement dominant : les modèles échouent fréquemment non pas parce qu'ils ne savent pas calculer, mais parce qu'ils ne reconnaissent pas quelle primitive mathématique le problème appelle.

Évaluation pratique et applications

Sur la base de ces diagnostics, les auteurs mènent une analyse d'attribution au niveau du post-entraînement montrant que les échecs limités par la découverte, c'est-à-dire les cas où le modèle possède la capacité d'exécution mais ne parvient pas à identifier lui-même la primitive requise, sont disproportionnellement faciles à corriger par un entraînement ciblé, avec un retour sur investissement nettement supérieur aux autres catégories d'échec.

Cette observation motive un cadre d'auto-distillation à primitive privilégiée : plutôt que de transférer l'intégralité de la trace de raisonnement sans distinction, comme le fait l'auto-distillation classique, le modèle enseignant annote explicitement la primitive mathématique qu'il mobilise à chaque étape, et seul ce signal de raisonnement guidé par la primitive est distillé de façon sélective vers le modèle élève. De vastes expériences menées sur plusieurs échelles de modèles et des benchmarks mathématiques exigeants montrent que ce cadre surpasse de façon constante les méthodes de référence, validant le paradigme plus large consistant à diagnostiquer avant de réparer, plutôt qu'un affinage indifférencié.

Impact sur l'industrie et perspectives

Les implications de ce travail dépassent largement les mathématiques. Il offre une méthodologie transférable pour transformer un réglage de post-entraînement de type boîte noire en une intervention ciblée, fondée sur un profil de capacités interprétable.

Pour les équipes qui développent des modèles orientés raisonnement, l'enseignement immédiat est qu'il faut diagnostiquer si les échecs proviennent de la découverte, de la génération, de la digestion ou de l'exécution, avant d'augmenter aveuglément les données d'entraînement ou la longueur des chaînes de raisonnement. À l'avenir, cette grille diagnostique à quatre dimensions pourrait s'étendre naturellement à d'autres domaines reposant sur la mobilisation de connaissances structurées pendant le raisonnement, comme la génération de code ou la vérification d'hypothèses scientifiques, pour devenir un outil standard d'évaluation de la qualité du post-entraînement.

Sources

FAQ

Quelles sont les quatre dimensions du benchmark diagnostique ?

Découverte (identifier quelle primitive un problème requiert), Génération (construire cette primitive à partir de rien), Digestion (intérioriser une primitive fournie), et Exécution (mener à bien le calcul restant une fois la primitive connue).

Quelle est la conclusion diagnostique centrale de l'article ?

La précision globale masque un profil de capacités très différencié, et la découverte constitue le goulot d'étranglement dominant du raisonnement mathématique : fournir explicitement la bonne primitive libère fortement une capacité d'exécution latente déjà présente.

En quoi le cadre d'auto-distillation proposé diffère-t-il de l'auto-distillation classique ?

Plutôt que de transférer toute la trace de raisonnement sans distinction, le modèle enseignant annote explicitement la primitive mathématique utilisée à chaque étape, et seul ce signal guidé par la primitive est distillé sélectivement vers le modèle élève.