Grammaires moléculaires d’ordre supérieur pour les modèles génératifs et fondamentaux en chimie
La représentation grammaticale d’ordre supérieur (HGR) transforme un graphe moléculaire en complexe combinatoire, puis encode sa hiérarchie de cycles et de motifs sous forme de règles de production réversibles. Des modèles séquentiels classiques peuvent ainsi exploiter une topologie explicite. Les auteurs présentent RingDiv, ensemble de 1,18 million de molécules, et un indice de diversité des cycles. Ils rapportent le meilleur score FCD sur cinq jeux de génération ainsi qu’un gain moyen d’AUC sur sept tâches MoleculeNet, en sondage et en ajustement complet. La validité annoncée dépend toutefois de règles chimiquement cohérentes et d’une dérivation achevée; elle ne démontre ni synthétisabilité ni généralisation universelle.
Contexte technique et problème
Une molécule est un graphe d’atomes et de liaisons, mais les cycles fusionnés et les motifs récurrents impliquent plusieurs atomes à la fois. Les chaînes de type SMILES sont faciles à donner à un modèle séquentiel; elles expriment pourtant les fermetures de cycles de façon indirecte. Les réseaux de graphes ordinaires voient d’abord des liens par paires. Les représentations explicites d’ordre supérieur demandent souvent davantage de calcul et posent un problème de décodage. HGR vise une représentation qui rende la hiérarchie topologique explicite, réversible et exploitable par un modèle séquentiel classique.
Les données d’évaluation comptent autant que l’architecture. Une collection dominée par des cycles simples peut masquer les échecs sur les cycles spiro, pontés ou de taille intermédiaire. Les auteurs construisent RingDiv, environ 1,18 million de molécules, puis un sous-ensemble RingDiv300k équilibré selon la topologie. Leur indice de diversité des cycles, RDI, mesure cette couverture. La sélection retient de un à dix cycles et une masse moléculaire de 100 à 900 Da, tout en excluant les macrocycles. Les conclusions ne s’étendent donc pas automatiquement aux macrocycles ni à tout l’espace chimique.
Architecture et principes
HGR élève d’abord le graphe moléculaire en complexe combinatoire. Les atomes deviennent les feuilles d’une hiérarchie; des sous-graphes adjacents sont fusionnés selon leur fréquence dans le corpus. Le rang d’une cellule correspond à sa hauteur dans l’arbre de contraction. Deux variantes, MIG et RSG, construisent cette hiérarchie. Le complexe conserve les relations d’ordre supérieur, tandis que le graphe associé conserve les liaisons effectives. Les cellules obtenues sont emboîtées ou disjointes, ce qui permet un parcours où les enfants précèdent leurs parents. Chaque cellule donne ensuite une règle de production. Son côté droit contient le graphe local et des positions enfants ordonnées; une interface d’ancrage ordonnée décrit les connexions vers l’extérieur. Les règles dont la structure et l’interface concordent peuvent être réutilisées dans plusieurs molécules. La molécule devient ainsi une séquence d’identifiants de règles. La compression ne supprime pas les liaisons: leur information réside dans les règles et leurs interfaces. Plusieurs ordres admissibles des cellules sœurs peuvent représenter la même structure, avec une reconstruction exacte par dérivation inverse.
Au décodage, une pile garde les positions non terminales à développer. Un masque n’autorise que les règles dont l’interface convient à la position courante. La dérivation n’est acceptée que lorsque toutes les règles ont été consommées et que la pile est vide. La proposition de reconstruction porte sur le complexe déjà analysé et son graphe associé, et non sur une chaîne arbitraire. La validité « par construction » suppose des règles tirées de graphes dont les valences sont cohérentes, des interfaces compatibles et une dérivation complète. Elle ne prouve ni stabilité physique, ni faisabilité de synthèse, ni absence de toxicité. Les auteurs appliquent cette représentation à HGR-VAE pour la génération, HGR-LDF pour l’échantillonnage latent et HGR-FM pour le transfert de caractéristiques moléculaires. Le réseau évite de traiter explicitement un complexe d’ordre supérieur à chaque étape, mais l’extraction des motifs, le dictionnaire des règles, les masques et le décodage ont toujours un coût. La couverture du vocabulaire peut devenir problématique dans un domaine chimique nouveau.
Évaluation pratique
La génération est comparée sur QM9, ZINC250k, MOSES, GuacaMol et RingDiv300k. Les auteurs rapportent la meilleure distance de Fréchet ChemNet, FCD, sur les cinq ensembles et une validité de 100 % dans leur cadre de génération contrainte. FCD mesure la proximité de deux distributions dans un espace de caractéristiques; ce n’est pas une mesure de l’efficacité pharmacologique d’une molécule. Il faut aussi considérer unicité, nouveauté, propriétés, squelettes et topologie. Sauf la validité, plusieurs métriques sont calculées uniquement sur les molécules valides: un score conditionnel favorable ne doit donc pas cacher les sorties rejetées.
Le transfert porte sur sept classifications MoleculeNet: BBBP, Tox21, ToxCast, SIDER, ClinTox, HIV et BACE. Les partitions 80/10/10 sont faites par squelette. Le sondage gèle l’encodeur et entraîne une tête légère; l’ajustement complet modifie les deux. Sur trois graines aléatoires, les auteurs rapportent un gain moyen d’AUC de 8,3 points pour le sondage et de 3,3 points pour l’ajustement, par rapport à leur meilleure base de comparaison. Ces moyennes ne démontrent pas un gain identique sur chaque tâche ni une hausse des découvertes confirmées en laboratoire.
Impact et perspectives
L’intérêt pratique est une séparation vérifiable entre choix de règles appris et contrôle structurel assuré par la grammaire. RingDiv rend visibles des familles de cycles que les moyennes globales peuvent cacher.
Avant un usage industriel, il faudrait comparer les modèles avec les mêmes partitions et budgets, recalculer les métriques par catégorie de cycles, publier les échecs de dérivation et mesurer le temps total de préparation, apprentissage et décodage. Les biais du corpus, la stéréochimie, les conformations tridimensionnelles, les routes de synthèse et l’activité mesurée restent des questions ouvertes. L’article décrit des résultats publiés par les auteurs, sans réplication indépendante.
Sources
FAQ
Comment HGR permet-il la reconstruction exacte ?
Les règles conservent graphes locaux, positions enfants ordonnées et interfaces d’ancrage; la dérivation inverse retrouve le complexe analysé et son graphe moléculaire.
Que couvre la validité de 100 % annoncée ?
Elle concerne les dérivations complètes avec règles issues de molécules à valence cohérente et interfaces compatibles, sans garantie de synthèse ni d’activité.