TIDES : déplacer la dépendance à l'entrée du pas de temps vers la matrice d'état des SSM sélectifs

Published · AI Daily — AI-assisted deep research, methodology & disclosure

TIDES est un modèle d'espace d'états sélectif (SSM) qui corrige une faiblesse discrète de Mamba. Dans Mamba, le pas de discrétisation dépend de l'entrée : il joue à la fois le rôle d'horloge et de porte de contenu, et les vrais horodatages n'ont pas de place. TIDES déplace la dépendance à l'entrée du pas vers la matrice d'état diagonale. Le pas égale alors l'écart de temps réel, l'échantillonnage irrégulier est traité nativement et la sélectivité par token est conservée. Les auteurs annoncent le meilleur rang moyen sur UEA et Physiome ODE, et un résultat égal ou supérieur à la référence sur 6 des 8 jeux de données irréguliers.

Les modèles d'espace d'états (SSM) figurent parmi les alternatives les plus suivies au Transformer. S4 et S5 voient une séquence comme des échantillons d'un système linéaire à temps continu, avec un coût d'inférence linéaire en la longueur. Mamba y a ajouté un mécanisme de sélection : ses paramètres varient avec l'entrée, et le modèle décide ce qu'il retient ou oublie selon le contenu. Cette sélectivité a un effet secondaire peu discuté : le sens du temps réel devient flou. L'article TIDES : Implicit Time-Awareness in Selective State Space Models vise ce point. Les auteurs sont Taylan Soydan, Miguel A. Bessa, Dirk Mohr et Rui Barreira. Il a été déposé sur arXiv le 10 mai 2026 et révisé en version 2 le 5 octobre 2026.

Le problème se situe dans le pas de discrétisation. Dans Mamba, le pas, noté delta, est produit à partir de l'entrée courante. Il joue deux rôles à la fois : il représente l'écart de temps entre deux observations, et il sert de porte de contenu qui règle la vitesse d'oubli. Avec un échantillonnage régulier, ce mélange gêne peu, puisque chaque écart réel est identique. Dès que les horodatages sont irréguliers, l'écart réel n'a plus de point d'entrée dans le modèle, et le réseau doit le deviner à partir des données. C'est le sens de « conscience implicite du temps » dans le titre : Mamba réagit au temps, mais de façon implicite, sans contrainte physique, et le signal temporel peut se mêler au signal de contenu. S5 fait l'inverse. Son pas suit l'écart réel et traite donc l'irrégularité nativement, mais sa dynamique est linéaire et invariante dans le temps, ce qui limite l'expressivité par token.

Le changement central de TIDES, selon le résumé, consiste à retirer la dépendance à l'entrée du pas pour la placer sur la matrice d'état diagonale. Le pas reste égal à l'écart de temps physique, donc les horodatages irréguliers sont traités nativement. La dépendance à l'entrée est portée par les éléments diagonaux de la matrice d'état, donc chaque token reste sélectif. En une phrase : le temps reste au temps, le contenu reste au contenu. Deux exigences en conflit, auparavant comprimées dans une seule variable, vivent maintenant dans deux. Une explication par la discrétisation aide, avec une réserve : il s'agit d'une inférence tirée du résumé. La paramétrisation exacte, les contraintes de stabilité et l'initialisation sont à vérifier dans l'article et le code publié. Après discrétisation à maintien d'ordre zéro, un système continu diagonal a un facteur de décroissance exp(delta fois a) par canal d'état. Dans Mamba, a est un négatif fixe et delta(x) varie avec l'entrée, soit exp(delta(x) fois a). Dans TIDES, delta est l'écart de temps réel t_k moins t_(k-1), et a(x) varie avec l'entrée, soit exp(delta fois a(x)). En échantillonnage régulier, les deux formes se ressemblent. En échantillonnage irrégulier, elles divergent : dans TIDES, la décroissance s'adapte seule à l'écart réel. Plus la pause est longue, plus on oublie par défaut, et le contenu fixe la vitesse. Le modèle n'a plus à déduire le temps des données. Le temps fait partie de la structure.

Sur les résultats, nous ne citons que ce que le résumé énonce. Les auteurs ont d'abord construit un petit diagnostic contrôlé, Fading Flash, conçu pour isoler la conscience du temps et comparer les SSM sur cette seule compétence. Ensuite, TIDES obtient un nouveau meilleur rang moyen sur le benchmark de classification UEA et sur le benchmark de régression Physiome ODE. Sur 8 jeux de données naturellement irréguliers, issus de l'astronomie, de l'agriculture, de la détection neuromorphique et des événements climatiques, TIDES égale ou dépasse la référence sur 6. Le résumé lu ne donne ni précision chiffrée, ni latence, ni nombre de paramètres, et cet article ne les invente pas. Pour le compromis exact entre coût et qualité, il faut lire les tableaux de l'article et reproduire les essais.

Pour les développeurs et les entreprises, l'intérêt tient à l'échantillonnage irrégulier : analyses de laboratoire intermittentes en suivi de patients, événements tick par tick en finance, capteurs qui tombent en panne ou émettent en différé, sorties de caméras événementielles, expositions astronomiques inégales. Les solutions usuelles sont d'interpoler sur une grille régulière, ce qui ajoute un biais, ou d'ajouter l'écart de temps comme variable et de laisser le réseau l'apprendre. TIDES propose une troisième voie : placer l'écart directement dans la discrétisation et le garantir par la structure. Le code est sur GitHub, dépôt TaylanSoydan/TIDES. Le modèle restant récurrent à temps linéaire, le coût d'inférence devrait rester proche de celui de Mamba, mais il faut le mesurer : le résumé ne le dit pas.

Le travail a des limites. D'abord, le résumé parle de 6 jeux sur 8 : sur 2, le modèle n'égale pas la référence, et le domaine d'usage dépend des données. Ensuite, la méthode suppose des horodatages fiables ; bruités ou manquants, ils réduiront le gain. Puis, placer la sélectivité sur une matrice diagonale laisse les canaux d'état sans couplage, et le plafond d'expressivité reste à tester. Enfin, on ignore encore si un noyau de scan parallèle égalera en vitesse l'implémentation très optimisée de Mamba. Les pistes futures incluent des hybrides avec de grands modèles de langage, la modélisation multi-échelle et les flux d'événements à temps continu. Dans l'ensemble, TIDES est une correction structurelle petite et claire, à essayer pour les équipes qui traitent des séries irrégulières.

Sources