TIDES:把输入依赖移到状态矩阵,让选择性状态空间模型原生理解不规则时间

Published · AI Daily — AI-assisted deep research, methodology & disclosure

TIDES 是一种选择性状态空间模型(SSM)。Mamba 让离散化步长随输入变化,步长因此同时承担时间间隔与内容门控两个角色,不规则时间戳无处安放。TIDES 把输入依赖从步长移到对角状态矩阵上,让步长等于真实时间间隔,既原生处理不规则采样,又保留逐 token 的选择性。论文报告其在 UEA 分类与 Physiome ODE 回归基准上取得最佳平均排名,并在 8 个天然不规则数据集中的 6 个上持平或超过基线。

状态空间模型(SSM)是近年来最受关注的 Transformer 替代路线之一。S4、S5 把序列看作连续时间线性系统的离散采样,推理成本随序列长度线性增长。Mamba 在此基础上加入选择性机制,让参数随输入变化,模型因而可以按内容决定记住什么、遗忘什么。但选择性带来了一个很少被讨论的副作用:模型对真实时间的感知变得含糊。TIDES 这篇论文正是针对这一点。作者为 Taylan Soydan、Miguel A. Bessa、Dirk Mohr 和 Rui Barreira,论文 2026 年 5 月 10 日提交 arXiv,10 月 5 日更新到第二版。

问题出在离散化步长。在 Mamba 中,步长 Δ 由当前输入生成。它同时扮演两个角色:一是两个观测之间的时间间隔,二是控制记忆衰减快慢的内容门。采样规则时,这两个角色混在一起问题不大,因为每一步的真实间隔都一样。可一旦时间戳不规则,真实的时间差就没有地方进入模型,只能让网络从数据里隐式地猜。这就是标题中「隐式时间感知」的含义:Mamba 有时间感知,但它是隐式的,既没有物理约束,也容易和内容信号纠缠。S5 的做法相反。它的步长对应真实时间间隔,可以原生处理不规则采样,但其动力学是线性时不变的,每个 token 的表达力受限。

TIDES 的核心改动,用摘要里的话说,就是把输入依赖从步长上移走,放到对角状态矩阵上。步长保持等于物理时间间隔,所以不规则时间戳被原生处理。输入依赖则由状态矩阵的对角元素承担,所以每个 token 仍然可以有选择性。一句话概括:时间归时间,内容归内容。两种相互冲突的需求,原本被压在同一个变量上,现在被拆到两个变量上。 下面用离散化公式做一个解释性说明。需要强调,这是根据摘要做的推演,具体参数化方式、稳定性约束和初始化细节,请以论文正文与开源代码为准。对角连续系统经零阶保持离散化后,状态衰减因子为 exp(Δ·a)。在 Mamba 中,a 是固定的负实数,Δ(x) 随输入变化,衰减因子是 exp(Δ(x)·a)。在 TIDES 中,Δ 等于真实时间差 t_k − t_{k−1},a(x) 随输入变化,衰减因子是 exp(Δ·a(x))。在规则采样下,两者的形式相近。在不规则采样下,差别就出现了:TIDES 的衰减会随真实间隔自动缩放,间隔越长,默认遗忘越多,而内容决定衰减的速率。这样模型不必再从数据中反推时间,时间信息成为结构的一部分。

实验结果方面,我们只引用摘要中明确给出的内容。作者先设计了一个名为 Fading Flash 的小型受控诊断任务,专门隔离「时间感知」这一能力,用来观察不同 SSM 在其上的差异。随后,TIDES 在 UEA 时间序列分类基准和 Physiome ODE 回归基准上取得了新的最佳平均排名。在 8 个天然不规则的数据集上,覆盖天文、农业、神经形态传感和气候事件,TIDES 在其中 6 个上持平或超过参考基线。我们读到的摘要没有给出具体的准确率、延迟或参数量,本文也不编造这些数字。想要精确的成本与性能权衡,需要查看论文的表格并自行复现。

对开发者和企业而言,价值主要在不规则采样的场景:病人监护中的间歇性化验、金融里的逐笔事件、传感器掉线与异步到达、事件相机输出、天文观测的不均匀曝光。常见做法是先插值到规则网格,这会引入偏差;或者把时间差当作一个额外特征拼进输入,让网络自己去学。TIDES 提供了第三条路:把时间差直接放进离散化,从结构上保证。代码已经发布在 GitHub 的 TaylanSoydan/TIDES 仓库。由于它仍是循环式的线性时间模型,推理成本预期与 Mamba 同量级,但这一点需要实测,不能由摘要推出。 从工程选型的角度看,这项改动的价值在于可解释性。过去遇到不规则数据,团队往往要在插值、补零掩码、时间差特征三种做法之间反复试验,每一种都要额外的预处理代码和调参。TIDES 把时间处理收进模型内部,预处理管线可以更短,出错点也更少。对于需要审计的医疗和金融系统,这一点尤其重要:衰减由真实时间决定,工程师可以直接检查模型在长时间间隔之后保留了多少信息,而不必依赖黑箱式的隐式推断。当然,这些好处仍需在具体业务数据上验证,摘要本身并不能替代复现实验。 这项工作也有局限。第一,摘要只说在 8 个数据集中的 6 个上持平或更好,这意味着另外 2 个没有达到,适用边界需要看具体数据特性。第二,方法依赖可靠的时间戳,时间戳本身有噪声或缺失时,收益会打折。第三,把选择性放在对角矩阵上,状态维度之间依然没有耦合,表达力的上限仍待检验。第四,并行扫描内核是否能和 Mamba 的高度优化实现同样高效,需要工程验证。未来的方向包括与大规模语言模型做混合架构、多时间尺度建模,以及连续时间事件流。总体而言,TIDES 是一个小而清晰的结构修正,值得做不规则时间序列的团队认真试一试。

Sources