TIDES:把輸入依賴移到狀態矩陣,讓選擇性狀態空間模型原生理解不規則時間

Published · AI Daily — AI-assisted deep research, methodology & disclosure

TIDES 是一種選擇性狀態空間模型(SSM)。Mamba 讓離散化步長隨輸入變化,步長因此同時承擔時間間隔與內容門控兩個角色,不規則時間戳無處安放。TIDES 把輸入依賴從步長移到對角狀態矩陣上,讓步長等於真實時間間隔,既原生處理不規則取樣,又保留逐 token 的選擇性。論文報告其在 UEA 分類與 Physiome ODE 迴歸基準上取得最佳平均排名,並在 8 個天然不規則資料集中的 6 個上持平或超過基線。

狀態空間模型(SSM)是近年來最受關注的 Transformer 替代路線之一。S4、S5 把序列看作連續時間線性系統的離散取樣,推理成本隨序列長度線性增長。Mamba 在此基礎上加入選擇性機制,讓參數隨輸入變化,模型因而可以按內容決定記住什麼、遺忘什麼。但選擇性帶來了一個很少被討論的副作用:模型對真實時間的感知變得含糊。TIDES 這篇論文正是針對這一點。作者為 Taylan Soydan、Miguel A. Bessa、Dirk Mohr 和 Rui Barreira,論文 2026 年 5 月 10 日提交 arXiv,10 月 5 日更新到第二版。

問題出在離散化步長。在 Mamba 中,步長 Δ 由當前輸入生成。它同時扮演兩個角色:一是兩個觀測之間的時間間隔,二是控制記憶衰減快慢的內容門。取樣規則時,這兩個角色混在一起問題不大,因為每一步的真實間隔都一樣。可一旦時間戳不規則,真實的時間差就沒有地方進入模型,只能讓網路從資料裡隱式地猜。這就是標題中「隱式時間感知」的含義:Mamba 有時間感知,但它是隱式的,既沒有物理約束,也容易和內容訊號糾纏。S5 的做法相反。它的步長對應真實時間間隔,可以原生處理不規則取樣,但其動力學是線性時不變的,每個 token 的表達力受限。

TIDES 的核心改動,用摘要裡的話說,就是把輸入依賴從步長上移走,放到對角狀態矩陣上。步長保持等於物理時間間隔,所以不規則時間戳被原生處理。輸入依賴則由狀態矩陣的對角元素承擔,所以每個 token 仍然可以有選擇性。一句話概括:時間歸時間,內容歸內容。兩種相互衝突的需求,原本被壓在同一個變數上,現在被拆到兩個變數上。 下面用離散化公式做一個解釋性說明。需要強調,這是根據摘要做的推演,具體參數化方式、穩定性約束和初始化細節,請以論文正文與開源程式碼為準。對角連續系統經零階保持離散化後,狀態衰減因子為 exp(Δ·a)。在 Mamba 中,a 是固定的負實數,Δ(x) 隨輸入變化,衰減因子是 exp(Δ(x)·a)。在 TIDES 中,Δ 等於真實時間差 t_k − t_{k−1},a(x) 隨輸入變化,衰減因子是 exp(Δ·a(x))。在規則取樣下,兩者的形式相近。在不規則取樣下,差別就出現了:TIDES 的衰減會隨真實間隔自動縮放,間隔越長,預設遺忘越多,而內容決定衰減的速率。這樣模型不必再從資料中反推時間,時間資訊成為結構的一部分。

實驗結果方面,我們只引用摘要中明確給出的內容。作者先設計了一個名為 Fading Flash 的小型受控診斷任務,專門隔離「時間感知」這一能力,用來觀察不同 SSM 在其上的差異。隨後,TIDES 在 UEA 時間序列分類基準和 Physiome ODE 迴歸基準上取得了新的最佳平均排名。在 8 個天然不規則的資料集上,涵蓋天文、農業、神經形態感測和氣候事件,TIDES 在其中 6 個上持平或超過參考基線。我們讀到的摘要沒有給出具體的準確率、延遲或參數量,本文也不編造這些數字。想要精確的成本與效能權衡,需要查看論文的表格並自行重現。

對開發者和企業而言,價值主要在不規則取樣的場景:病人監護中的間歇性化驗、金融裡的逐筆事件、感測器掉線與非同步到達、事件相機輸出、天文觀測的不均勻曝光。常見做法是先插值到規則網格,這會引入偏差;或者把時間差當作一個額外特徵拼進輸入,讓網路自己去學。TIDES 提供了第三條路:把時間差直接放進離散化,從結構上保證。程式碼已經發布在 GitHub 的 TaylanSoydan/TIDES 倉庫。由於它仍是循環式的線性時間模型,推理成本預期與 Mamba 同量級,但這一點需要實測,不能由摘要推出。 從工程選型的角度看,這項改動的價值在於可解釋性。過去遇到不規則資料,團隊往往要在插值、補零遮罩、時間差特徵三種做法之間反覆試驗,每一種都要額外的預處理程式碼和調參。TIDES 把時間處理收進模型內部,預處理管線可以更短,出錯點也更少。對於需要稽核的醫療和金融系統,這一點尤其重要:衰減由真實時間決定,工程師可以直接檢查模型在長時間間隔之後保留了多少資訊,而不必依賴黑箱式的隱式推斷。當然,這些好處仍需在具體業務資料上驗證,摘要本身並不能取代重現實驗。 這項工作也有侷限。第一,摘要只說在 8 個資料集中的 6 個上持平或更好,這意味著另外 2 個沒有達到,適用邊界需要看具體資料特性。第二,方法依賴可靠的時間戳,時間戳本身有雜訊或缺失時,收益會打折。第三,把選擇性放在對角矩陣上,狀態維度之間依然沒有耦合,表達力的上限仍待檢驗。第四,平行掃描核心是否能和 Mamba 的高度最佳化實作同樣高效,需要工程驗證。未來的方向包括與大規模語言模型做混合架構、多時間尺度建模,以及連續時間事件流。總體而言,TIDES 是一個小而清晰的結構修正,值得做不規則時間序列的團隊認真試一試。

Sources