TIDES: 입력 의존성을 스텝 크기에서 상태 행렬로 옮겨 선택적 상태공간 모델에 시간 인식을 부여
TIDES는 Mamba의 숨은 약점을 고치는 선택적 상태공간 모델(SSM)입니다. Mamba에서는 이산화 스텝 크기가 입력에 따라 변해 시계와 내용 게이트 역할을 동시에 맡기 때문에 실제 타임스탬프가 들어갈 자리가 없습니다. TIDES는 입력 의존성을 스텝 크기에서 대각 상태 행렬로 옮겨 스텝 크기를 실제 시간 간격과 같게 둡니다. 불규칙 샘플링을 기본으로 처리하면서 토큰별 선택성도 유지합니다. 저자들은 UEA와 Physiome ODE에서 최고 평균 순위를, 불규칙 데이터셋 8개 중 6개에서 기준 이상의 성능을 보고합니다.
상태공간 모델(SSM)은 Transformer를 대체할 유력한 경로로 주목받고 있습니다. S4와 S5는 시퀀스를 연속 시간 선형 시스템의 샘플로 보며, 추론 비용이 시퀀스 길이에 선형으로 늘어납니다. Mamba는 여기에 선택 메커니즘을 더해 파라미터가 입력에 따라 변하게 했고, 모델은 내용에 따라 무엇을 기억하고 잊을지 정합니다. 그러나 선택성에는 잘 언급되지 않는 부작용이 있습니다. 실제 시간에 대한 모델의 감각이 흐려진다는 점입니다. 논문 TIDES가 바로 이 문제를 다룹니다. 저자는 Taylan Soydan, Miguel A. Bessa, Dirk Mohr, Rui Barreira이며, 2026년 5월 10일 arXiv에 제출되고 10월 5일 2판으로 개정되었습니다.
문제는 이산화 스텝 크기에 있습니다. Mamba에서는 스텝 크기 델타가 현재 입력에서 생성됩니다. 델타는 두 역할을 동시에 맡습니다. 하나는 두 관측 사이의 시간 간격이고, 다른 하나는 기억 감쇠 속도를 정하는 내용 게이트입니다. 샘플링이 규칙적이면 두 역할이 섞여도 큰 문제가 없습니다. 실제 간격이 매 단계 같기 때문입니다. 하지만 타임스탬프가 불규칙해지면 진짜 시간 차가 모델에 들어갈 곳이 없어, 네트워크가 데이터에서 암묵적으로 추측해야 합니다. 제목의 암묵적 시간 인식이 뜻하는 바가 이것입니다. Mamba는 시간에 반응하지만 암묵적이고, 물리적 제약이 없으며, 내용 신호와 얽히기 쉽습니다. S5는 반대입니다. 스텝 크기가 실제 시간 간격에 대응해 불규칙 샘플링을 기본으로 처리하지만, 동역학이 선형 시불변이라 토큰별 표현력이 제한됩니다.
TIDES의 핵심 변경은 초록의 표현대로 입력 의존성을 스텝 크기에서 떼어 대각 상태 행렬로 옮기는 것입니다. 스텝 크기는 물리적 시간 간격과 같게 유지되므로 불규칙 타임스탬프가 자연스럽게 처리됩니다. 입력 의존성은 상태 행렬의 대각 성분이 맡으므로 각 토큰의 선택성도 남습니다. 한마디로 시간은 시간에, 내용은 내용에 맡기는 설계입니다. 한 변수에 눌려 있던 상충하는 두 요구가 두 변수로 나뉘었습니다. 이산화 식으로 해석해 봅니다. 다만 초록에서 이끌어 낸 추론이므로 구체적인 파라미터화, 안정성 조건, 초기화는 논문 본문과 공개 코드로 확인해야 합니다. 대각 연속 시스템을 영차 유지로 이산화하면 각 상태 채널의 감쇠 계수는 exp(델타 곱하기 a)입니다. Mamba에서 a는 고정된 음수이고 델타(x)가 입력에 따라 변하므로 계수는 exp(델타(x) 곱하기 a)입니다. TIDES에서는 델타가 실제 시간 차 t_k 빼기 t_(k-1)이고 a(x)가 입력에 따라 변하므로 계수는 exp(델타 곱하기 a(x))입니다. 규칙적 샘플링에서는 두 형태가 비슷하지만, 불규칙 샘플링에서는 달라집니다. TIDES에서는 감쇠가 실제 간격에 맞춰 자동으로 조절되어, 간격이 길수록 기본적으로 더 많이 잊고 그 속도는 내용이 정합니다. 모델이 시간을 데이터에서 역산할 필요가 없어지고, 시간이 구조의 일부가 됩니다.
결과는 초록에 명시된 내용만 인용합니다. 저자들은 먼저 Fading Flash라는 작은 통제 진단 과제를 만들어 시간 인식 능력만 분리해 SSM들을 비교했습니다. 이어 TIDES는 UEA 시계열 분류와 Physiome ODE 회귀 벤치마크에서 새로운 최고 평균 순위를 얻었습니다. 천문, 농업, 뉴로모픽 센싱, 기후 이벤트에 걸친 본래 불규칙한 데이터셋 8개 중 6개에서 기준 모델과 같거나 앞섰습니다. 확인한 초록에는 정확도, 지연 시간, 파라미터 수의 구체적 수치가 없으며, 이 글도 만들어 내지 않습니다. 정확한 비용과 성능의 균형은 논문의 표를 보고 직접 재현해야 합니다. 개발자와 기업에게 가치는 불규칙 샘플링 상황에 있습니다. 환자 모니터링의 간헐적 검사, 금융의 틱 단위 이벤트, 끊기거나 비동기로 도착하는 센서, 이벤트 카메라 출력, 고르지 않은 천문 노출 등입니다. 흔한 방법은 규칙 격자로 보간하거나(편향이 생김) 시간 차를 추가 특징으로 붙여 네트워크가 배우게 하는 것이었습니다. TIDES는 시간 차를 이산화에 직접 넣어 구조로 보장하는 세 번째 길을 제시합니다. 코드는 GitHub의 TaylanSoydan/TIDES에 공개되어 있습니다. 여전히 선형 시간 순환 구조이므로 추론 비용은 Mamba와 비슷할 것으로 보이지만, 초록만으로는 알 수 없어 실측이 필요합니다.
한계도 있습니다. 첫째, 초록은 8개 중 6개라고 하므로 나머지 2개에서는 기준에 미치지 못했고, 적용 범위는 데이터 특성에 달려 있습니다. 둘째, 신뢰할 수 있는 타임스탬프를 전제하므로 잡음이나 누락이 있으면 이득이 줄어듭니다. 셋째, 선택성을 대각 행렬에 두어도 상태 채널 사이에는 결합이 없어 표현력의 상한은 검증되지 않았습니다. 넷째, 병렬 스캔 커널이 고도로 최적화된 Mamba 구현만큼 빠를지는 공학적 검증이 필요합니다. 앞으로는 대형 언어 모델과의 하이브리드, 다중 시간 척도 모델링, 연속 시간 이벤트 스트림이 방향이 될 수 있습니다. 전체적으로 TIDES는 작고 명확한 구조 수정이며, 불규칙 시계열을 다루는 팀이 시도해 볼 만합니다.