層次去噪機制賦能多步視覺推理:HDR框架實現高效流式生成與邏輯一致性

針對現有影片模型在多步視覺推理中缺乏類人邏輯一致性與低延遲串流輸出能力的瓶頸,本文提出HDR(Hierarchical Denoising for Visual Reasoning)統一框架。該框架將階層潛在變數引入因果影片生成,透過樹狀結構組織影片潛在變數,實現從粗到細的推理過程。粗粒層去噪層保留不確定假設以支援全局規劃,細粒層逐步細化為具體視覺狀態,結合稀疏階層注意力模式(SHAP)降低計算成本。在包含迷宮導航、漢諾塔等六類任務的基準測試中,HDR將成功率從34.22%提升至60.29%,平均進度提升至89.56%,推理速度比雙向擴散模型快54.2倍,且在僅2%訓練數據下保持82.9%的全量數據性能。真實機器人實驗進一步驗證了其在物理互動與世界建模中的潛力,為高效視覺推理提供了新範式。

Sources