Chimera架构突破:融合Chinchilla定律与混合注意力的长视频生成新范式

针对视觉生成任务中高分辨率图像与长视频处理带来的全注意力机制计算成本指数级增长问题,研究团队提出Chimera架构。该模型摒弃传统位置嵌入,通过光栅化有序流统一处理多模态令牌,创新结合Kimi Delta Attention、多头潜在注意力及模态感知短卷积,平衡长上下文跟踪与局部时空细节。基于Chinchilla缩放定律优化的11B参数模型,在显著降低计算成本的同时,实现了从5秒零样本外推至30秒视频的能力,为高效长上下文扩散模型奠定了技术基础。

在视觉生成领域,随着对高分辨率图像、长时长视频以及多模态上下文需求的日益增长,传统基于全注意力机制的模型面临着计算成本呈二次方增长的严峻挑战。这种计算瓶颈严重限制了模型处理长序列数据的能力,使得生成高质量长视频变得极其昂贵且低效。为了解决这一核心痛点,本文提出了Chimera,这是一种精心设计的混合视觉扩散骨干网络。Chimera的核心贡献在于其创新的架构设计与一套原则性的缩放配方,旨在打破计算效率与生成质量之间的权衡。它不再依赖传统的绝对位置嵌入,而是通过光栅化有序流将文本、图像和视频令牌统一处理,从而在保持序列信息完整性的同时,大幅降低了计算复杂度。这一设计不仅简化了输入处理流程,更为后续引入高效的注意力机制和稀疏专家层奠定了结构基础,使得模型能够在有限的计算资源下处理更长、更复杂的视觉序列。 在技术实现层面,Chimera采用了一种异构混合架构,巧妙融合了多种注意力机制与局部处理模块。首先,它引入了Kimi Delta Attention(KDA),这是一种具有O(N)复杂度的注意力机制,专门用于长上下文的状态跟踪,有效解决了长序列中的信息遗忘问题。其次,为了捕捉全局交互,模型嵌入了多头潜在注意力(MLA),使得不同模态间的特征能够直接进行全局交互。此外,针对局部时空上下文,Chimera使用了模态感知的短卷积,以高效提取局部细节。为了在不显著增加推理成本的前提下扩大模型容量,架构中还集成了稀疏混合专家(MoE)层,仅在推理时激活部分专家,从而控制了激活计算量。为了科学地缩放这一复杂的异构架构,作者提出了HeteroP方案,这是一种模块级的超参数传递策略。HeteroP根据每个张量的功能扇入和模型深度,将超参数在宽度和深度之间进行智能迁移,确保不同模块在训练过程中能够协同优化,避免了超参数调优的盲目性。 在实验验证环节,研究团队基于HeteroP方案拟合了Chinchilla风格的计算最优定律,确定了激活模型大小、训练令牌数量以及图像与视频数据比例之间的最佳平衡点。基于这些定律,他们训练了一个拥有110亿总参数但仅激活20亿参数的Chimera模型。实验结果令人印象深刻:在预训练扩散损失指标上,仅使用密集骨干网络的Chimera在计算效率上是匹配的Wan-2.1 2B全注意力基线的1.7倍,而完整系统更是达到了7.3倍的效率提升。在长视频生成能力方面,Chimera展现了卓越的零样本外推能力,无需针对特定长度进行微调,即可从5秒的训练片段外推至30秒的视频,且最后五秒的FID指标仅下降6.5%,证明了其强大的时序一致性保持能力。此外,拟合定律显示,在图像预训练中,计算资源在激活模型大小和训练令牌数之间近乎平均分配,而在视频预训练中,随着预算增加,计算资源略微倾向于扩大模型规模。 Chimera的提出对开源社区和工业落地具有深远的意义。首先,它证明了通过合理的架构混合与科学的缩放定律,可以在不牺牲生成质量的前提下,大幅降低长视频生成的计算门槛。这对于推动多模态大模型在视频生成领域的实际应用至关重要,使得在消费级或边缘设备上运行高质量视频生成模型成为可能。其次,HeteroP缩放方案和Chinchilla风格定律的发现,为后续研究者提供了可复用的设计指南,有助于加速高效视觉生成架构的迭代。最后,Chimera在长上下文处理上的突破,也为视频理解、长视频编辑等下游任务提供了强大的基础模型支持,有望引发视觉生成领域从短片段向长叙事内容生成的范式转变,推动人工智能在创意内容生产领域的进一步普及。

Sources