Chimera 아키텍처 돌파: Chinchilla 법칙과 하이브리드 어텐션을 결합한 장편 비디오 생성의 새로운 패러다임

시각 생성 작업에서 고해상도 이미지와 긴 비디오 처리로 인한 전체 어텐션 메커니즘의 계산 비용 지수적 증가 문제를 해결하기 위해 연구팀은 Chimera 아키텍처를 제안합니다. 전통적인 위치 임베딩을 포기하고 래스터화된 순차 흐름을 통해 멀티모달 토큰 처리를 통합합니다. Kimi Delta Attention, 다중 헤드 잠재 어텐션 및 모드 인식형 짧은 합성곱을 혁신적으로 결합하여 긴 컨텍스트 추적과 국소 시공간 세부 사항 간의 균형을 맞춥니다. Chinchilla 스케일링 법칙에 따라 최적화된 110억 파라미터 모델은 계산 비용을 크게 줄이면서도 5초 제로샷 외삽에서 30초 비디오까지 확장하는 능력을 구현하여, 효율적인 긴 컨텍스트 확산 모델의 기술적 기반을 마련했습니다.

배경

시각 생성 분야에서 고해상도 이미지와 장시간 비디오 생성에 대한 수요가 급증함에 따라, 기존 트랜스포머 기반 아키텍처의 근본적인 계산 병목 현상이 부각되고 있습니다. 시퀀스 길이에 따라 전역 어텐션 메커니즘을 사용하는 모델들의 계산 비용이 이차함수적으로 증가하는 문제는, 고품질 장비디오 생성을 비현실적으로 비싸고 비효율적으로 만듭니다. 이는 실시간 또는 배치 처리가 표준 하드웨어에서 불가능할 정도로 메모리와 처리 오버헤드가 커지는 결과를 초래하며, 현재 최첨단 시스템의 실용성을 심각하게 제한합니다.

이러한 핵심 문제를 해결하기 위해 연구팀은 Chimera라는 새로운 하이브리드 시각 확산 백본을 제안했습니다. Chimera는 절대 위치 임베딩에 의존하는 기존 방식과 달리, 래스터화된 순서 흐름을 통해 텍스트, 이미지, 비디오 토큰을 통합 처리합니다. 이 아키텍처적 변화는 입력 처리를 단순화하면서도 시퀀스 무결성을 유지하여, 이후 효율적인 어텐션 메커니즘을 위한 견고한 기반을 마련합니다. 이는 생성 품질과 계산 효율성 간의 전통적인 트레이드오프를 깨고, 제한된 자원 환경에서도 훨씬 길고 복잡한 시각적 시퀀스를 처리할 수 있게 합니다.

심층 분석

Chimera는 성능 최적화를 위해 여러 어텐션 메커니즘과 로컬 처리 모듈을 전략적으로 통합한 이종 하이브리드 아키텍처를 사용합니다. 핵심 혁신 중 하나는 O(N) 복잡도를 가진 Kimi Delta Attention(KDA)으로, 이는 장문맥 상태 추적을 위해 특별히 설계되어 긴 시퀀스에서의 정보 상실을 방지합니다. 이를 보완하기 위해 Multi-Head Latent Attention(MLA)이 도입되어 서로 다른 모달리티 간 특징의 직접적인 전역 상호작용을 가능하게 하며, 모달리티 인식 단축 컨볼루션은 미세한 국소 시공간 세부 정보를 효율적으로 추출합니다.

복잡한 아키텍처를 추론 비용을 선형적으로 증가시키지 않고 확장하기 위해, 모델은 Sparse Mixture of Experts(MoE) 레이어를 통합합니다. 추론 시 일부 전문가만 활성화되어 총 용량을 유지하면서 활성화된 파라미터 수를 크게 줄입니다. 이 이종 시스템의 학습은 HeteroP라는 모듈 수준 하이퍼파라미터 전달 전략에 의해 지배됩니다. HeteroP는 각 텐서의 기능적 팬인과 모델 깊이에 기반하여 폭과 깊이 간에 하이퍼파라미터를 지능적으로 이동시켜, 다양한 모듈이 훈련 중 협력 최적화되도록 보장합니다.

산업 영향

Chimera의 실험적 검증은 기존 베이스라인 대비 상당한 효율성 향상을 보여줍니다. HeteroP_scheme를 통해 피팅된 Chinchilla 스타일 확장 법칙에 기반하여, 연구진은 총 110억 파라미터 중 20억만 활성화된 Chimera 모델을 훈련했습니다. 사전 훈련 확산 손실 지표에서, 밀집 백본을 사용한 Chimera는 Wan-2.1 2B 전역 어텐션 베이스라인 대비 계산 효율성이 1.7배 높았으며, MoE와 하이브리드 어텐션을 포함한 전체 시스템은 7.3배의 효율성 향상을 달성했습니다.

순수 효율성 외에도 Chimera는 장비디오 생성에서 놀라운 제로 샷 외삽 능력을 보여줍니다. 모델은 5초 클립으로 훈련되었지만 특정 길이 미세 조정 없이 30초 비디오를 성공적으로 생성했습니다. 특히 확장된 비디오의 마지막 5초에 대한 FID 지표는 단 6.5%만 하락하여 긴 지속 시간 동안 강력한 시간적 일관성을 입증했습니다. 이는 비디오 AI에서 가장 지속적인 과제 중 하나인, 시간 증가에 따른 내러티브 또는 시각적 연속성 상실을 해결합니다.

전망

Chimera의 등장은 시각 생성 분야에서 짧은 클립 합성에서 긴 내러티브 콘텐츠 창작으로의 중요한 패러다임 전환을 의미합니다. 아키텍처 하이브리드화와 과학적 확장 법칙이 품질을 희생하지 않고 계산 장벽을 drasticaly 낮출 수 있음을 입증함으로써, 이 작업은 소비자 등급 또는 엣지 장치에서 고급 비디오 모델을 배포할 수 있는 길을 열었습니다. HeteroP 확장 프로토콜과 유도된 Chinchilla 스타일 법칙은 향후 연구를 위한 재사용 가능한 설계 프레임워크를 제공하여 효율적인 시각 아키텍처의 반복을 가속화합니다.

앞으로 그 영향력은 단순한 생성 효율성을 넘어섭니다. Chimera의 강력한 장문맥 처리 능력은 글로벌 일관성이 로컬 세부 사항만큼 중요한 비디오 이해 및 편집 작업에 강력한 후보로 자리매김합니다. 이는 더 복잡하고 스토리 중심의 AI 생성 비디오를 가능하게 하여 창의적 콘텐츠 생산 전반에 광범위한 변화를 촉발할 수 있습니다. 계산 자원이 AI 발전의 제한 요인으로 남아있는 한, 구조적 혁신을 통해 효율성을 우선시하는 Chimera와 같은 아키텍처는 차세대 멀티모달 모델의 표준이 될 가능성이 높습니다.

Sources