하이브리드 27B LLM에서 Gated DeltaNet이 4비트 양자화에 견디는 이유: NVFP4 풀 정밀도 압축 실전

Published 2026-09-03 · AI Daily — AI-assisted deep research, methodology & disclosure

하이브리드 LLM의 선형 주의 계층(Gated DeltaNet 등)이 양자화하기 어렵다는 기존 통념에 도전하여, NVFP4 W4A4 전체 모델 양자화 방식인 Minima를 제안합니다. GDN 모듈에 8/16비트 정밀도를 유지하는 관습을 깨고, 감쇠 게이트 및 쓰기 강도 게이트를 포함한 모든 496개 선형 계층에 대한 4비트 양자화를 최초로 실현했습니다. MMLU-Pro, GSM8K, AIME'25, GPQA-Diamond, LiveCodeBench, RULER 검색 등 벤치마크에서 BF16 기준선과 거의 동일한 성능(평균 차이 -0.52%)을 유지하면서 모델 크기를 17.5 GiB로 압축하고 프리필 속도도 14-19% 향상시켰습니다. NVFP4 블록 스케일링, 게이트 투영의 강건성, Delta 규칙의 노이즈 억제, 문맥에 따른 양자화 오차 희석 등을 분석하여 하이브리드 모델의 순환 부분이 오히려 양자화하기 쉬운 메커니즘을 규명하고, 산업계 배포를 위한 실용적인 가이드를 제공합니다.

배경

하이브리드 아키텍처를 채택한 대규모 언어 모델(LLM)의 발전 과정에서 항상 존재해 온 핵심 과제는 추론 효율성과 긴 컨텍스트 처리 능력 사이의 균형입니다. 기존 하이브리드 모델들은 일반적으로 소프트맥스 어텐션 메커니즘과 Gated DeltaNet(GDN)과 같은 선형 어텐션 계층을 결합하여 사용합니다. GDN은 고정된 크기의 순환 상태를 통해 컨텍스트 정보를 요약하는 방식으로 작동합니다. 그러나 연구 커뮤니티에서는 오랫동안 선형 어텐션 계층, 특히 GDN 모듈이 저비트 양자화에 저항성이 있다고 믿어 왔습니다. 이는 순환 상태 업데이트의 특성상 양자화 오차가 긴 시퀀스를 거치며 누적되어 모델 성능을 저하시킬 수 있다는 우려에서 비롯된 것입니다. 이러한 인식 때문에 GDN 모듈, 특히 감쇠 게이트와 쓰기 강도 게이트와 같은 핵심 구성 요소는 8비트 또는 16비트의 높은 정밀도를 유지해야 한다는 것이 관례였습니다.

이러한 기존 통념은 하이브리드 모델의 대규모 배포에 병목 현상을 일으켰습니다. 고정밀도 유지는 메모리_footprint_를 증가시키고 추론 속도를 저하시키기 때문입니다. 최근 소개된 Minima 양자화 방식은 이러한 가정에 도전하며, NVFP4 W4A4 형식을 사용한 전체 모델 양자화 접근법을 제안합니다. 이 방식은 GDN 모듈을 포함한 모든 496개의 선형 계층을 양자화하는 것을 목표로 합니다. 이는 선택적으로 정밀도를 보존했던 이전 방법들과는 크게 다른 접근이며, 적절한 양자화 전략 하에서 하이브리드 모델의 순환 구성 요소가 저비트 제약 하에서도 안정적일 뿐만 아니라 고유한 동적 특성으로 인해 양자화 노이즈에 더 높은 내성을 가질 수 있음을 시사합니다.

심층 분석

Minima 방식의 기술적 기반은 NVFP4(비균일 벡터 부동소수점 4비트)와 W4A4(가중치 4비트, 활성화 4비트)의 정교한 적용에 있습니다. 연구진은 네트워크 전체에 균일한 양자화 전략을 적용하는 대신, GDN의 특정 구조에 맞춰 세밀한 양자화 경로를 설계했습니다. 핵심 혁신 중 하나는 NVFP4의 16개 요소 블록 스케일링 메커니즘을 사용하는 것입니다. 이 기법은 잔차 스트림의 극단적인 이상값을 국소화하여 모델 내 다양한 계층과 역할 간에 활성화 오차를 균형 있게 분배합니다. 이를 통해 단일 큰 오차가 양자화 노이즈 예산을 지배하는 것을 방지하며, 이는 순환 계층의 안정성을 유지하는 데 필수적입니다.

기대와는 달리, 연구진은 이전에 취약하고 양자화에 민감하다고 여겨졌던 게이트 투영 계층이 실제로 양자화 오차에 가장 강건한 구성 요소임을 발견했습니다. softplus, 지수함수, 시그모이드와 같은 매개변수화 함수를 통해 이러한 게이트 투영은 약 11%의 GEMM(일반 행렬 곱셈) 오차를 약 2%의 출력 오차로 압축할 수 있습니다. 또한 연구진은 모듈 레벨 교정 체크포인트가 단일 GEMM 커널로 융합될 때 발생하는 글로벌 스케일 불일치 문제를 해결했으며, 교정된 FP8 키-값(KV) 캐시를 사용하는 것이 성능 비용 측면에서 '무료'임을 입증했습니다. 이는 복잡한 파인튜닝이나 배포 후 추가 교정 단계 없이도 배포 파이프라인을 단순화할 수 있음을 의미합니다.

산업 영향

Minima 방식의 실험적 검증은 48개의 GDN 계층과 16개의 어텐션 계층을 갖춘 Qwen3.8-27B 모델에서 수행되었습니다. 평가는 4K 및 32K 컨텍스트 길이의 퍼플렉시티, MMLU-Pro, GSM8K, AIME'25, GPQA-Diamond, LiveCodeBench, 그리고 최대 64K 컨텍스트를 지원하는 RULER 검색 작업을 포함한 광범위한 벤치마크를 포함했습니다. 결과는 주목할 만했는데, 양자화된 모델은 5개 작업에서 평균 -0.52%의 차이만을 보이며 BF16 기준선과 거의 동일한 성능을 달성했습니다. 이 편차는 시드 노이즈 범위 내에 있어 양자화 과정이 통계적으로 유의미한 성능 저하를 초래하지 않았음을 나타냅니다. 이는 프로덕션 수준의 하이브리드 모델에서 공격적인 양자화의 실현 가능성을 입증합니다.

정확도 외에도 산업적 배포 측면에서의 실용적 이점은 큽니다. Minima 방식은 모델 크기를 17.5 GiB로 압축하여 비교 대상 중 가장 작은 모델을 만들었으며, 프리필 속도를 14-19% 향상시켰습니다. 이러한 메모리_footprint_ 감소와 속도 향상은 27B 클래스 하이브리드 모델을 소비자용 또는 엣지 장치에 배포하는 것을 가능하게 하여 추론 비용을 크게 절감합니다. 오픈소스 커뮤니티에게 Minima 모델 가중치의 공개는 효율적인 하이브리드 아키텍처에 대한 재현성과 추가 연구를 촉진합니다. 리소스가 제한된 환경에서 실시간 처리가 필요한 모바일 기기나 엣지 서버와 같은 애플리케이션에는 높은 성능을 유지하면서 리소스를 줄일 수 있는 이점이 특히 가치 있습니다.

전망

이 연구의 함의는 즉각적인 기술적 성취를 넘어 순환 신경망 및 상태 공간 모델의 양자화에 대한 새로운 이론적 틀을 제공합니다. 하이브리드 모델의 순환 부분이 이전에 생각했던 것보다 양자화하기 쉽다는 발견은 기존 직관에 도전하며, Mamba와 같은 다른 아키텍처의 양자화 잠재력을 재평가하도록 유도할 수 있습니다. 식별된 메커니즘, 즉 Delta 규칙 순환이 주입된 노이즈를 평평한 고원에 유지하고 수백 단계 내에 상태 펄스를 잊어버린다는 사실은 긴 컨텍스트 성능이 악화되지 않는 이유를 명확히 설명합니다. 이러한 이해는 더 넓은 범위의 모델 아키텍처에 대해 더 강건한 양자화 알고리즘 개발을 안내할 수 있습니다.

앞으로 Minima 방식은 대규모 언어 모델의 효율적인 배포를 위한 새로운 기준을 설정합니다. 성능 손실 없이 NVFP4 W4A4로의 전체 모델 양자화가 가능함을 증명함으로써, 이는 산업계가 더 공격적인 압축 기술을 채택하도록 장려합니다. '모든 것을 양자화하고 KV 스케일을 분배한다'는 레시피는 배포 워크플로우를 단순화하여 효율적인 모델 서빙의 진입 장벽을 낮춥니다. 더 긴 컨텍스트 윈도우와 낮은 지연 시간에 대한 요구가 계속 증가함에 따라, 이 연구가 제공하는 통찰은 차세대 하이브리드 모델의 설계에 영향을 미쳐 저비트 양자화와 본질적으로 더 호환되는 아키텍처를 우선시할 것입니다. 이는 고성능 AI를 더 접근 가능하고 비용 효율적으로 만들어 실시간 번역부터 복잡한 코드 생성에 이르기까지 다양한 애플리케이션에서 대규모 언어 모델의 채택을 가속화할 것입니다.

Sources

FAQ

Minima는 무엇이며 어떤 돌파구를 만들었나요?

Minima는 NVFP4 W4A4 전체 모델 양자화 방식으로, Qwen3.8-27B 하이브리드 LLM의 모든 496개 선형 계층(감쇠 게이트·쓰기 강도 게이트 포함)을 처음으로 4비트로 압축한 연구입니다.

이 연구는 왜 중요한가요? LLM 배포에 어떤 영향을 주나요?

모델 크기를 17.5 GiB로 줄이고 프리필 속도를 14-19% 높이면서도 여섯 개 벤치마크에서 BF16 기준선과 평균 -0.52% 차이에 그쳐, 27B급 하이브리드 LLM의 저비용 배포가 가능해졌습니다.

앞으로 무엇을 주목해야 하나요?

순환 부분이 오히려 양자화에 강하다는 발견은 Mamba 등 다른 상태공간 모델의 4비트 양자화 가능성도 시사합니다. 앞으로 Minima 오픈 가중치 재현 실험과 KV 캐시 보정의 추가 활용이 주목됩니다.