CRAFT: 합성 목표 이미지 없이 주체 개인화 확산 모델 파인튜닝 프레임워크

Published 2026-08-14 · AI Daily — AI-assisted deep research, methodology & disclosure

본 논문은 주체 기반 이미지 개인화 생성에서 고비용 합성 데이터에 대한 의존도를 해결하기 위해 CRAFT 프레임워크를 제안합니다. 기존 방법은 수백만 개의 참조-합성 목표 쌍을 구축해야 하여 복잡하고 비용이 높습니다. CRAFT는 단일 단계 ReFL 프레임워크를 사용하여 LoRA 어댑터를 통해 사전 학습된 참조 인식 MMDiT을 파인튜닝하며, 합성 목표 지도 없이 참조 이미지와 마스크 10,000장만 사용합니다. 그 핵심은 '주시점' 원리로, 어텐션 레벨 보상을 통해 노이즈와 구문 토큰 어텐션을 정렬하고, 픽셀 레벨 동일성 보상을 통해 지도 일관성을 보장합니다. FLUX.2-klein-9B에서 CRAFT는 XVerseBench에서 SOTA 성능을 달성하여 150K-2M 데이터가 필요한 방법들을 크게 능가하며, 다른 백본 네트워크로 이전 가능합니다.

배경

시각 콘텐츠 제작 분야에서 주체 기반 이미지 개인화 생성은 핵심 역량으로, 새로운 장면에서 참조 주체의 정체성을 보존하는 것을 목표로 합니다. 그러나 기존 주류 방법은 수십만에서 수백만 쌍에 달하는 '참조 이미지-합성 목표' 데이터로 사전 학습된 다중모달 확산 Transformer(MMDiT)을 파인튜닝하는 범용 전략에 크게 의존합니다. 이 패러다임은 합성 목표 생성을 위해 LLM 기반 프롬프트 생성, T2I 합성, 주체 추출, VLM 기반 품질 필터링, 대응 관계 어노테이션 등 복잡한 다단계 데이터 큐레이션 파이프라인이 필요하다는 치명적 결함을 안고 있습니다. 이는 데이터 생산 비용을 급등시킬 뿐만 아니라, 특정 목표 합성기나 큐레이션 선택에方法与를 강하게 결합시켜 일반화 능력을 크게 제한하는 결과를 초래합니다.

이러한 문제점을 해결하기 위해 본 연구는 CRAFT(Constrained Reward via Attention Fine-Tuning) 프레임워크를 제안합니다. CRAFT는 합성 목표 지도 없이도 사전 학습된 참조 인식 MMDiT을 효율적으로 파인튜닝하기 위한 단일 단계 ReFL 프레임워크입니다. 이 프레임워크는 고비용 합성 데이터 쌍에 대한 의존성을 완전히 제거하여, 단 10,000장의 참조 이미지와 해당 주체 마스크만으로 고품질 학습이 가능함을 입증했습니다. 이를 통해 데이터 구축의 복잡도와 비용을 대폭 절감하며, 더 가볍고 유연한 개인화 생성 솔루션을 제공합니다.

심층 분석

CRAFT의 기술적 핵심은 '주시점(gaze point)' 원리에 있습니다. 이 원리는 어텐션 레벨 보상 메커니즘을 통해 모델이 올바른 주체 위치를 학습하도록 유도합니다. 구체적으로 LoRA 어댑터를 활용하여 사전 학습된 모델을 파인튜닝하며, 노이즈 어텐션과 구문 토큰 어텐션을 정렬하는 데 중점을 둡니다. 이러한 정렬은 생성 과정에서 모델이 올바른 참조 주체에 정확하게 집중하도록 보장하여, 기존 방법에서 흔히 발생하는 어텐션 불일치나 정체성 혼란 문제를 방지합니다.

이러한 기반 위에 CRAFT는 주체별 어텐션 마스크를 도입하여 픽셀 레벨의 동일성 보상을 게이트합니다. 이 설계는 이미지 공간의 지도 신호가 학습된 어텐션 라우팅과 항상 일치하도록 보장합니다. 어텐션과 픽셀 레벨 보상의 이중 제약은 명시적인 합성 목표 지도가 없더라도 생성된 이미지에서 주체 정체성의 높은 충실도를 유지할 수 있게 합니다. 이 세밀한 어텐션 제어 전략은 모델의 주체 특성 포착 능력을 향상시키고, 다양한 장면에서의 적응력을 강화하여 생성 결과가 정체성을 유지하면서도 새로운 배경 환경에 자연스럽게 통합되도록 돕습니다.

산업 영향

실험 설정에서 CRAFT는 FLUX.2-klein-9B 모델에 적용되어 XVerseBench 벤치마크에서 종합적으로 평가되었습니다. 그 결과, CRAFT는 단 10,000장의 참조 전용 샘플만으로도 최첨단(SOTA) 성능을 달성했습니다. 반면, 이전의 범용 방법들은 유사하거나 더 열위한 결과를 내기 위해 150,000에서 200만 쌍 이상의 합성 목표 데이터가 필요했습니다. 이 결과는 CRAFT가 데이터 효율성 면에서 압도적인 우위를 점하고 있음을 강력하게 보여줍니다. 또한 아블레이션 실험은 어텐션 레벨 보상과 픽셀 레벨 동일성 보상의 시너지 효과가 최적의 성능을 위해 필수적임을 드러냈으며, 어느 하나만 사용해서는 최상위 결과를 달성할 수 없었습니다.

특히 주목할 점은 CRAFT 레시피의 높은 이전 가능성입니다. 다른 참조 인식 백본 네트워크에 적용했을 때도 일관되게 성능을 향상시켰습니다. 이는 해당 방법이 특정 모델 아키텍처에 국한되지 않으며, 넓은 적용 범위를 가진 보편적인 어텐션 제약 기반 개인화 파인튜닝 패러다임을 제공한다는 것을 의미합니다. 특정 목표 합성기에 대한 의존성을 분리함으로써 CRAFT는 유연성과 견고성을 높여 다양한应用场景에서의 빠른 배포와 반복을 용이하게 합니다.

전망

CRAFT의 도입은 오픈소스 커뮤니티와 산업 현장 모두에 깊은 영향을 미칠 것입니다. 첫째, 주체 개인화 모델의 데이터 진입 장벽을 크게 낮춥니다. 이는 중소기업과 연구기관이 대규모 합성 데이터셋 구축에 막대한 비용을 투자하지 않아도 고성능 개인화 모델을 훈련할 수 있음을 의미합니다. 둘째, 특정 목표 합성기에 대한 의존성을 분리함으로써 방법론의 유연성과 견고성을 향상시켜, 다양한 애플리케이션에 쉽게 배포할 수 있게 합니다.

향후 연구 측면에서 CRAFT가 보여준 어텐션 레벨 보상 메커니즘은 확산 모델의 제어 가능 생성에 새로운 통찰을 제공합니다. 이는 어텐션 제약 기반의 더 많은 파인튜닝 전략을 영감시킬 수 있습니다. 또한, SOTA 성능을 유지하면서 데이터 요구량을 대폭 줄이는 이 방법은 현재 AI 모델이 추구하는 효율적이고 지속 가능한 개발 추세와 부합합니다. CRAFT는 미래 개인화 이미지 생성 분야의 표준 패러다임 중 하나가 될 잠재력을 지니고 있으며, 시각 콘텐츠 제작이 더 높은 품질과 더 낮은 비용으로 나아가는 것을 촉진할 것입니다.

Sources

FAQ

CRAFT는 무엇인가요?

CRAFT는 주체 개인화용 확산 모델 파인튜닝 프레임워크로, 단일 단계 ReFL과 LoRA 어댑터를 사용해 합성 목표 이미지 없이 참조 이미지 10,000장과 마스크만으로 학습할 수 있습니다.

CRAFT가 중요한 이유는 무엇인가요?

기존 방법은 150K~2M의 고비용 합성 참조-목표 쌍 구축이 필요했습니다. CRAFT는 이 의존을 없애고 FLUX.2-klein-9B로 XVerseBench SOTA를 달성했으며 다른 백본으로 이전 가능합니다.

앞으로 주목할 점은 무엇인가요?

어텐션 레벨 보상 메커니즘이 보편적인 개인화 파인튜닝 패러다임이 될지, 다른 참조 인식 백본에서도 안정적으로 성능을 높여 중소기업과 연구 기관의 데이터 부담을 줄일지 지켜볼 만합니다.