CRAFT框架:摆脱合成数据依赖,重塑主体个性化图像生成范式

Published 2026-08-14 · AI Daily — AI-assisted deep research, methodology & disclosure

本文提出CRAFT框架,旨在解决主体驱动图像个性化生成中依赖昂贵合成数据的问题。传统方法需构建百万级参考-合成目标对,流程复杂且成本高。CRAFT采用单步ReFL框架,通过LoRA适配器微调预训练的参考感知MMDiT,仅使用10K张参考图像及掩码,无需合成目标监督。其核心在于"注视点"原则,利用注意力级奖励对齐噪声与短语token注意力,并通过像素级身份奖励确保监督一致性。在FLUX.2-klein-9B上,CRAFT在XVerseBench达到SOTA性能,显著优于需150K-2M数据的方法,且可迁移至其他骨干网络。

在视觉内容创作领域,主体驱动的图像个性化生成是一项基础且关键的能力,其核心目标是在新场景中保留一个或多个参考主体的身份特征。然而,当前主流方法主要依赖通用化策略,即通过在数十万至数百万对"参考图像-合成目标"样本上微调预训练的多模态扩散 Transformer(MMDiT)来实现。这种范式存在显著缺陷:构建合成目标需要耗费巨大的多阶段数据策划流程,包括基于 LLM 的提示生成、基于 T2I 的目标合成、参考主体提取、基于 VLM 的质量过滤以及对应关系标注。这不仅导致数据生产成本高昂,还使得方法与特定的目标合成器和策划选择紧密耦合,限制了泛化能力。针对这一痛点,本文提出了 CRAFT(Constrained Reward via Attention Fine-Tuning)框架,这是一种单步 ReFL 框架,旨在通过紧凑的仅参考数据构建方式,在不使用合成目标监督的情况下,高效微调预训练的参考感知 MMDiT。CRAFT 的核心贡献在于彻底摆脱了对昂贵合成数据对的依赖,仅需 10K 张参考图像及其对应的主体掩码即可实现高性能训练,从而大幅降低了数据构建的复杂度和成本,为个性化生成提供了更轻量、更灵活的解决方案。CRAFT 的技术核心在于其独特的"注视点"(Where to look)原则,该原则通过注意力级别的奖励机制来引导模型学习正确的主体定位。

具体而言,该方法利用 LoRA 适配器对预训练模型进行微调,重点对齐噪声注意力与短语 token 注意力,确保模型在生成过程中能够准确关注到正确的参考主体。在此基础上,CRAFT 引入了基于每个主体的注意力掩码,这些掩码用于门控像素级的身份奖励。这种设计确保了图像空间的监督信号与学习到的注意力路由保持一致,避免了传统方法中可能出现的注意力错位或身份混淆问题。通过这种注意力与像素的双重约束,CRAFT 能够在没有显式合成目标图像监督的情况下,依然保持生成图像中主体身份的高保真度。这种细粒度的注意力控制策略不仅提升了模型对主体特征的捕捉能力,还增强了模型在不同场景下的适应性,使得生成结果在保持主体身份的同时,能够自然地融入新的背景环境中。在实验设置方面,CRAFT 被应用于 FLUX.2-klein-9B 模型,并在 XVerseBench 基准上进行了全面评估。结果显示,CRAFT 在仅使用 10K 张仅参考样本的情况下,实现了最先进的性能表现,而先前通用的方法通常需要 150K 到超过 2M 的合成目标对才能达到类似或更差的效果。

这一结果有力地证明了 CRAFT 在数据效率上的巨大优势。此外,消融实验进一步揭示了注意力级奖励与像素级身份奖励协同作用的重要性,单独使用其中一种奖励机制均无法达到最佳效果。值得注意的是,CRAFT 的配方具有良好的可迁移性,当应用于其他参考感知骨干网络时,也能一致地提升性能表现。这表明该方法不仅仅局限于特定的模型架构,而是提供了一种通用的、基于注意力约束的个性化微调范式,具有广泛的适用性和推广价值。从行业意义和潜在影响来看,CRAFT 的提出对开源社区和工业落地具有深远影响。首先,它极大地降低了主体个性化生成模型的数据门槛,使得中小企业和研究机构无需投入巨额成本构建大规模合成数据集,即可训练出高性能的个性化模型。其次,CRAFT 解耦了模型与特定目标合成器的依赖,提高了方法的灵活性和鲁棒性,便于在不同应用场景中快速部署和迭代。对于后续研究而言,CRAFT 展示的注意力级奖励机制为扩散模型的可控生成提供了新的思路,可能启发更多基于注意力约束的微调策略。此外,该方法在保持 SOTA 性能的同时大幅减少数据需求,符合当前 AI 模型追求高效、绿色发展的趋势,有望成为未来个性化图像生成领域的标准范式之一,推动视觉内容创作向更高质量、更低成本的方向发展。

Sources

FAQ

CRAFT 是什么?

CRAFT 是一个主体个性化扩散模型微调框架,采用单步 ReFL 设计,通过 LoRA 微调参考感知 MMDiT,仅用 10K 张参考图像和掩码即可训练,无需合成目标图像监督。

CRAFT 为什么重要?

传统方法需构建 150K 至 2M 的合成目标对,流程复杂且成本高昂;CRAFT 摆脱了这一依赖,在 FLUX.2-klein-9B 上以 XVerseBench 的 SOTA 性能显著胜出,且可迁移到其他骨干网络。

后续值得关注的方向是什么?

值得关注其注意力级奖励机制能否推广为通用的个性化微调范式,以及是否能在更多参考感知骨干网络上稳定提升性能,从而降低中小企业和研究机构的数据构建门槛。