大型語言模型中的修辭過度:自修正現象的成因與基於適配器的緩解策略

本文系統研究了大型語言模型中普遍存在的「自修正」修辭現象,即模型頻繁使用「這不是……而是……」這類強調句式。研究發現,這種傾向並非自回歸生成的固有缺陷,而是訓練數據中大量推廣性文本與RLHF偏好對齊機制共同作用的結果——後者獎勵自信、強調性的表達。作者提出了「自修正指數」來量化這一偏差。實驗表明,模型在演講體裁中過度使用該修辭(約兩倍至三倍),在非正式問答中則使用不足,而在論證、新聞和百科體裁中與人類表現一致。研究提出了一套緩解方案,重點評估了輕量級LoRA適配器:簡單指令微調可將修辭使用率降低50%至75%,監督微調適配器幾乎完全消除偏差,並可透過縮放係數校準至人類水平。研究強調目標是針對特定體裁進行修辭校準,而非徹底消除該修辭。

这篇论文聚焦于大型语言模型中一个被长期忽视却日益显著的修辞现象:自修正(Epanorthosis)的过度使用。自修正是一种古典修辞手法,表现为作者先提出一个陈述,随即自我纠正并给出更准确或更具强调性的表述,例如"这不仅仅是一门课程,而是一场变革之旅"。尽管西塞罗和昆体良在两千年前便已记录此修辞,但现代大语言模型却系统性地、过度地复现了这一模式。本研究的核心贡献在于揭示了这一现象背后的深层成因,并建立了一套量化的评估与缓解框架。作者论证认为,这种修辞过度并非由自回归生成的从左到右特性所导致,后者仅起到放大作用。真正的根源在于训练数据分布中大量存在的推广性散文,以及偏好对齐(RLHF)过程中对自信、强调性措辞的奖励机制。

这种训练偏好导致模型偏离了人类自然的修辞风格,形成了一种被训练出来的行为倾向。通过引入"自修正指数",即模型使用该修辞的密度相对于人类基准的比率,研究首次系统地量化了这种风格偏差,为理解模型的语言生成习惯提供了新的视角。在技术方法层面,本文基于 Fontanier 对自修正作为"思想修辞"的分类,构建了一套严谨的评估与干预流程。首先,研究确立了基于体裁的人类基准线,将文本分为演讲、非正式问答、论证、新闻和百科等类别,以计算自修正指数。随后,论文提出并评估了一系列缓解技术,核心聚焦于轻量级 LoRA 适配器。这种方法避免了全参数微调的高昂成本,通过低秩矩阵注入来调整模型的生成偏好。

研究特别展示了在意大利语场景下的具体实施细节:通过一条简单的指令,即可显著改变模型的输出风格;而更进一步的监督微调(SFT)适配器则能更精细地控制修辞密度。技术亮点在于提出了"缩放系数"的概念,允许研究者根据目标体裁,将模型的修辞使用率动态调整回人类正常水平,从而实现从"消除偏差"到"精准校准"的技术转变。这种基于适配器的干预策略,既保留了模型的基础语言能力,又有效修正了其风格上的过度拟合。实验设置涵盖了同一指令微调模型家族的三种不同规模,并在多种体裁下进行了细致的测量。关键结果显示,模型表现出明显的体裁校准失调:在演讲体裁中,模型过度使用自修正修辞,其频率约为人类基准的两倍,在意大利语的大规模模型中甚至接近三倍;而在非正式问答写作中,模型则表现出使用不足。然而,在论证、新闻和百科类文本中,模型的表现与人类高度一致,未出现显著偏差。

消融实验进一步证实,轻量级 LoRA 适配器在意大利语任务中效果显著:仅通过一行指令,即可将自修正修辞的使用率降低约 50% 至 75%;而经过监督微调的适配器则能几乎完全消除该修辞的过度使用。更重要的是,通过调整缩放系数,研究者成功将模型的修辞密度重新校准至人类基准水平,证明了该方法的灵活性和有效性。这些结果不仅验证了训练数据分布和 RLHF 对修辞风格的决定性影响,也展示了微调技术在风格控制上的巨大潜力。这项研究的行业意义深远,它不仅揭示了当前大语言模型在语言风格上的系统性偏差,更为开源社区和工业落地提供了实用的风格控制方案。对于开发者而言,理解自修正修辞的成因有助于优化训练数据清洗策略和偏好对齐算法,从而生成更自然、更符合人类习惯的文本。在工业应用中,基于 LoRA 的轻量化校准方案为不同场景下的定制化写作提供了高效路径,例如在营销文案中适度保留强调性修辞,而在技术文档中则保持简洁中立。此外,研究强调的目标是"体裁特定的校准"而非"彻底消除",这一观点对后续研究具有重要启示:我们应追求模型风格与人类多样性的对齐,而非单一标准的同质化。最终,论文警示了一个潜在风险:如果不对此类修辞偏差进行干预,人类可能会逐渐开始像机器一样写作,导致语言丰富性的丧失。这一呼吁提醒学术界和工业界,在追求模型性能的同时,必须重视语言风格的人文价值与伦理考量。

Sources