IDEAgent:基於質量多樣性搜尋的科研創意生成智能體框架

現有大語言模型在自動化科學發現中常陷入獨立優化創意質量或單一維度的困境,導致生成概念要不過於相似、要不質量過低。為此,本文提出 IDEAgent —— 一個將科研創意生成建模為質量與多樣性聯合搜尋(Quality-Diversity Search)的多智能體框架。該框架透過譜系化結構管理創意演化,利用多目標反饋驅動的修復與精煉機制提升產出質量,同時結合輕量級序列記憶與顯式對比策略確保創意多樣性。研究團隊提出聯合評估指標 Yield 進行系統評測。在計算科學 8 個領域、32 個主題的大規模實驗中,IDEAgent 在 Yield 指標上超越最佳基線 3.89 倍,覆蓋的非零 Yield 主題數量達到基線的 8 倍。消融實驗進一步驗證了修復與精煉機制對構建邏輯嚴謹性的重要作用。項目已開源。

当前,大型语言模型(LLMs)在自动化科学发现领域取得了显著进展,极大地加速了科研创意的生成过程。然而,深入分析现有系统可以发现一个核心局限性:它们通常将创意的"质量"与"多样性"作为独立的目标进行优化。这种割裂的处理方式导致了严重的后果,即生成的创意往往在概念空间上彼此过于接近,缺乏足够的差异性;或者虽然数量众多,但内容琐碎、缺乏科学依据或表述不清,难以构成有价值的研究假设。针对这一痛点,本研究提出了一种全新的视角,认为科研创意生成应当被视为质量与多样性的联合搜索问题(Quality-Diversity Search)。基于此,作者提出了 IDEAgent,这是一个创新的多智能体协作框架。该框架的核心创新在于引入了"谱系"(lineages)概念来管理创意的演化过程,不再孤立地看待单个创意,而是将其置于一个动态发展的家族树中,从而在追求高科学价值的同时,确保创意库的丰富性与差异性,从根本上解决了传统方法中质量与多样性难以兼得的难题。

在技术实现层面,IDEAgent 采用了一种精细化的多智能体协同机制,通过不同的智能体角色分工来实现质量与多样性的双重驱动。在质量优化方面,框架引入了多目标反馈机制,专门用于对生成的创意进行修复(repair)与精炼(refinement)。这一过程并非简单的文本润色,而是通过逻辑校验和科学合理性评估,剔除错误假设,增强论证的严密性,确保每个最终输出的创意都具备较高的学术价值。在多样性维持方面,IDEAgent 设计了一种轻量级的序列记忆模块,并结合显式的对比策略。系统会将新生成的创意与已完成的历史创意、其祖先节点以及被拒绝的提案进行显式对比。这种机制有效地防止了创意在演化过程中陷入局部最优或重复生成,迫使智能体探索概念空间中未被充分开发的区域。

通过这种将质量优化与多样性探索解耦又协同的架构,IDEAgent 能够在复杂的创意空间中高效导航,生成既新颖又严谨的研究假设。为了系统性地评估这种质量与多样性联合搜索的效果,研究团队开发了一个名为 Yield 的联合评估指标。Yield 指标的计算逻辑是找出满足预定质量阈值的前提下,互不相同的创意集合的最大规模。这一指标巧妙地平衡了"好"与"多"两个维度,避免了单一指标评估的偏差。实验设置涵盖了计算机科学领域的 8 个不同子领域,共计 32 个具体的研究主题,确保了评估的全面性与代表性。实验结果表明,IDEAgent 在 Yield 指标上显著优于现有的最佳基线模型,性能提升了 3.89 倍。

更为惊人的是,IDEAgent 在 8 倍于基线模型数量的主题上实现了非零的 Yield 值,证明了其极强的泛化能力和在不同科研场景下的适用性。此外,通过对质量改进的深入分析,研究进一步证实了修复与精炼机制的关键作用:它们对于构建创意的逻辑严谨性和清晰度至关重要,同时并未牺牲创意的非显而易见性(non-obviousness),即在保持创新性的同时提升了科学性。IDEAgent 的提出对开源社区、工业落地以及后续学术研究具有深远的意义。首先,它打破了传统 AI 辅助科研中质量与多样性对立的思维定式,为自动化科学发现提供了新的方法论范式。通过开源 IDEAgent 框架,研究团队鼓励更多学者探索基于质量多样性搜索的创意生成技术,这将极大促进相关领域的技术创新。对于工业界而言,IDEAgent 能够辅助研究人员快速筛选和生成高质量、多样化的研究假设,缩短从灵感到实验设计的周期,特别是在需要快速迭代和广泛探索的新兴交叉学科领域,具有巨大的应用潜力。此外,该框架的谱系管理和多智能体协作机制也为其他需要平衡探索与利用的复杂决策问题提供了参考。随着大模型在科研中角色的深化,像 IDEAgent 这样能够系统性地处理创意生成中多重约束的框架,将成为推动 AI for Science 发展的重要基础设施,帮助人类科学家在浩瀚的知识海洋中更有效地发现新的真理。

Sources