大語言模型在物理科研規劃與提案評估中的能力:人與AI的盲測對比
本研究探討大型語言模型(LLM)在協助物理科研規劃與提案評估中的實際能力。研究團隊以物理學、天文物理學與宇宙學領域的八個專家級研究項目為對象,分別由人類研究團隊與 ChatGPT、Claude、DeepSeek 三種主流大型語言模型獨立生成一頁紙的項目計劃,共計 32 份提案。隨後,這些提案被匿名評估,由四位人類評審員和兩個前沿大模型(Claude Opus 4.8 與 ChatGPT Pro 5.5)依據評分質量、研究意義、可行性與創新性四個維度進行打分,並嘗試識別提案是由人類還是 AI 撰寫。結果顯示,人類評審員對 AI 生成與人類撰寫提案的評分總體相當。但 AI 評審員對 AI 生成的提案給出了顯著更高的分數——約高出 1 分。在作者身份識別任務中,人類評審員對 AI 與人類作者的識別準確率分別為 72% 與 79%,而 AI 評審員則達到了 100% 的準確率。這一發現揭示了當前大型語言模型在科研輔助中的能力及其在評估環節中的系統性偏見,提示我們在廣泛部署 LLM 時應保持謹慎態度。
随着人工智能技术的飞速发展,大型语言模型(LLMs)在自然科学领域的应用已从简单的文献综述扩展到复杂的科研辅助环节。本研究聚焦于一个关键且尚未被充分探索的问题:LLMs是否具备协助科学家进行项目规划及撰写科研提案的能力,以及在提案评估过程中,AI与人类评审员之间是否存在认知偏差。研究团队选取了物理学、天体物理学和宇宙学领域的八个由专家构思的研究项目,旨在模拟真实的科研申请场景。通过对比人类研究人员与当代主流LLM(包括ChatGPT、Claude和DeepSeek,均为2025年中期的模型,并启用了默认的工具访问功能)生成的一页纸项目计划,研究试图量化AI在科研构思阶段的产出质量。这一研究不仅关注AI能否生成结构完整、逻辑自洽的文本,更关注其内容是否符合该领域的专业规范和创新要求,从而为AI在科研生命周期中的角色定位提供实证依据。在技术方法与实验设计上,本研究采用了严格的盲测对照实验。首先,针对选定的八个研究项目,分别由人类专家和三个LLM独立生成项目计划,形成了32份待评估的提案样本,确保了样本的多样性和对比性。
随后,这些提案被匿名化处理,交由四位人类评审员和两个更新的前沿LLM(Claude Opus 4.8和ChatGPT Pro 5.5)进行评估。评估过程依据一个包含四个维度的标准化评估量表进行,涵盖了提案的科学价值、方法论严谨性、可行性及创新性等关键指标。此外,评审任务还包括一项身份识别环节,即要求所有评审员判断每份提案是由人类还是AI撰写。这种设计不仅评估了提案本身的质量,还考察了评审系统对AI生成内容的感知能力。通过引入不同代际的LLM作为评审者,研究进一步揭示了模型版本迭代对评估结果可能产生的影响,避免了单一模型评估带来的偏差。实验结果呈现出有趣且值得深思的差异。在提案质量评分方面,人类评审员对AI撰写和人类撰写的提案给出了总体相似的评分,这表明当前主流的LLM已经能够生成在专业性和完整性上媲美人类专家的项目计划,至少在"一页纸"的篇幅限制下,AI的产出在人类眼中已具备相当的竞争力。
然而,当使用AI作为评审员时,情况发生了显著变化:两个前沿LLM对AI生成的提案评分平均比人类撰写的提案高出约1分(在五分制量表上),显示出明显的系统性偏好。在身份识别任务中,人类评审员正确识别人类和AI提案的准确率分别为72%和79%,说明人类尚能察觉部分AI痕迹,但仍有误判空间;相比之下,AI评审员对32份提案的身份识别准确率达到了100%,显示出AI在识别同类生成内容方面的极高敏锐度。消融分析并未直接涉及,但通过对比不同评审员群体的行为,可以推断出评估主体的身份对评分结果具有决定性影响。这些发现对开源社区、工业落地及后续研究具有深远的意义。首先,它证实了LLMs在科研辅助工具链中的巨大潜力,特别是在项目构思和初步规划阶段,AI可以作为高效的"协作者"激发灵感或完善细节。然而,AI评审员对AI生成内容的偏好警示我们,如果将LLM广泛用于提案评估或同行评审,可能会导致"回音室效应",即AI更倾向于认可其他AI生成的内容,从而扭曲科研资源的分配。因此,在部署LLM进行自动化评估时,必须引入人类监督或采用混合评审机制,以抵消这种系统性偏见。对于开源社区而言,这一研究提供了评估AI科研能力的基准框架,鼓励开发者关注模型在专业领域的公平性与鲁棒性。未来研究可进一步探索如何通过提示工程或微调技术,减少AI评审器的偏见,或开发更复杂的评估指标,以全面衡量AI在科研全生命周期中的贡献。