Intern-S2-Preview 发布:以记忆增强与多模态强化学习重构长时程科学智能体

Published 2026-08-13 · AI Daily — AI-assisted deep research, methodology & disclosure

上海人工智能实验室发布 Intern-S2-Preview,一款专为长时程科学任务设计的智能体基础模型。该模型通过科学多模态预训练及包含监督微调、多任务强化学习、黑盒/白盒智能体强化学习、在线策略蒸馏的统一后训练流程构建。架构上,397B 版本将时间序列建模扩展至数值预测,Memory Decoder 作为独立记忆增强路径,在不修改冻结骨干网络前提下实现快速科学特化。实验显示,其在多个基准上取得领先,时间序列模块提升 SciTS 信号理解与预测能力,Intern-MemDec-4B 扩展将 Biology-Instructions 平均分从 56.92 提升至 60.32,展现复杂科学工作流中的强大潜力。

随着科学发现日益依赖对异构模态证据的推理、与科学工具的交互以及跨长任务周期的持续进展,传统 AI 系统在处理复杂科学工作流时面临严峻挑战。Intern-S2-Preview 正是为了解决这一痛点而设计,它不仅仅是一个静态的知识库,更是一个能够主动与环境交互、执行多步骤任务的智能体基础模型。该系列模型的核心贡献在于构建了一套支持多模态科学理解、推理、生成及长时程任务执行的完整框架。通过整合视觉、文本及时间序列数据,该模型旨在模拟科学家在研究过程中的认知路径,从初步假设生成到实验数据验证,再到最终结论推导,实现端到端的自动化辅助。这种设计使得 AI 不再局限于回答单一问题,而是能够参与整个科学发现的生命周期,显著降低了跨学科研究的技术门槛,并为自动化实验室和智能科研助手提供了坚实的技术底座。 在技术实现上,Intern-S2-Preview 采用了一套严谨且高效的训练流水线。首先,模型在渲染的科学文档、交错图文数据及多样化科学语料库上进行多模态预训练,以建立深厚的领域知识基础。随后,从预训练检查点出发,应用统一的后训练流程,包括监督微调、可扩展的多任务强化学习、黑盒与白盒智能体强化学习以及在线策略蒸馏。为了提升训练的稳定性和效率,研究团队引入了一系列实用技术,如带有离策略校正的部分 rollout、自适应长度正则化、在线推测解码、鲁棒多任务优化以及针对智能体任务的轨迹感知经验组装。在架构层面,Intern-S2-Preview-397B 特别扩展了时间序列建模能力,从高效的长序列理解延伸至数值预测,使其能够处理动态变化的科学信号。此外,Memory Decoder 被设计为一条独立的记忆增强路径,它允许在不修改冻结的 397B 骨干网络的情况下,通过外部记忆模块快速适应新的科学领域,这种解耦设计极大地提高了模型的可扩展性和维护效率。 实验评估涵盖了科学、多模态、智能体及通用基准,全面验证了模型的性能。结果显示,Intern-S2-Preview-397B 在多个设置中取得了具有竞争力或领先的结果,证明了其在复杂推理任务中的鲁棒性。特别是在时间序列模块方面,模型在 SciTS 基准上显著提升了科学信号的理解与预测能力,表明其能够捕捉科学数据中的细微动态变化。更引人注目的是,独立的 Intern-MemDec-4B 扩展在不改动主模型的前提下,将 Biology-Instructions 基准的平均得分从 56.92 提升至 60.32。这一结果不仅证明了记忆增强机制的有效性,也展示了模块化设计在特定领域快速特化方面的巨大优势。消融实验进一步揭示,在线策略蒸馏和轨迹感知经验组装对于维持长时程任务中的决策一致性至关重要,而自适应长度正则化则有效缓解了智能体在探索过程中的冗余行为,确保了训练过程的收敛性。 从行业意义来看,Intern-S2-Preview 的发布标志着 AI 在科学领域的应用从"辅助工具"向"协作伙伴"的转变。对于开源社区而言,其提供的统一后训练流程和模块化架构为后续研究提供了宝贵的参考范式,特别是记忆增强路径的设计,为如何在保持基础模型通用性的同时实现领域特化提供了新思路。在工业落地方面,该模型在长时程任务中的稳定性使其有望应用于药物发现、材料科学等需要长期迭代和复杂交互的场景,大幅缩短研发周期。此外,其在线推测解码和鲁棒多任务优化技术也为降低大规模智能体模型的推理成本提供了可行方案。未来,随着更多科学工具的集成和记忆机制的优化,此类智能体基础模型有望成为自动化科研基础设施的核心组件,推动科学发现进入一个由 AI 深度参与的新纪元。

Sources