GS-Agent:基於生成式仿真構建可控4D物理世界的多智能體系統

本文提出GS-Agent,一個端到端的多智能體框架,旨在從自然語言描述中自動生成動態且物理真實的4D世界。傳統電腦圖形學方法依賴人工精細調整材質、運動與視覺保真度,耗時且難以保證物理合理性;而現有的生成式基礎模型雖能學習大規模數據,卻往往缺乏對物理規律的嚴格遵循及細粒度控制能力。GS-Agent受人類創作流程啟發,將任務分解為實體管理(涵蓋3D資產策展、材質調節、放置及運動控制)與渲染配置(包括相機與燈光操控)。系統透過整合物理引擎,讓具備不同專長的多个智能體利用程式碼與物理環境互動,並尋求多模態回饋,從而迭代構建符合描述的4D世界。實驗表明,GS-Agent能有效生成包含液體、可變形物體與剛體豐富互動的物理合理世界,並實現電影級的相機與燈光控制,為創意內容生成與物理AI奠定了新範式。

在计算机图形学与人工智能的交叉领域,如何从自然语言描述中自动生成动态且物理真实的4D世界,一直是一个既迷人又极具挑战性的难题。传统的计算机图形学方法虽然能够产出高质量的视觉效果,但其核心依赖于繁琐的人工创建过程,创作者需要投入大量精力去微调材质属性、设计物体运动轨迹以及优化视觉保真度,这种高人力成本的模式难以规模化。近年来,随着生成式基础模型的兴起,研究者开始探索利用大规模数据来学习4D世界的生成,然而,现有方法普遍面临两大瓶颈:一是生成的场景往往缺乏严格的物理合理性,物体可能穿越彼此或违背重力常识;二是缺乏细粒度的可控性,用户难以精确指定复杂的物理交互细节。针对这一现状,本研究提出了一种截然不同的解决路径,即利用基础模型构建一个代理系统(Agentic System),该系统不仅自动化了传统的人类创作流程,更通过引入物理引擎作为核心反馈机制,确保了生成内容的物理真实性与可控性。GS-Agent的核心贡献在于它不仅仅是一个生成模型,而是一个能够模拟人类专家思维过程的多智能体协作框架,它重新定义了从文本到复杂物理世界的生成范式。

在技术方法层面,GS-Agent采用了一个端到端的多智能体架构,其设计理念深度借鉴了人类艺术家和工程师构建虚拟世界的逻辑。系统将复杂的4D世界生成任务解耦为两个主要模块:实体管理与渲染配置。在实体管理模块中,智能体负责3D资产的策展与选择、材质参数的精细调节、物体在场景中的空间放置以及运动行为的控制;而在渲染配置模块中,智能体则专注于相机视角的规划与灯光环境的布置,以营造特定的氛围。为了实现这些任务,GS-Agent集成了物理引擎在循环中(physics in the loop),这意味着生成过程不是单向的映射,而是一个闭环的迭代优化过程。多个具有不同专长的智能体通过编写代码与物理引擎进行交互,它们能够实时观测物理模拟的结果,并获取多模态的反馈信息。

例如,当智能体放置一个刚体时,物理引擎会模拟其碰撞与下落,智能体根据反馈判断是否符合物理常识,若不符合则调整参数或重新放置。这种基于代码交互与多模态反馈的协作机制,使得系统能够逐步修正错误,最终构建出既符合自然语言描述,又具备高度物理合理性的4D世界。实验结果充分验证了GS-Agent的有效性与优越性。在多个基准测试中,GS-Agent展示了将自然语言转化为多样化且物理合理的4D世界的能力。特别是在处理复杂的物理交互场景时,系统能够生成包含液体流动、可变形物体形变以及刚体碰撞等丰富动态效果的场景,这些场景中的物体行为严格遵循物理定律,没有出现穿模或反重力等不合理现象。

此外,GS-Agent在渲染质量上也表现出色,能够实现电影级的相机运镜与灯光控制,使得生成的视频片段具有极高的视觉保真度和艺术感染力。消融实验进一步揭示了多智能体协作与物理引擎反馈的重要性:当移除物理引擎反馈时,生成的场景物理合理性显著下降;当移除多智能体协作机制时,系统在复杂任务上的控制精度大幅降低。这些关键结果不仅证明了GS-Agent在技术上的可行性,也展示了其在处理复杂物理场景时的鲁棒性。GS-Agent的提出对开源社区、工业落地及后续研究具有深远的意义。对于开源社区而言,GS-Agent提供了一个全新的多智能体协作框架,展示了如何将基础模型与专业工具(如物理引擎)有机结合,为后续研究提供了宝贵的参考范式。在工业落地方面,该系统有望被广泛应用于游戏开发、电影特效制作以及虚拟现实内容生成等领域,大幅降低高质量4D内容制作的门槛与成本,赋能创意内容的快速生产。此外,GS-Agent生成的物理合理世界也为物理AI(Physical AI)的研究提供了理想的训练环境,智能体可以在这些逼真的环境中学习更复杂的交互策略,从而推动具身智能的发展。总之,GS-Agent不仅是一个技术突破,更是一个开启4D世界生成新范式的基石,它预示着未来人机协作创作将更加自然、高效且充满无限可能。

Sources