FlashRT:智能体驱动的多模态实时推理部署新范式
针对实时多模态应用部署中人工优化成本高、灵活性差的痛点,研究提出FlashRT框架。该框架利用引导编码智能体,将开发者参考实现自动转化为高效的多GPU部署方案。通过"程序链"范式,智能体执行代码到中间表示转换、验证及静态分析,并在测量门控循环中迭代优化。实验显示,在NVIDIA B200上延迟降低70倍,在AMD MI355X上吞吐量提升3.6倍,且在Qwen3-Omni任务中比专家级vLLM-Omni延迟降低65%,证明了智能体驱动优化在异构硬件上的卓越可扩展性。
实时多模态应用,涵盖语音智能体与交互式视频生成等前沿领域,正日益成为人工智能落地的核心场景。这类应用通常由异构模型组合而成的复杂流水线构成,其高效部署不仅依赖于底层硬件性能,更取决于针对具体应用场景在模型放置、流式处理以及模型内并行策略上的精细决策。然而,现有的推理服务系统和自动并行编译器往往局限于固定的工作负载假设和有限的变换策略,导致面对新型应用时,开发者必须投入大量人力进行手工定制,以构建高效的实现方案。这种高度依赖专家经验的模式不仅效率低下,且难以快速适应不断变化的硬件架构与应用需求。为此,本研究提出了 FlashRT,一个创新的智能体辅助部署框架。FlashRT 的核心贡献在于引入智能体来自动化这一复杂的优化过程,它引导编码智能体将开发者编写的简单参考实现,自动升华为针对多 GPU 环境高度优化的部署代码。
该框架能够灵活权衡延迟、吞吐量等关键性能指标,从而在无需人工介入底层细节的情况下,实现从概念原型到生产级高性能部署的跨越,解决了实时多模态应用部署中灵活性与性能难以兼顾的行业难题。在技术实现层面,FlashRT 采用了一种全新的"程序链"(chain-of-program)范式,通过多阶段、多轮次的转换流程来指导通用编码智能体。首先,智能体将开发者的参考实现代码转换为中间表示(IR),这一过程旨在精确捕捉数据依赖关系和持久化状态的作用域,为后续优化奠定结构基础。随后,系统通过一个顺序解释器对生成的 IR 进行验证,确保语义的正确性,并执行静态分析以识别出潜在的优化变换候选项。在此基础上,FlashRT 构建了一个测量门控的优化循环,智能体在该循环中迭代地实现、验证并基准测试每一个候选变换方案。这种机制允许智能体根据实际的测量反馈动态调整优化策略,从而在不同的硬件预算约束下,生成既高效又稳健的部署方案。
整个流程摒弃了传统的硬编码优化规则,转而利用智能体的推理能力,自动探索庞大的优化空间,实现了从代码结构分析到性能调优的端到端自动化。为了验证 FlashRT 的有效性,研究团队在多种具有代表性的实时多模态应用上进行了广泛的实验,包括视频世界模型和多模态大语言模型(MLLMs)。实验结果显示,FlashRT 能够将简单的参考实现转化为极具效率的部署方案。在 NVIDIA B200 GPU 平台上,FlashRT 实现了高达约 70 倍的延迟降低,同时将吞吐量提升了 2.8 倍,显著优于传统手动优化方法。更引人注目的是其在 AMD MI355X GPU 上的表现:FlashRT 不仅匹配了 B200 上的峰值延迟降低效果,还将峰值吞吐量提升推高至 3.6 倍。此外,在 Qwen3-Omni 文本到音频推理任务中,FlashRT 的部署方案相比专家级手工优化的 vLLM-Omni 实现,进一步将响应延迟降低了 65%。
消融实验与对比分析表明,智能体驱动的优化策略在硬件平台生态相对成熟(如 NVIDIA)时能带来巨大收益,而在专家优化资源较少或平台特性独特(如 AMD)时,其可扩展性和适应性优势更为明显,证明了该框架在不同硬件环境下的通用性与鲁棒性。FlashRT 的提出对开源社区、工业落地及后续研究具有深远的意义。对于开源社区而言,它降低了高性能多模态应用部署的门槛,使得开发者无需具备深厚的系统优化知识即可利用智能体获得接近专家水平的性能。在工业落地方面,FlashRT 提供的自动化部署能力能够显著缩短产品从原型到上线的周期,特别是在面对多样化硬件集群时,能够快速适配并优化,降低运维成本。对于后续研究,FlashRT 验证了智能体在系统级优化任务中的巨大潜力,特别是"程序链"范式为自动化编译器设计提供了新的思路。它表明,通过引导智能体进行多轮次的代码变换与验证,可以探索出传统启发式算法难以发现的优化路径。这一工作不仅推动了多模态应用部署技术的进步,也为未来利用 AI 自动化解决复杂软件工程问题开辟了新的方向,预示着智能体将在系统软件栈中扮演越来越核心的角色。