多智能體离线深度强化学习优化智慧校园毫米波基站部署
本文針對智慧校園中毫米波(mmWave)基站的最優部署問題展開研究。由於實際校園拓撲具有非凸性,且最大最小公平性目標函數呈現非凸、非光滑特徵,該部署問題屬於 NP-hard 難題。作者將基站選址建模為馬爾可夫決策過程(MDP),並系統性地對比了四種深度強化學習(DRL)方案:離散型單智能體 DQN、空間分區多智能體 DQN、連續型單智能體 DDPG,以及地理分區多智能體 DDPG。數字實驗表明,在密集用戶場景下,多智能體 DDPG 顯著優於單智能體方法,實現了全覆蓋,並獲得 0.94 的 Jain 公平性指數。此外,該多智能體框架在 400 用戶的密集場景中展現出高效的計算收斂能力。這項工作為複雜拓撲下的無線資源部署提供了可復現的強化學習基準。
在第五代移动通信及未来网络中,毫米波技术凭借大带宽成为提升容量的关键手段,但其高频段传播损耗大、波束指向性强的特性,使得基站的部署位置直接决定了网络覆盖质量与用户体验。智慧校园作为典型的复杂非凸拓扑场景,建筑密集、用户分布高度不均,传统基于解析或凸优化的部署方法难以适用。本文聚焦的核心问题正是:在现实且非凸的校园拓扑中,如何最优地部署毫米波基站,以同时兼顾覆盖完整性与用户间的公平性。作者指出,由于最大最小公平性目标函数兼具非凸与非光滑特征,该问题属于 NP-hard 难题。
为突破这一约束,论文将基站选址问题形式化为马尔可夫决策过程(MDP),并引入深度强化学习(DRL)框架,利用其在实时自适应与复杂优化中的能力寻求近似最优解。这一贡献的意义在于,把原本难以建模的组合优化问题转化为智能体与环境交互学习的序列决策问题,为无线网络的智能部署提供了新的思路。在技术方法层面,论文的核心在于系统性地设计并对比了四类深度强化学习方案,以探究不同智能体架构与动作空间对部署效果的影响。首先是离散型单智能体 Deep Q-Network(DQN),它将可选基站位置离散化为有限动作,由单一智能体全局决策;其次是空间分区多智能体 DQN,通过地理划分将校园切分为若干子区域,各子区域智能体独立决策以缓解动作空间爆炸。
针对连续动作场景,作者进一步引入连续型单智能体 Deep Deterministic Policy Gradient(DDPG),以及地理分区多智能体 DDPG 框架。这种设计兼顾了离散与连续动作空间、单智能体与多智能体两种协作模式,形成了一套完整的对照体系。训练策略上,多智能体分区机制通过降低每个智能体的局部决策复杂度,提升了密集场景下的收敛效率,而 DDPG 作为确定性策略算法,则更适合连续选址这类需要精细动作输出的任务。四类方案的对比,本质上是在探索智能体规模与动作连续性如何共同影响复杂拓扑下的部署质量。
在实验设置与关键结果方面,论文在贴近真实的非凸校园拓扑上进行了数值评估,并重点考察了密集用户场景下的表现。关键指标包括网络覆盖率、Jain 公平性指数以及算法的收敛效率。实验结果显示,多智能体 DDPG 方案在密集场景下显著优于单智能体方法,充分验证了分区协作与连续动作设计的有效性。更为重要的是,该方法实现了全覆盖,并获得了 0.94 的高 Jain 公平性指数,意味着用户在体验上的差异被有效缩小,避免了少数用户被边缘化的问题。
在收敛性方面,多智能体框架在 400 用户的密集场景中展现出高效的计算收敛能力,说明其在用户规模增大时仍能保持稳定的求解效率。这些消融式的对比发现揭示了一条清晰规律:当场景复杂度上升时,单智能体方案因动作空间与状态空间膨胀而性能受限,而多智能体分区结合连续策略的 DDPG 则能更好地平衡性能与效率,为实际部署提供了可靠的算法选择。从行业意义与潜在影响来看,这项工作为智慧校园及类似复杂场景的无线网络部署提供了一套可复现、可对比的强化学习基准。其价值不仅在于提出了一个高性能的部署方案,更在于系统梳理了不同 DRL 架构在同一问题上的优劣,为后续研究指明了方向。在开源社区层面,这种将 NP-hard 部署问题统一建模为 MDP 并公开对比框架的做法,降低了后来者的研究门槛,有助于推动无线资源管理领域的标准化评测。在工业落地方面,毫米波基站的智能部署是 5G 乃至 6G 网络建网阶段的关键环节,多智能体 DDPG 所展现的高覆盖、高公平与高效收敛特性,直接契合运营商对建设成本与用户体验的双重诉求。对于后续研究而言,本文提出的空间分区与连续动作结合的思路,可自然延伸至移动用户场景、动态时变拓扑或联合波束赋形等更复杂的联合优化问题,具有广阔的拓展空间。总体而言,该研究在理论建模与工程实用之间架起了桥梁,是强化学习赋能无线通信部署的一次扎实探索。
Sources
FAQ
这项研究针对智慧校园的什么问题?
研究聚焦非凸校园拓扑中毫米波基站的最优部署,将基站选址建模为马尔可夫决策过程(MDP),引入深度强化学习(DRL)寻求近似最优解。
为什么毫米波基站部署属于 NP-hard 难题?
因为现实校园拓扑是非凸的,而最大最小公平性目标函数兼具非凸与非光滑特征,导致该选址问题无法用传统凸优化高效求解。
哪种强化学习方案部署效果最好?
实验表明,密集用户场景下多智能体 DDPG 显著优于单智能体方法,实现全覆盖并获得 0.94 的 Jain 公平性指数,400 用户场景中收敛高效。