多无人机自适应信息路径规划深度强化学习系统 | 1
← 返回项目列表

免费项目

多无人机自适应信息路径规划深度强化学习系统

基于深度强化学习的多无人机自适应路径规划系统(IROS 2023),采用反事实基线方法解决多智能体信用分配问题,实现无人机团队协同的3D地形监测。支持团队规模可迁移和通信约束,在真实地形数据上验证优于传统方法

项目说明

项目简介

基于深度强化学习的多无人机自适应路径规划系统,专门用于大规模地形监测任务。论文发表于 IROS 2023,由波恩大学 PhenoRob 团队开发。

核心功能

  • 多智能体深度强化学习框架:Actor网络独立策略,Critic网络中心化训练,反事实基线处理信用分配
  • 3D工作空间路径规划:新型网络特征表示,自适应采样策略,局部地图更新,全局目标协同
  • 通信约束处理:支持完全通信、限制通信和无通信模式,团队规模可迁移
  • 自适应地形监测:感兴趣区域优先,动态重规划,团队鲁棒性保障

技术架构

  • Actor网络:learner.py(训练器)、network.py(策略网络)、transformations.py(特征转换)
  • Agent组件:agent.py(核心逻辑)、action_space.py、state_space.py、communication_log.py
  • 训练流程:环境初始化 → 状态观测 → 动作采样 → 环境交互 → 经验存储 → 网络更新
  • 反事实基线:构造反事实状态,Q值差分计算,信用分配,协同行为学习

应用场景

大规模环境监测(森林火灾、农业作物)、灾害响应(洪水地震评估、搜索救援)、基础设施巡检、科学研究(地质勘探、极地监测)

技术亮点

  • CTDE范式:中心化训练利用全局信息,去中心化执行无需通信
  • 反事实基线:解决多智能体信用分配难题,区分个体和协同贡献
  • 可迁移性:训练一次适用不同数量无人机和地形类型
  • 3D特征表示:高度信息编码,多尺度特征,高效网络结构

性能优势

相比非学习方法:更快的映射速度,更高的覆盖效率。相比非反事实变体:显著提升的团队协作,更快的训练收敛。真实数据验证:合成地形和真实地形数据双重验证,良好的跨环境泛化能力。