免费项目
多无人机自适应信息路径规划深度强化学习系统
基于深度强化学习的多无人机自适应路径规划系统(IROS 2023),采用反事实基线方法解决多智能体信用分配问题,实现无人机团队协同的3D地形监测。支持团队规模可迁移和通信约束,在真实地形数据上验证优于传统方法
项目说明
项目简介
基于深度强化学习的多无人机自适应路径规划系统,专门用于大规模地形监测任务。论文发表于 IROS 2023,由波恩大学 PhenoRob 团队开发。
核心功能
- 多智能体深度强化学习框架:Actor网络独立策略,Critic网络中心化训练,反事实基线处理信用分配
- 3D工作空间路径规划:新型网络特征表示,自适应采样策略,局部地图更新,全局目标协同
- 通信约束处理:支持完全通信、限制通信和无通信模式,团队规模可迁移
- 自适应地形监测:感兴趣区域优先,动态重规划,团队鲁棒性保障
技术架构
- Actor网络:learner.py(训练器)、network.py(策略网络)、transformations.py(特征转换)
- Agent组件:agent.py(核心逻辑)、action_space.py、state_space.py、communication_log.py
- 训练流程:环境初始化 → 状态观测 → 动作采样 → 环境交互 → 经验存储 → 网络更新
- 反事实基线:构造反事实状态,Q值差分计算,信用分配,协同行为学习
应用场景
大规模环境监测(森林火灾、农业作物)、灾害响应(洪水地震评估、搜索救援)、基础设施巡检、科学研究(地质勘探、极地监测)
技术亮点
- CTDE范式:中心化训练利用全局信息,去中心化执行无需通信
- 反事实基线:解决多智能体信用分配难题,区分个体和协同贡献
- 可迁移性:训练一次适用不同数量无人机和地形类型
- 3D特征表示:高度信息编码,多尺度特征,高效网络结构
性能优势
相比非学习方法:更快的映射速度,更高的覆盖效率。相比非反事实变体:显著提升的团队协作,更快的训练收敛。真实数据验证:合成地形和真实地形数据双重验证,良好的跨环境泛化能力。