首站-论文投稿智能助手
典型文献
基于改进DDPG的空战行为决策方法
文献摘要:
针对空战中飞机如何根据实时态势进行快速智能决策问题,提出基于改进DDPG算法的空战行为决策框架(Air Combat Behavior Decision-making Framework on Improve DDPG,ACBDF_DDPG).框架中的主要改进如下:1.设计一种针对动态目标的嵌入式人工经验奖励机制,缓解深度强化学习算法在训练过程中,由于状态空间巨大且奖励稀疏导致的收敛困难问题;2.对框架中的Actor网络更新机制进行改进,解决Critic网络评估效果差时,更新Actor网络导致的模型训练不稳定问题;3.采用优先采样机制确保训练价值高的经验样本得到充分利用.最后基于MaCA平台搭建仿真实验环境,通过消融实验验证了所提出框架中改进机制的有效性和优越性.
文献关键词:
深度强化学习;深度确定性策略梯度;空战行为决策;动态目标;嵌入式人工经验奖励机制
作者姓名:
殷宇维;王凡;吴奎;胡剑秋
作者机构:
江苏自动化研究所,江苏 连云港 222061
文献出处:
引用格式:
[1]殷宇维;王凡;吴奎;胡剑秋-.基于改进DDPG的空战行为决策方法)[J].指挥控制与仿真,2022(01):97-102
A类:
空战行为决策,ACBDF,嵌入式人工经验奖励机制,MaCA
B类:
DDPG,决策方法,时态,智能决策,决策问题,决策框架,Air,Combat,Behavior,Decision,making,Framework,Improve,动态目标,深度强化学习算法,训练过程,状态空间,疏导,困难问题,Actor,更新机制,Critic,网络评估,评估效果,模型训练,稳定问题,采样机制,训练价值,平台搭建,实验环境,消融实验,深度确定性策略梯度
AB值:
0.352314
相似文献
机标中图分类号,由域田数据科技根据网络公开资料自动分析生成,仅供学习研究参考。