Deep Reinforcement Learning for Adaptive Radar Jamming: A Markov Decision Process Approach to Cognitive Electronic Warfare
摘要
This study proposes a Reinforcement Learning (RL) framework for adaptive radar jamming in dynamic electronic warfare. By formalizing jamming decisions as a Markov Decision Process and employing a Deep Q-Network with prioritized experience replay, the method optimizes resource allocation across four networked radars using five coordinated jamming techniques. A composite reward mechanism balances suppression effectiveness (87% guidance radar lock-on reduction), evasion improvement (21% in search radars), and energy efficiency. Experiments demonstrate superior performance over conventional RL methods (Q-Learning, State-Action-Reward-State-Action (SARSA), Policy Gradient), achieving mission success despite persistent detection. The work validates RL’s viability for cognitive electronic warfare through theoretical MDP foundations and multi-radar suppression scenarios, highlighting future directions in dynamic state transitions and multi-agent coordination.