【RL+抗干扰】抗反应式干扰的强化学习辅助 OFDM-IM 通信系统【附python代码】

作品简介
微信公众号:EW Frontier关注可了解更多的雷达、通信、人工智能相关代码。问题或建议,请公众号留言;如果你觉得EW Frontier对你有帮助,欢迎加入我的知识星球或面包多,更多代码等你来学
新知识星球:https://wx.zsxq.com/group/15554455154582面包多:https://mbd.pub/o/author-a2mYl2tsbA==/work
QQ交流群:363269350
注:本文为参考文章~代码为对其部分内容进行复现~

抗反应式干扰的强化学习辅助 OFDM-IM 通信系统


一、摘要

本文提出了一种创新的正交频分复用索引调制(OFDM-IM)发射机设计,旨在实现抗反应式干扰的高速通信。该模型能动态调整索引调制(IM)参数与调制类型,还具备新颖的多载波噪声调制能力,可在强干扰环境下提升鲁棒性。此外,系统引入强化学习(RL)机制,无需任何干扰机信息即可寻找最优防御策略。通过大量计算机仿真验证,结果表明:子载波自适应(调整 IM 参数)能提升系统吞吐量,噪声调制可改善误码率(BER)性能;该模型在复杂反应式干扰攻击下仍能维持稳定通信,性能优于多种基准模型。

二、引言

无线通信因无线信道的叠加特性,极易受到外部信号干扰,这凸显了下一代通信系统设计中安全与可靠性措施的重要性。干扰攻击是无线通信的重大威胁之一,它会向信道中注入恶意信号以干扰合法信号。根据干扰机特性(如信号类型、认知能力、干扰模式),抗干扰方案分为规避干扰机和减轻干扰信号破坏性两类。

传统干扰规避策略以扩频(SS)技术为主,发射机通过快速跳频或直接序列扩频利用宽频谱。这类技术虽能通过规避干扰实现一定数据速率,但存在带宽效率低、实现复杂的问题。缓解类方法则通过调整系统参数应对干扰,而非规避干扰,例如速率自适应策略会在检测到干扰时切换至低速率以维持通信质量,功率自适应策略会提高发射功率防止合法信号被干扰信号压制,但这两种策略分别以降低数据速率和增加功耗为代价。

现代抗干扰技术将缓解策略提升到新高度,引入了环境反向散射、能量收集和欺骗技术。例如,环境反向散射技术可将干扰信号转化为数据传输介质,能量收集技术能利用干扰信号存储能量供后续传输,欺骗技术则主要针对反应式干扰机,通过虚假信号诱使其暴露。

由于发射机和干扰机都能观察对方行为并做出反应,为节点配备感知能力带来了独特的优化问题。因此,部分抗干扰研究聚焦于寻找最优决策机制(即策略)。随着机器学习技术的发展,强化学习(RL)在抗干扰最优防御策略研究中开始发挥关键作用。

(一)相关工作

1

强化学习辅助抗干扰:基于强化学习的抗干扰应用按优化目标大致可分为两类,一是寻找最优跳频方案,二是确定最优传输参数。例如,有研究采用深度 Q 学习(一种结合深度学习的无模型强化学习方法)为认知无线电网络中的次级用户寻找最优跳频;也有研究将环境表示为频谱瀑布(时频维度的能量矩阵),利用深度 Q 学习选择最佳信道。此外,强化学习 - based 的频率选择思想还被扩展到多用户系统,也有研究用深度 Q 学习寻找最佳传输参数,并验证了多种技术对提升平均吞吐量的作用。

2

OFDM-IM 辅助抗干扰:OFDM(正交频分复用)与 IM(索引调制)结合的架构,通过子载波激活模式传输额外信息,相比传统 OFDM 系统提升了频谱效率和误码性能。已有研究将 IM 应用于正交啁啾分复用和仿射频分复用,提升了系统抗干扰和应对动态环境的能力;还有研究利用 OFDM-IM 架构中的无源子载波设计干扰检测算法,或独立调整索引和数据码率以提升不同干扰场景下的 BER 性能。但上述研究均未考虑通过机器学习动态优化系统参数。

(二)研究动机与贡献

现有部分强化学习模型通过在频域规避干扰机提升系统性能,但仅利用少量频谱,导致频谱效率低、数据速率下降;另有部分模型虽直接对抗反应式干扰机,甚至诱骗干扰机以利用其干扰功率,且证明了强化学习在新型系统模型中的有效性,但仅关注强化学习模型的可行性,未考虑通信系统本身,缺乏物理层设计,且系统模型侧重数据队列和能量管理优化。

本文提出的方法与之不同,一是采用两种新型抗干扰技术,二是构建多载波、以速率为核心的系统模型,三是纳入物理层设计。主要贡献包括:

1

提出新型 OFDM-IM 发射机设计,可调整 IM 参数(如子块、激活子载波)和调制类型(M 进制星座、噪声调制),其中噪声调制能在强干扰下实现稳定通信,且该研究首次实现子载波自适应和多载波噪声调制。

2

引入 Q 学习模型寻找最优防御策略,发射机通过与信道交互学习最优行为,无需预先获取干扰机信息。

3

考虑四种不同反应式干扰机策略,以评估系统应对不同干扰能力(如功率自适应、带宽自适应、隐蔽性)的鲁棒性。

4

通过大量仿真验证系统可行性与性能,仿真涵盖从 OFDM-IM 发射机到接收机的基带实现,包含多径、衰落、热噪声等物理层因素,结果证实子载波自适应和噪声调制分别提升了系统吞吐量和 BER 性能。

三、强化学习网络模型

(一)模型基础:马尔可夫决策过程(MDP)

系统将通信过程建模为 MDP,各核心要素定义如下:

智能体:合法发射机,通过执行动作与环境交互。

动作(a∈A):从动作空间 A 中选择发射机参数组合。

状态(s∈S):信道状态快照,取值于状态空间 S。

环境:无线信道,决定状态转移,包含干扰机决策。

奖励(r=R (s,a)):接收机反馈,由奖励函数 R (s,a) 计算。

策略(π:S→A):决策机制,定义智能体动作选择,即从状态空间到动作空间的映射。

发射机目标是寻找最大化累积奖励期望的策略,公式为:


其中,τ 为吞吐量,γ 为折扣因子,E 为期望算子,t 代表发射机执行动作并观察结果的时间步。

(二)核心算法:Q 学习

Q 学习无需建模环境即可为 MDP 优化问题提供迭代解决方案,核心是维护 Q 表记录各状态 - 动作对的 Q 值(Q (s,a)),Q (s,a) 表示在状态 s 下执行动作 a 的收益。策略由 Q 表确定,即选择当前状态下 Q 值最大的动作,公式为:


Q 表通过与环境交互迭代更新,更新规则为:


其中,Q_target 为目标 Q 值,计算公式为:


α 为学习率(0<α≤1),决定新信息对现有 Q 值的影响程度;γ 为折扣因子(0<γ<1),权衡即时奖励与未来奖励的重要性。

(三)关键设计细节

1

探索与利用平衡:采用 ε- 贪婪算法,以 ε 概率探索新动作(获取环境信息),以 1-ε 概率利用已知最优动作(最大化收益)。且 ε 随时间衰减,初期较大以快速学习,后期减小以优化策略。

2

状态空间:定义为干扰符号的带宽占用率(ρ)和功率(N_j)的元组集合,即:


发射机通过信道估计获取当前状态,若干扰功率为连续值,会将观测值取整后存入 Q 表。

1

动作空间:包含 OFDM-IM 配置、OFDM 配置、噪声调制和空闲四种类型,具体为:


其中,n 为子块中子载波数,k 为子块中激活子载波数,M 为调制阶数。

1

奖励机制:奖励函数结合吞吐量和 BER 表现,公式为:

è

‹

è

‹

è

‹

当 BER 低于阈值(BER_lim)时,奖励为吞吐量;高于阈值时,按子载波数(潜在通信速率)惩罚;空闲状态无奖励或惩罚。

(四)算法流程与发射机设计

1

算法步骤:输入探索率 ε、学习率 α、折扣因子 γ 和动作空间 A;初始化初始状态 s_t=0 和 Q 表 Q_t;在每个时间步 t,按 ε- 贪婪算法选择动作 a_t 并执行;根据接收机反馈计算奖励 r_t,观测下一状态 s_{t+1};若 s_{t+1} 为新状态,在 Q 表中创建新条目,否则更新 Q 表;最后更新探索率 ε,进入下一时间步。

2

发射机结构:包含学习模块、子块创建器、索引选择器、映射器、OFDM 块创建器、IFFT 模块等。学习模块运行 Q 学习算法确定动作 a_t 并传递给子块创建器;子块创建器根据 a_t 将信息比特分配给索引选择器和映射器;索引选择器通过查找表生成激活子载波数组;映射器将比特调制为星座符号;OFDM 块创建器生成 OFDM 符号;后续模块完成 IFFT 变换、添加报头与循环前缀、并串转换和数模转换等操作。

四、结论

本文提出一种抗干扰通信系统,融合 OFDM、IM、噪声调制和 Q 学习技术,优化应对多种干扰攻击的防御策略。该研究首次引入子载波自适应和多载波噪声调制,为该领域设立新基准。系统将通信过程建模为 MDP 优化问题,通过 Q 学习算法求解,使发射机能通过与信道交互学习最优行为,无需预先掌握干扰机信息。大量仿真验证了系统的可行性与性能,未来研究将探索集成更先进的强化学习技术,并将该系统适配到其他通信框架中。

相关学习资料见面包多链接https://mbd.pub/o/author-a2mYl2tsbA==/work

欢迎加入我的知识星球:

https://wx.zsxq.com/group/15554455154582,永久获取更多相关资料、代码。

(目前为新知识星球,切莫加入到老知识星球)


创作时间: