logo全球能源互联网期刊信息服务平台

目录

图片(0

    表格(0

      全球能源互联网

      第9卷 第1期 2026年01月;页码:60-71
      EN

      面向强不确定性供需波动的新能源电网调度强化学习算法

      A Reinforcement Learning Algorithm for New Energy Grid Dispatch with Strong Uncertainty in Supply and Demand Fluctuations

      周宁1 ,徐铭铭1 ,刘清秋2 ,黄玉雄2 ,陈明1 ,李更丰2*
      ZHOU Ning1 , XU Mingming1 , LIU Qingqiu2 , HUANG Yuxiong2 , CHEN Ming1 , LI Gengfeng2*
      • 1.国网河南省电力公司电力科学研究院,河南省 郑州市 450052
      • 2.西安交通大学电气工程学院,陕西省 西安市 710049
      • ZHOU Ning1, XU Mingming1, LIU Qingqiu2, HUANG Yuxiong2, CHEN Ming1, LI Gengfeng2* (1. State Grid Henan Electric Power Research Institute, Zhengzhou 450052, Henan Province, China
      • 2. School of Electrical Engineering, Xi’an Jiaotong University, Xi’an 710049, Shaanxi Province, China

      摘 要

      Abstract

      随着新能源产业逐步规模化,面向新能源消纳能力提升的电力系统,动态经济调度重要性日渐凸显。提出一种分布式多智能体强化学习算法来解决高比例新能源动态经济调度问题。首先,通过平均一致性算法得到每时刻电网功率总需求,利用投影优化方法求得满足耦合约束、完全消纳新能源的可行功率输出;同时,基于二次函数逼近评价网络的状态动作值函数,通过求解凸优化问题得到调度的另一个近似最优解;然后,构建动作网络用于直接学习总功率需求、新能源实时最大可用出力与各火电机组决策有功出力之间的关系,并运用大量训练所得经验,在动态电力系统中迅速作出最优输出功率预测,从而提高发电机决策效率;最后,通过IEEE 39节点算例验证了所提算法的有效性和鲁棒性。

      As the new energy industry gradually scales up, dynamic economic dispatch in power systems aimed at enhancing new energy absorption capacity is becoming increasingly crucial. This paper proposes a distributed multiagent reinforcement learning algorithm to address the dynamic economic dispatch problem in systems with high proportions of new energy. First, the total power demand of the grid at each time step is obtained through an average consensus algorithm,and a feasible power output that meets coupling constraints and fully absorbs new energy is determined using a projection optimization method. Additionally, by employing a quadratic function to approximate the state-action value function of the evaluation network, another near-optimal solution for dispatch is derived by solving a convex optimization problem.Subsequently, an action network is constructed to directly learn the relationship between total power demand, real-time maximum available output of new energy units, and the active power output decisions of each thermal power unit. Leveraging experience from extensive training, the model swiftly predicts optimal output power in dynamic power systems, thus improving generator decision efficiency. Finally, the effectiveness and robustness of the proposed algorithm are verified through tests on the IEEE 39-bus system.

      0 引言

      在“十四五”期间,碳达峰、碳中和成为国家发展的关键目标,高比例新能源电力系统建设正逐步推进[1-4]。新能源发电出力受气象条件影响,呈现间歇性和不可控性,增加了系统功率平衡难度,对电力系统的经济调度提出新挑战[5-7]。同时,新能源出力与负荷需求的时空不匹配要求配置更多灵活性资源,提高了运行成本[8-11]。这些技术特性使得经济调度需要在确保系统安全稳定的前提下,优化资源配置,提高新能源消纳效率[12-13]

      在电力系统中,经济调度问题(economic dispatch problem,EDP)的主要任务是在各种约束条件下寻求最优发电量分配,以使总发电成本最小化。根据考虑时间段单一与否,EDP可以分为静态经济调度问题(static economic dispatch problem,SEDP)与动态经济调度问题(dynamic economic dispatch problem,DEDP)[14]。文献[15]利用梯度推进算法解决了具有通信时滞的SEDP问题;文献[16]基于乘子分裂方法,在无初始化的情况下给出SEDP的最优策略。但SEDP仅考虑确定时间段内的经济调度,属于在单一时间断面上研究特定时段的优化问题,忽略了电力系统的动态特性与各个时间段之间的联系,存在明显的局限性[17]。DEDP则充分利用各时间断面电力系统各特征量之间的联系,更好地应对新能源接入带来的源侧随机性。

      解决EDP的主要方法有经典优化算法、智能优化算法与强化学习算法[18]。文献[19]基于混合整数线性规划方法,建立了min-max-min结构的两阶段鲁棒优化模型,得到运行成本最低的调度方案。文献[20]提出了双层非线性经济调度模型,并运用非线性对偶优化方法求解。这些传统调度方法往往依赖于高精度的预测模型,或仅按照固定比例预留备用容量,难以应对高比例新能源带来的强随机性;而鲁棒优化等方法虽然考虑了不确定性,但往往导致结果过于保守,难以兼顾经济性与安全性[21-22]。强化学习算法在未知环境中展现出强大的策略开发能力[23],通过持续的环境探索与自主学习机制,快速响应系统负荷需求,有效维持系统功率平衡,确保电力系统的安全稳定运行[24]

      从通信的角度来看,强化学习解决DEDP的算法可以分为集中式算法[25-30]和分布式算法[31-32]。集中式算法需要一个集中式控制中心,在全局视角优化和统一协调方面具有优势[33]。文献[27-28]构建了一种基于Q-learning算法的配电网智能调度模型,从而有效应对负荷波动和风电出力不确定性的双重挑战。文献[29]以实现光伏发电全额消纳为前提,创新提出了一种基于改进型深度确定性策略梯度算法的光伏抽水蓄能联合系统实时优化调度策略。文献[30]采用混合知识数据驱动方法,通过先验知识进行初始化,并结合最新经验持续更新模型,显著提升了系统在无经验突发场景下的安全性。但在处理大规模、复杂和动态变化的电力系统时,集中式算法的联合动作空间将随着系统中智能体数量的增加而呈指数级增长[34]

      在分布式算法中,每个智能体只与相邻智能体进行通信,而不需要知道全局信息,展现出更高的计算效率、扩展性、鲁棒性[35]和实时响应能力[36]。文献[37]利用分布式强化学习算法,针对多用户蜂窝网络中的动态功率分配问题提出了有效的解决方案。文献[38]运用分布式优化方法研究了具有局部不等式约束的电力系统,并将其应用于考虑发电机发电限制和输电线路容量约束的最优负载共享问题。文献[39]提出了经济调度中成本函数建模困难的Q-learning算法。文献[40]通过切平面一致性算法[41]对多区域DEDP进行完全分散优化。文献[42]采用二次函数逼近将原问题近似为凸优化问题,并利用分布式优化算法与分布式强化学习结合寻找最优的连续功率输出。文献[43]将确定性动作神经网络融入分布式多智能体强化学习算法中解决动态经济调度问题。

      现有研究利用分布式多智能体强化学习算法解决了传统电力系统的DEDP,但较少考虑新能源发电受气象因素影响带来的强不确定性问题,导致其在应对高比例新能源场景时存在局限性。针对这一问题,本文聚焦于高比例新能源发电的场景,提出一种改进的分布式多智能体深度确定性策略梯度方法[44],以解决新能源出力波动引发的供需失配与安全消纳问题。本文的主要贡献如下:

      1)使用分布式强化学习算法,引入分布式约束投影方法[16],通过训练逐步得到最优的可行功率输出组合,达到消纳新能源的效果。

      2)设计动作网络[43],可以直接学习总负荷需求、新能源实时最大可用出力与最优功率输出之间的关系,促使智能体在面对波动的新能源出力时作出高效决策。

      1 高比例新能源的动态经济调度模型

      1.1 动态经济调度问题模型

      解决高比例新能源电力系统DEDP的关键是在机组上下限约束与火电机组爬坡约束下,找到最优的火电机组电力分配,从而有效消纳新能源,同时使总发电成本最小化,可描述为式(1):

      式中:Fi(·) 是火电机组i的发电成本函数;γ tt时刻的折扣因子且γ ∈(0,1];pi ,t是在时间t火电机组i的功率输出;prej t,是时间t新能源机组j的功率输出;Dt是时间t电网的总功率需求;pi分别是火电机组i的最小和最大功率输出;分别是新能源机组j的最小和最大功率输出;piR是火电机机组i的爬坡率限制。由于新能源机组发电不消耗燃料,在本文中发电成本仅考虑传统火电机组。

      在成本函数中引入折扣因子γ ∈(0,1],可以与强化学习中衡量未来奖励的折扣因子相对应,而由于各个时段成本同样重要,在本文中令γ =1。火电机组发电成本函数可以表示为各种形式,包括线性函数、对数函数等。本文采用最常见二次函数[27]作为成本函数:

      式中:aibici为系数。

      为保证负荷的有效供应、DEDP存在可行解,假设负荷与发电机机组出力之间的关系满足:

      同时在t=0时满足:

      式(3)与式(4)保证了在考虑时间段的每时刻,至少存在一组满足约束条件的可行机组功率输出组合(p1,1 ,… ,p N,1 , …,p1 ,T ,…,pN ,T)T,同时在所有的有功功率输出组合中存在一个最优解。令Pi ,t为火电机组i的允许功率输出区间,则火电机组约束条件可以简化为

      这样直接通过单个上下限约束同时满足火电机组上下限约束与爬坡约束。

      1.2 动态经济调度的马尔可夫决策过程

      DEDP可以看作一个马尔可夫决策过程(Markov decision process,MDP)。DEDP的分布式多智能体MDP(multi-agent MDP,MAMDP)可以被定义为一个元组,也即:。其中,S是一个由所有智能体共享的全局状态空间,设置为t时刻新能源实时最大可用出力与电网所需总负荷,也即;Ai是智能体i的动作空间,设计为火电发电机组有功出力pi ,t;Ri为智能体i的动作奖励值,考虑为发电总成本;γ ∈(0,1]为折扣因子,与设计的发电总成本对应,γ =1。在多智能体决策中,整体动作空间为各个智能体动作空间叠加,故A = A1 × … ×AN,同时奖励R i: S × A × S →R为在状态空间S下执行智能体动作A得到的本地奖励。对于单个智能体而言,其获得全局状态空间的信息st ∈S,预测本地智能体i的动作策略ai ,t ∈Ai,执行动作策略获得本地奖励

      因此,DEDP可以由强化学习算法进行求解。图1显示了强化学习训练与实际决策的关系,设计离线高效训练模块作为强化学习训练的环境,不断训练智能体作出最优决策。在实际电力系统中,智能体面对波动的电力系统能够高效地进行决策,在满足耦合约束的情况下使发电成本最小化。

      图1 强化学习训练与实际决策关系
      Fig. 1 The relationship between reinforcement learning training and actual decision making

      2 分布式强化学习算法设计

      为充分应对高比例新能源的波动性,通过以下步骤设计一种分布式的强化学习算法。这种算法能够事先根据预测的负荷需求、新能源出力进行训练,在遇到与预测情况较有偏差的实际情况时迅速作出反应,在满足负荷需求下使得总发电成本最小。算法的框架如图2所示。

      首先,建立强化学习状态空间,为训练提供环境支持;随后,分别设计动作网络与评价网络,智能体给出初步决策;然后,通过约束投影方法、状态动作值函数最小化优化方法,选择二者最优策略得到本次训练的最优决策;最后,将最优策略元组存入经验集,定期更新网络参数。通过以上的训练思路,动作网络最终直接学习到总负荷、新能源实时最大可用出力与火电机组有功出力的动作决策之间的关系,从而在面对实际电力系统时迅速作出决策。

      2.1 强化学习状态空间构建

      DEDP状态空间。其中,新能源出力最大值可以由预测信息直接得到,而总的负荷需求需要利用分布式多智能体系统的平均一致性算法得到。假设智能体信息交换图、电网节点间信息交流图均为平衡图,从而保证各个智能体、电网节点之间的信息可以互相交换[30]

      图2 本文研究框架
      Fig. 2 Research framework of this paper

      定义,其 中i项表示电网拓扑中所有节点的平均功率需求估计值,B为电网节点数。共识算法可以表示为

      式中:LB是图G中电网节点间通信拓扑的拉普拉斯矩阵,。可以得到:

      式中:1B是一个B维列向量,矩阵元素为1。随后,每个电网节点可以通过与邻接电网节点交换局部估计值来获得总功率需求。

      定义来表示电网节点的通信拓扑度信息,。每个电网节点都可以通过式(7)的分布式算法获得相同的ϵ。式中:ai,j是通信拓扑邻接矩阵的元素。Vmax次迭代后,存在,其中,等于通信拓扑的最大度,N i表示邻接节点的集合。

      2.2 评价网络设计

      设计评价-动作双网络,动作网络负责生成火电机组有功功率决策,即在给定电网状态下应采取的出力策略;而评价网络则于更新状态动作值函数,评估采取某个动作后系统的预期成本。这种分离的架构允许系统在执行时迅速作出决策,并在训练阶段有效地评估决策的长期效果。定义作为在时隙t处在策略动作π下状态动作值函数,ωt是网络的参数。采用与目标网络的均方差作为损失函数来更新ωt参数。损失函数定义为

      式中:Pt为所有火电机组有功出力的集合,即。为最小化损失函数,采用式(9)更新ωt

      式中:α为学习率;ωt的导数。为提升强化学习稳定性,利用式(10)保证参数ωt缓慢更新:

      本文采用二次函数来逼近状态动作值函数[20],也即定义状态动作值函数:

      式中:是特征向量。相应地,设计评价函数近似参数,定义:

      式中:i =1,2,… ,N,则可以得到状态动作值函数满足:

      用分布式的方法获得状态动作值函数的最小值t,也即解决关于近似状态动作值函数的问题:

      式中:对每个机组智能体都有。假设对式(14) 存在一个有限的最优解。对于式 (14) 满足Slater的约束条件,即存在,使得供需平衡。对λ ∈R有:

      式中:。采用拉普拉斯矩阵L建立式(15)约束优化问题:

      带有乘子的增广拉格朗日对偶性为

      由[16]提出的全分布式投影优化方法,智能体i的分布式算法为

      从Karush-Kuhn-Tucker(KKT)条件出发,式(17)的平衡点是式(14)的最优解。将其中一个平衡点表示为与向量堆叠的列向量。该模型的收敛性已在文献[16]中证明。

      2.3 动作网络设计

      对于每个发电机机组的智能体,都有一个动作网络(actor network),记为,采用参数来近似最优策略。选择一个具有2个隐藏层的全连接多层感知器来近似最优发电策略,将发电机单元i的动作网络表示为

      式中:是权重矩阵;是偏差向量;h1h2是2个隐藏层中的神经元数量;φ1(·) 、φ2(·) 、φ3(·) 是非线性激活函数。强化学习状态与智能体动作分别是动作网络的输入和输出。权重矩阵和偏差向量是需要拟合的参数。定义J函数,梯度表示为

      为了最小化近似误差,沿着负梯度进行更新,即式(20):

      式中:β为学习率。类似地,动作网络按照式(21)缓慢更新:

      本文设计动作网络来近似出每个单元的最优策略,从而提高了策略的泛化能力。ωtθit都有下标t,表示来自不同时间的数据是分别训练的,不同时间的值函数可能不同。同样,由于不同时间段的最优策略不同,对不同时间段的动作网络也需要单独进行训练。

      2.4 平衡探索与经验的强化学习决策

      发电机机组智能体的决策是在原有经验的基础上进行出力决策,逐步最小化发电成本,并且在一定程度上保证算法的稳定性和效率,同时探索可能的最优解。为探索可能的最优功率输出,需要合理平衡经验和探索,以确保智能体能够在复杂环境中学习到最优策略。故而引入贪婪策略ε -greedy算法[28],1-ε的概率选择当前最优,ε的概率随机采样。对于当前的第k次训练,在探索次数kK0时,设计策略:

      式中:为第k次训练的值,ε0为参数。探索次数kK0后,智能体决策功率决定于:

      式中:表示在st下选择动作a的概率。初始情况下,智能体优先采用基于评价网络的贪婪策略,在kK0之后,动作网络直接给出确定性决策,同时采用贪婪策略为算法提供一个更好的探索决策。

      2.5 约束条件下强化学习决策调整

      各智能体决策输出功率为,整个系统的功率输出分布可表示为可能不满足耦合约束条件。在与电网真实环境交互之前,通过式(24) 对智能体决策功率进行调整:

      式中:是投影后的联合动作。等效替换目标函数为

      则该问题可以转变为式(26)所示优化问题[35]

      式中:λizi是辅助变量;PPi ,t (·) 是投影算子。最终收敛解即为满足物理约束的功率指令。

      2.6 获取总发电成本

      经济调度的奖励函数设置为考虑时段内各发电机机组的发电总成本。各发电机智能体在完成发电出力决策后,首先计算并上报其对应的本地发电成本。为实现系统层面的总发电成本最小化,智能体之间通过通信机制共享必要的信息,从而获得电网的整体发电成本。进一步地,本文将系统总发电成本作为所有智能体的统一奖励函数,使各智能体在策略学习过程中以全局最优为目标,避免仅基于自身局部成本进行决策,从而提升多智能体协同调度的整体性能。

      定义为时间t的平均发电成本的局部估计,其中每个智能体i。应用平均一致性算法,各时间成本满足式(27):

      式中:LN为智能体节点间通信拓扑的拉普拉斯矩阵。可以得到对平均值的局部估计发电成本收敛于时隙t处的实际平均发电成本。因此,总发电成本为Nct

      2.7 更新本地操作策略

      为了帮助动作网络进行更好的决策,得到最经济的发电策略,定义为历史最优策略。定义:

      随后可以依据式(29)更新本地操作策略:

      式中:是在训练过程中由问题式 (14) 与式 (24)得到的中最优调度记录。只有决策出力组合更加经济时,最优调度策略才会被更新。这种策略保证了最优调度策略总发电成本单调递减,最终达到最优。

      3 算法求解

      为平衡探索新策略与充分利用原有经验,使用贪婪策略更新原有功率,但这个决策动作可能不满足所需负荷约束、功率上下限约束、功率爬坡约束,故而采用约束投影算法对功率进行调整。

      整个探索过程可以用如图3表示。由图3可以清晰看出整个训练过程:若kK00,评价网络拟合的二次函数系数输出到状态动作值函数优化器得到另外一组功率输出分布,使得状态动作值函数值最小,本文K00取1;训练kk 1时算法向经验集存放数据;kk 2时,每隔k3次训练在存有个经验的经验集中抽取个数据用于神经网络更新。

      图3 智能体探索过程
      Fig. 3 Agent exploration process

      4 算例分析

      本章主要探讨本文所提算法在经济调度中的决策效果。强化学习主要参数如表1所示。

      表 1 强化学习主要参数
      Table 1 Main parameters of reinforcement learning

      α β' γ τ m M k1 k2 k3 1e-15 0.95 0.01 100 2000 1 110 10

      算例考虑带有10个机组的IEEE 39节点系统,其中5个机组为新能源机组(2个光伏发电机组PV,3个风能发电机组WP),总成本计算结果以标准货币单位(monetary unit,m.u.)表示。图4展示各机组所在位置与通信关系。

      图4 IEEE 39节点系统
      Fig. 4 IEEE 39-bus system

      共计设置5个时隙,总功率需求分别设置为1700、1750、1800、1750、1725(MW)。时隙总数设置为T =5。探索率设置为ε =0.2。各火电机组参数如表2所示[42]、新能源出力波动如图5所示。

      表 2 IEEE 39节点火电机组主要参数
      Table 2 IEEE 39-bus thermal power unit main parameters

      机组pi pi piR 成本函数系数ai bi ci G1 0 339.69 50 0.007 2 5.56 30 G2 0 479.1 50 0.016 8 4.32 25 G3 0 290.4 90 0.021 6 6.6 25 G4 0 306.34 100 0.014 1 7.9 16 G5 0 593.8 200 0.027 3 7.54 6

      图5 新能源出力预测曲线
      Fig. 5 New energy output forecast curves

      4.1 决策情况与新能源消纳分析

      训练2000次结果如图6所示。最终得到策略所需总成本30 523.17,优于混合整数线性规划(mixedinteger linear programming,MILP)算法所得策略成本31 972.94。

      由图6可以看出,随着探索步数增加,本文算法策略成本逐步减小后逐渐稳定,相较于算法1下降更快且结果更优,说明内嵌投影优化算法的优势所在。最终得到的火电机组出力决策如表3所示。最终决策结果符合调度要求。

      表 3 火电机组决策
      Table 3 Thermal power unit decision

      i µ( D)1 µ(D2) µ(D3) µ(D4) µ(D5)1 305.11 339.69 339.69 289.69 293.49 2 226.59 176.59 226.59 221.03 271.03 3 148.10 148.20 112.02 202.02 119.18 4 13.20 12.70 87.10 12.30 12.70 5 0.00 51.92 4.80 8.75 0.10

      图6 智能体决策的总成本的演变过程
      Fig. 6 The evolution process of the total cost of agent decision making

      注:采用算法1进行对比。算法1由MADDPG算法、内嵌偏差调整的优化[42]、40个神经元、2个隐藏层的动作-评价神经网络等其他优化方式得到。且在算法执行过程中不难发现偏差调整的优化方式很难达到偏差σ =0,所作决策可能无法满足负荷需求,证明约束投影算法运用的有效性。

      随着训练次数的增加,每个时刻各火电发电机出力决策演变如图7。

      图7 每时刻机组策略随训练演变过程
      Fig. 7 The crew strategy evolves with training at each time

      在这个算例设置下,成本函数为凸函数,可以通过原对偶算法(primal dual,PD)求解原问题的精确最优解[32]。将精确解表示为,近似解表示为Ct,定义ER:作为评价指标。表4显示了对偶单纯形法(dual simplex method,DS)[32]、MILP、本文算法与精确解的比较。

      从表4可以看出,经过2000次训练后,本文算法的结果30 523.17,误差3.04%,完全消纳新能源的波动。这一误差主要来源于以下两方面:一是探索机制的固有随机性,为了避免陷入局部最优,算法保留了一定的探索概率,导致策略在最优解附近微小震荡;二是序贯决策的累积偏差,传统优化方法(如PD/DS)基于全局完美预测信息进行一次性求解,而强化学习基于当前状态进行时序决策,预测误差和控制偏差会在时间步上产生一定的累积效应。

      表 4 算法结果比较
      Table 4 Comparison of algorithm results

      算法 总成本 误差/% 训练次数PD 29 621.65 0.00 DS 29 621.65 0.00 MILP 31 972.94 7.93本文算法 30 523.17 3.04 2000

      4.2 不同探索率对算法效果的影响

      在算例中,为检验不同探索率ε贪婪策略对5个发电机机组的影响,采取固定ε=0.2、 ε =0.4、ε=0.6、 ε =0.8分别进行训练,使得ε-greedy贪婪策略中的操作策略具有无限探索的贪婪极限。图8显示了每个更新策略的2000次训练的总发电成本的演变。

      图8 不同探索率下策略成本随训练演变情况
      Fig. 8 The evolution of strategy cost with training under different exploration rates

      由图8可知,ε= 0.6时,误差最大;ε = 0.2时,误差最小。在不同探索率下,智能体出力决策结果均满足负荷需求、机组出力上下限与爬坡约束,符合调度要求。从本节给出的结果可以看出,探索率对分布式强化学习优化算法非常重要,因为在每个时间段中,可行功率输出组合的数量都是无限的。只有通过不断的尝试与探索,才能够得到这些可行功率输出组合中的最优解。但探索率不宜过大,这会导致一直探索新的结果而不依据历史经验作出决策,导致强化学习的学习结果无效。每次训练过程中探索到的最优解会存放在经验回放池中,便于后续利用经验,这些都对动态经济调度有着重要作用。

      4.3 鲁棒性分析

      最大训练次数设置为K =2000。在训练k =1800时,在时刻t=5的总功率需求突然变为1825 MW,在原有负荷上增加100 MW。图9表示功率需求波动的情况下,时刻t=5的火电机组功率输出情况,可以看到出力在训练第1801次时发生突变,相应的总成本突变为40 771.80,随后又随着训练成本逐步下降。

      图9 机组功率输出突变情况
      Fig. 9 Abrupt change of power output of the unit

      新能源满发加上火电机组功率输出,t=5时刻的总功率输出突变为1825 MW,保持了负荷需求与机组发电的平衡,同时满足机组出力上下限、爬坡约束。实验结果表明,该算法在波动功率需求条件下具有较强的鲁棒性。

      4.4 泛化能力检验

      强化学习解决动态经济调度的关键优势在于,强化学习能够在数次训练后,对于突然出现的新的环境能够迅速给出较好的机组出力方案,提升解决调度问题的速度。本节算例将证明这个优势。为减少计算时间,设置T =1。总电力需求Dt在此时间间隔内波动[1900,1920]MW。训练集设置为

      在实际(测试)中,测试集设置为

      设置探索率为ε=0.2,学习率α为1e-11。实际测试中,将不经过训练的预测联合动作设定为初始策略,经过K =1000设置为训练所得策略。将每个时间段的功率总需求(time power demand)表示为TPD,直接预测的发电总成本(projected total cost)表示为PTC,实际训练后发电总成本(after training cost)表示为ATC,预测误差以ATC作为精确解,相对误差表示为ER。

      部分预测策略的测试集的结果如表5所示。测试集出力决策满足负荷需求、机组出力上下限与爬坡约束,符合调度要求。

      表 5 动态经济调度算例分析
      Table 5 Analysis of dynamic economic scheduling examples

      TPD/MW PTC ATC ER/%893.5 8 685.08 8 583.10 1.19 896.5 8 723.80 8 599.93 1.44 899.5 8 762.59 8 597.79 1.92 902.5 8 801.44 8 676.42 1.44 905.5 8 840.36 8 701.90 1.59 908.5 8 879.34 8 774.16 1.20 911.5 8 918.39 8 753.43 1.88 913.5 8 944.46 8 843.70 1.14

      由表5可以看出PTC和ATC非常接近,ER均小于2%。这证明了该算法应对新状况时决策出力的有效性。

      5 结论

      本文针对高比例新能源电力系统的动态经济调度问题,提出了分布式多智能体强化学习算法,实现了新能源波动性与随机性的消纳,并得出结论如下。

      1)本文所提出的分布式多智能体强化学习算法可以有效求得满足发电耦合约束的火电机组有功功率输出策略,极大地有效消纳新能源。

      2)不同探索率下算法的收敛速度不同,探索率过大反而容易探索不到最优有功输出。算法的鲁棒性较强,能够适应突然的变动。

      3)设计动作网络,直接学习总功率需求、新能源实时最大可用出力与火电机组最优功率输出之间的关系。面对波动的新能源供给,动作网络可以高效地作出火电机组有功输出决策,算例验证了该算法的泛化能力。

      尽管强化学习算法在动态环境中表现出显著优势,能够有效应对新能源出力波动和负荷不确定性带来的挑战,但其在新能源场景中的应用仍面临训练效率低、收敛性差等局限性。同时,本文尚未考虑新能源波动带来的暂态稳定性问题,未来研究将通过引入优先经验回放机制、优化算法引导策略以及设计内嵌电压频率稳定等物理约束,进一步提升算法性能与实用性。

      参考文献

      1. [1]

        刘泽洪,郑炜,李佳朋,等. 构网型技术发展现状与前景[J]. 全球能源互联网,2025,8(4):399-415.LIU Zehong, ZHENG Wei, LI Jiapeng, et al. Status and outlook for the development of grid-forming technologies[J].Journal of Global Energy Interconnection, 2025, 8(4): 399-415(in Chinese). [百度学术]

      2. [2]

        陶劲宇,秦川,金宇清,等. 面向新型电力系统的负荷模型研究综述[J]. 电力系统保护与控制,2025,53(5):168-187.TAO Jinyu, QIN Chuan, JIN Yuqing, et al. A review of load models for new power systems[J]. Power System Protection and Control, 2025, 53(5): 168-187(in Chinese). [百度学术]

      3. [3]

        付小标,姜旭,李欣蒙,等. 基于卷积自注意力聚类算法的高比例新能源电力系统典型运行方式提取[J]. 南方电网技术,2025,19(9):140-149.FU Xiaobiao, JIANG Xu, LI Xinmeng, et al. Typical operation mode extraction of high proportion new energy power system based on convolutional self-attention clustering algorithm[J].Southern Power System Technology, 2025, 19(9): 140-149(in Chinese). [百度学术]

      4. [4]

        周海锋,徐伟,沙立成,等. 考虑新能源不确定性的调度计划安全稳定校核方法[J]. 电力工程技术,2024(3):63-70.ZHOU Haifeng, XU Wei, SHA Licheng, et al. Security and stability checking method of dispatching plan considering uncertainty of new energy[J]. Electric Power Engineering Technology, 2024(3): 63-70(in Chinese). [百度学术]

      5. [5]

        郭俊劭,王明强,韩学山,等. 考虑自适应前瞻时间尺度的动态经济调度[J]. 电力系统自动化,2025,49(9):107-113.GUO Junshao, WANG Mingqiang, HAN Xueshan, et al.Dynamic economic dispatch considering adaptive look-ahead time scale[J]. Automation of Electric Power Systems, 2025,49(9): 107-113(in Chinese). [百度学术]

      6. [6]

        吕东,冒烨颖,丁敏. 考虑热-电-气-氢-碳耦合与源荷响应的综合能源系统优化调度[J]. 电力需求侧管理,2025,27(3):65-70.LÜ Dong, MAO Yeying, DING Min. Optimal scheduling of integrated energy system considering heat-electricity-gashydrogen-carbon coupling and the source-load response[J].Power Demand Side Management, 2025, 27(3): 65-70(in Chinese). [百度学术]

      7. [7]

        欧阳昌乐,张春,吴文泰,等. 基于改进动态事件触发机制的微电网经济调度一致性算法[J]. 发电技术,2025,46(6):1240-1250.OUYANG Changle, ZHANG Chun, WU Wentai, et al.Consensus algorithm for economic scheduling of microgrids based on improved dynamic event-triggered mechanism[J]. Power Generation Technology, 2025, 46(6): 1240-1250(in Chinese). [百度学术]

      8. [8]

        冯斌,胡轶婕,黄刚,等. 基于深度强化学习的新型电力系统调度优化方法综述[J]. 电力系统自动化,2023,47(17):187-199.FENG Bin, HU Yijie, HUANG Gang, et al. Review on optimization methods for new power system dispatch based on deep reinforcement learning[J]. Automation of Electric Power Systems, 2023, 47(17): 187-199(in Chinese). [百度学术]

      9. [9]

        林顺富,张琪,沈运帷,等. 面向灵活爬坡服务的高比例新能源电力系统可调节资源优化调度模型[J]. 电力系统保护与控制,2024,52(2):90-100.LIN Shunfu, ZHANG Qi, SHEN Yunwei, et al. Optimal dispatch model of adjustable resources in a power system with high proportion of renewable energy for flexible ramping product[J]. Power System Protection and Control, 2024, 52(2):90-100(in Chinese). [百度学术]

      10. [10]

        鞠立伟,吕硕硕,李鹏. 新型电力系统需求侧灵活性资源时空协同优化与动态均衡机制研究综述[J]. 电力建设,2024,45(9):142-163.JU Liwei, LÜ Shuoshuo, LI Peng. Review of novel demandside flexibility resource spatio-temporal co-optimization and dynamic equilibrium mechanism of power systems[J]. Electric Power Construction, 2024, 45(9): 142-163(in Chinese). [百度学术]

      11. [11]

        马骞,苏京轩,邹金,等. 考虑灵活性的高比例新能源电力系统机组检修策略[J]. 南方电网技术,2025,19(1):118-128.MA Qian, SU Jingxuan, ZOU Jin, et al. Considering flexibility of units maintenance strategy for high proportion renewable energy power system[J]. Southern Power System Technology,2025, 19(1): 118-128(in Chinese). [百度学术]

      12. [12]

        李敬如,白宇,王旭阳,等. 考虑主配协同的分布式光伏接入电网安全经济承载力计算方法[J]. 电力建设,2025,46(10): 113-121.LI Jingru, BAI Yu, WANG Xuyang, et al. A calculation method for PVs' safe and economic carrying capacity that consider transmission and distributed network coordination[J].Electric Power Construction, 2025, 46(10): 113-121(in Chinese). [百度学术]

      13. [13]

        孔月萍,陈宇沁,王国际,等. 计及不确定性新能源消纳的海量分布式灵活资源虚拟电厂调控策略[J]. 电力需求侧管理,2025,27(6):45-50.KONG Yueping, CHEN Yuqin, WANG Guoji, et al. Massive distributed flexible resource virtual power plant control strategy considering uncertain new energy consumption[J].Power Demand Side Management, 2025, 27(6): 45-50(in Chinese). [百度学术]

      14. [14]

        裴佑楠. 考虑灵活性的电力系统动态经济调度理论研究[D].济南:山东大学,2023.PEI Younan. Theoretical study on dynamic economic dispatch of power system considering flexibility[D]. Jinan: Shandong University, 2023(in Chinese). [百度学术]

      15. [15]

        YANG T, LU J, WU D, et al. A distributed algorithm for economic dispatch over time-varying directed networks with delays[J]. IEEE Transactions on Industrial Electronics, 2017,64(6): 5095-5106. [百度学术]

      16. [16]

        YI P, HONG Y G, LIU F. Initialization-free distributed algorithms for optimal resource allocation with feasibility constraints and application to economic dispatch of power systems[J]. Automatica, 2016, 74: 259-269. [百度学术]

      17. [17]

        孙元章,吴俊,李国杰,等. 基于风速预测和随机规划的含风电场电力系统动态经济调度[J]. 中国电机工程学报,2009,29(4):41-47.SUN Yuanzhang, WU Jun, LI Guojie, et al. Dynamic economic dispatch considering wind power penetration based on wind speed forecasting and stochastic programming[J]. Proceedings of the CSEE, 2009, 29(4): 41-47(in Chinese). [百度学术]

      18. [18]

        SUTTON R S, BARTO A G. Reinforcement Learning[M]. 2nd ed. Cambridge, MA: MIT Press, 2018. [百度学术]

      19. [19]

        刘一欣,郭力,王成山. 微电网两阶段鲁棒优化经济调度方法[J]. 中国电机工程学报,2018,38(14):4013-4022.LIU Yixin, GUO Li, WANG Chengshan. Economic dispatch of microgrid based on two stage robust optimization[J].Proceedings of the CSEE, 2018, 38(14): 4013-4022(in Chinese). [百度学术]

      20. [20]

        周玮,胡姝博,孙辉,等. 考虑大规模风电并网的电力系统区间非线性经济调度研究[J]. 中国电机工程学报,2017,37(2):557-564.ZHOU Wei, HU Shubo, SUN Hui, et al. Interval nonlinear economic dispatch in large scale wind power integrated system[J]. Proceedings of the CSEE, 2017, 37(2): 557-564(in Chinese). [百度学术]

      21. [21]

        张野,李凤婷,张高航,等. 考虑风电爬坡备用需求的风电高渗透电力系统优化调度方法[J]. 电力系统保护与控制,2024,52(23):95-106.ZHANG Ye, LI Fengting, ZHANG Gaohang, et al.Optimization and scheduling methods for wind power highpenetration power systems considering wind power ramping reserve requirements[J]. Power System Protection and Control,2024, 52(23): 95-106(in Chinese). [百度学术]

      22. [22]

        杜刚,赵冬梅,刘鑫. 含高比例风电系统随机备用调度研究[J]. 电网技术,2023,47(4):1378-1385.DU Gang, ZHAO Dongmei, LIU Xin. Stochastic reserve scheduling of high proportion wind power system[J]. Power System Technology, 2023, 47(4): 1378-1385(in Chinese). [百度学术]

      23. [23]

        彭刘阳,孙元章,徐箭,等. 基于深度强化学习的自适应不确定性经济调度[J]. 电力系统自动化,2020,44(9):33-42.PENG Liuyang, SUN Yuanzhang, XU Jian, et al. Self-adaptive uncertainty economic dispatch based on deep reinforcement learning[J]. Automation of Electric Power Systems, 2020,44(9): 33-42(in Chinese). [百度学术]

      24. [24]

        LI M, QIN J H, FRERIS N M, et al. Multiplayer Stackelberg-Nash game for nonlinear system via value iteration-based integral reinforcement learning[J]. IEEE Transactions on Neural Networks and Learning Systems, 2022, 33(4): 1429-1440. [百度学术]

      25. [25]

        YANG T, ZHAO L Y, LI W, et al. Dynamic energy dispatch strategy for integrated energy system based on improved deep reinforcement learning[J]. Energy, 2021, 235: 121377. [百度学术]

      26. [26]

        陈思畏,李建军,邹信迅,等. 基于孪生延迟DDPG强化学习的电-热耦合系统低碳经济调度[J]. 现代电力,2025,42(2):314-321.CHEN Siwei, LI Jianjun, ZOU Xinxun, et al. Low-carbon economic dispatch of electric-thermal coupling system based on twin delayed DDPG reinforcement learning[J]. Modern Electric Power, 2025, 42(2): 314-321(in Chinese). [百度学术]

      27. [27]

        MENG F Y, BAI Y, JIN J L. An advanced real-time dispatching strategy for a distributed energy system based on the reinforcement learning algorithm[J]. Renewable Energy,2021, 178: 13-24. [百度学术]

      28. [28]

        WANG F, GAO J, LI M S, et al. Autonomous PEV charging scheduling using dyna-Q reinforcement learning[J]. IEEE Transactions on Vehicular Technology, 2020, 69(11): 12609-12620. [百度学术]

      29. [29]

        李涛,胡维昊,李坚,等. 基于深度强化学习算法的光伏-抽蓄互补系统智能调度[J]. 电工技术学报,2020,35(13):2757-2768.LI Tao, HU Weihao, LI Jian, et al. Intelligent economic dispatch for PV-PHS integrated system: a deep reinforcement learning-based approach[J]. Transactions of China Electrotechnical Society, 2020, 35(13): 2757-2768(in Chinese). [百度学术]

      30. [30]

        YI Z K, WANG X, YANG C, et al. Real-time sequential security-constrained optimal power flow: a hybrid knowledgedata-driven reinforcement learning approach[J]. IEEE Transactions on Power Systems, 2024, 39(1): 1664-1680. [百度学术]

      31. [31]

        WANG D, CHEN M F, WANG W. Distributed extremum seeking for optimal resource allocation and its application to economic dispatch in smart grids[J]. IEEE Transactions on Neural Networks and Learning Systems, 2019, 30(10): 3161-3171. [百度学术]

      32. [32]

        CHERUKURI A, CORTÉS J. Distributed generator coordination for initialization and anytime optimization in economic dispatch[J]. IEEE Transactions on Control of Network Systems, 2015, 2(3): 226-237. [百度学术]

      33. [33]

        林振福,杨铎烔. 基于确定性策略梯度深度强化学习和模仿学习的多源微电网经济优化调度策略[J]. 电工技术,2023(8):76-82.LIN Zhenfu, YANG Duotong. Economic optimal dispatch strategy for multi-source microgrid based on deep deterministic policy gradient and imitation learning[J]. Electric Engineering,2023(8): 76-82(in Chinese). [百度学术]

      34. [34]

        孙长银,穆朝絮. 多智能体深度强化学习的若干关键科学问题[J]. 自动化学报,2020,46(7):1301-1312.SUN Changyin, MU Chaoxu. Important scientific problems of multi-agent deep reinforcement learning[J]. Acta Automatica Sinica, 2020, 46(7): 1301-1312(in Chinese). [百度学术]

      35. [35]

        WEN G H, YU X H, LIU Z W, et al. Adaptive consensusbased robust strategy for economic dispatch of smart grids subject to communication uncertainties[J]. IEEE Transactions on Industrial Informatics, 2018, 14(6): 2484-2496. [百度学术]

      36. [36]

        HUG G, KAR S, WU C Y. Consensus + innovations approach for distributed multiagent coordination in a microgrid[J]. IEEE Transactions on Smart Grid, 2015, 6(4): 1893-1903. [百度学术]

      37. [37]

        MENG F, CHEN P, WU L N, et al. Power allocation in multi-user cellular networks: deep reinforcement learning approaches[J]. IEEE Transactions on Wireless Communications, 2020, 19(10): 6255-6267. [百度学术]

      38. [38]

        YI P, HONG Y G, LIU F. Distributed gradient algorithm for constrained optimization with application to load sharing in power systems[J]. Systems & Control Letters, 2015, 83: 45-52. [百度学术]

      39. [39]

        LI F Y, QIN J H, ZHENG W X. Distributed Q-learningbased online optimization algorithm for unit commitment and dispatch in smart grid[J]. IEEE Transactions on Cybernetics,2020, 50(9): 4146-4156. [百度学术]

      40. [40]

        ZHAO W M, LIU M B, ZHU J Q, et al. Fully decentralised multi-area dynamic economic dispatch for large-scale power systems via cutting plane consensus[J]. IET Generation,Transmission & Distribution, 2016, 10(10): 2486-2495. [百度学术]

      41. [41]

        GODSIL C, ROYLE G. Algebraic graph theory[M]. New York, NY: Springer New York, 2001. [百度学术]

      42. [42]

        DAI P C, YU W W, WEN G H, et al. Distributed reinforcement learning algorithm for dynamic economic dispatch with unknown generation cost functions[J]. IEEE Transactions on Industrial Informatics, 2020, 16(4): 2258-2267. [百度学术]

      43. [43]

        HU C F, WEN G H, WANG S, et al. Distributed multiagent reinforcement learning with action networks for dynamic economic dispatch[J]. IEEE Transactions on Neural Networks and Learning Systems, 2024, 35(7): 9553-9564. [百度学术]

      44. [44]

        LOWE R, WU Y, TAMAR A, et al. Multi-agent actor-critic for mixed cooperative-competitive environments[EB/OL]. 2017:arXiv: 1706.02275. https://arxiv.org/abs/1706.02275. [百度学术]

      基金项目

      国家电网有限公司科技项目(521702230005/SGHADK00PJJS2400401)。

      Science and Technology Foundation of SGCC (521702230005/SGHADK00PJJS2400401).

      作者简介

      • 周宁

        周宁 (1971),男,教授级高工,研究方向为配电网运行与管理、新能源与储能技术,E-mail:zhouningznzz@sina.com。

      • 刘清秋

        刘清秋(2002),女,硕士研究生,研究方向为电力系统可靠性分析、电网调度与运行优化,E-mail:qingqiuliu@stu.xjtu.edu.cn。

      • 李更丰

        李更丰 (1984),男,博士,教授,研究方向为电力系统可靠性、综合能源系统与主动配电网技术、弹性电力系统。通信作者,E-mail:gengfengli@xjtu.edu.cn。

      出版信息

      文章编号:2096-5125 (2026) 01-0060-12

      中图分类号:TM734;TP181

      文献标志码:A

      DOI:10.19705/j.cnki.issn2096-5125.20240492

      收稿日期:2024-12-16

      修回日期:

      出版日期:2026-01-25

      引用信息: 周宁,徐铭铭,刘清秋等.面向强不确定性供需波动的新能源电网调度强化学习算法[J].全球能源互联网,2026,9(1):60-71 .ZHOU Ning, XU Mingming, LIU Qingqiu,et al.A Reinforcement Learning Algorithm for New Energy Grid Dispatch with Strong Uncertainty in Supply and Demand Fluctuations[J].Journal of Global Energy Interconnection,2026,9(1):60-71 (in Chinese).

      (责任编辑 李锡)
      分享给微信好友或者朋友圈

      使用微信“扫一扫”功能
      将此文章分享给您的微信好友或者朋友圈