GECCO 2025,基于自动景观特征的强化学习自适应差分进化算法
📅 2026/7/22 18:43:33
👁️ 次浏览
目录1.摘要2.研究背景与 MetaBBO3.RLDE-AFL 双层框架4.自动景观特征学习5.强化学习驱动的 DE 动态配置6.实验结果7.参考文献8.算法辅导·应用定制·读者交流1.摘要元黑箱优化Meta-Black-Box OptimizationMetaBBO通过学习可迁移的元策略为底层优化器动态选择算法配置能够减少为新问题手工设计自适应机制的工作。然而现有方法通常依赖人工构造的状态特征既需要领域知识也可能消耗额外函数评估。论文提出 RLDE-AFL将可学习的景观特征提取器嵌入强化学习驱动的差分进化DE中联合学习特征编码与动态算法配置策略该方法用带尾数—指数目标值嵌入的注意力网络将种群及其适应度转化为可表达、可泛化的景观状态同时把多种变异、交叉算子及其参数纳入统一动作空间。2.研究背景与 MetaBBO黑箱优化无法直接使用目标函数解析式或梯度而NFL定理意味着不存在对所有问题都占优的固定算法。传统自适应 DE 依靠人工规则选择算子并调整缩放因子、交叉率设计成本较高。MetaBBO 以神经策略替代部分人工设计上层策略根据第t tt代状态s t s_tst输出底层算法配置ω t \omega_tωt底层优化后的目标值变化再作为学习信号。J ( θ ) arg max θ ∈ Θ E f ∈ I [ ∑ t 1 T P e r f ( A , ω t , f ) ] , ω t π θ ( s t ) . J(\theta)\arg\max_{\theta\in\Theta}\mathbb{E}_{f\in\mathcal{I}}\left[\sum_{t1}^{T}\mathrm{Perf}(A,\omega_t,f)\right],\qquad \omega_t\pi_\theta(s_t).J(θ)argθ∈ΘmaxEf∈I[t1∑TPerf(A,ωt,f)],ωtπθ(st).已有 RL-DE 方法多使用人工统计特征且往往只选择算子或只控制参数候选算子池也较小。RLDE-AFL 的目标是同时降低状态设计依赖、扩大策略行为多样性并让同一策略适应不同维度、预算和问题分布。3.RLDE-AFL 双层框架RLDE-AFL 由上层元智能体和下层 DE 优化器组成。第t tt代状态包含种群X t X_tXt、目标值Y t Y_tYt与时间戳t tt修改后 NeurELA 把它们编码为个体级景观表示Actor 为每个个体选择变异算子、交叉算子及相应参数。下层 DE 按配置产生下一代并将改进量作为奖励返回上层从而形成状态—配置—优化—奖励的闭环。该过程被建模为马尔可夫决策过程策略学习目标为π ∗ arg max π ∈ Π ∑ t 1 T γ t − 1 R ( s t , a t ) , \pi^*\arg\max_{\pi\in\Pi}\sum_{t1}^{T}\gamma^{t-1}R(s_t,a_t),π∗argπ∈Πmaxt1∑Tγt−1R(st,at),其中γ \gammaγ为折扣因子T TT为优化时域。论文采用近端策略优化PPO训练策略使配置决策直接面向跨问题的累计优化收益。4.自动景观特征学习为统一不同搜索空间解向量按各维上下界缩放。不同问题的目标值可能跨越多个数量级简单的种群内最小—最大归一化会抹去问题间以及优化阶段间的绝对尺度差异。RLDE-AFL 将每个目标值写成科学计数法y t , i ϖ t , i 10 e t , i y_{t,i}\varpi_{t,i}10^{e_{t,i}}yt,iϖt,i10et,i再以( ϖ t , i , ϵ t , i ) (\varpi_{t,i},\epsilon_{t,i})(ϖt,i,ϵt,i)表示其中ϵ t , i e t , i / η \epsilon_{t,i}e_{t,i}/\etaϵt,iet,i/ηη \etaη是尺度因子时间特征则归一化为s t i m e t / T s_{\mathrm{time}}t/Tstimet/T。NeurELA 的输入因此由位置、尾数和指数构成而非单一归一化适应度。观测先经3 × 64 3\times643×64的线性嵌入再依次通过跨个体注意力和跨维度注意力。第二阶段加入正弦—余弦位置编码以保留维度顺序随后沿维度平均池化得到每个个体的 64 维表示归一化时间戳经 MLP 映射为 16 维表示与景观特征拼接成 80 维决策向量。5.强化学习驱动的 DE 动态配置动作空间覆盖 14 种变异算子和 3 种交叉算子。变异池包括经典的 rand/1、best/1、rand/2、best/2、current-to-rand/1、current-to-best/1、rand-to-best/1以及引入 pbest、外部档案、距离采样、时间档案和拓扑邻域的高级变体交叉池包含二项式、指数式和 p-binomial 交叉。Actor 对每个个体分别输出变异与交叉算子的分类概率并输出相应参数的正态分布。为兼容参数数量不同的算子网络统一产生最多 3 个变异参数和 2 个交叉参数算子只读取所需的前若干项。Critic 先估计每个个体状态价值再对种群求平均。即时奖励以当前最优值的归一化改进定义r t y t − 1 ∗ − y t ∗ y 0 ∗ − y ∗ , r_t\frac{y^*_{t-1}-y^*_t}{y^*_0-y^*},rty0∗−y∗yt−1∗−yt∗,其中y t ∗ y^*_tyt∗为第t tt代已找到的最优目标值y 0 ∗ y^*_0y0∗为初始种群最优值y ∗ y^*y∗为问题全局最优值。6.实验结果实验基于 MetaBox使用合成 COCO-BBOB、含噪合成问题和 Protein-Docking 基准。传统基线包括 DE、MadDE、JDE21、NL-SHADE-LBC 和 AMCDE学习型基线包括 DE-DDQN、DE-DQN、LDE、GLEET、RL-HPSDE 与 RL-DAS。论文直接把在 10 维合成问题上训练的模型迁移到 20 维问题不作微调。RLDE-AFL 在 16 个测试问题上继续保持整体优势说明跨维度注意力能够处理维度变化依赖固定维度状态的 RL-DAS 则无法迁移。7.参考文献Guo H, Ma S, Huang Z, et al. Reinforcement learning-based self-adaptive differential evolution through automated landscape feature learning[C]//Proceedings of the Genetic and Evolutionary Computation Conference. 2025: 1117-1126.8.算法辅导·应用定制·读者交流xx
PreMiD Activities开发指南:3步创建你的第一个Discord状态增强插件 【免费下载链接】Presences 🛒 Storage for Activities located at our Activity Library. 项目地址: https://gitcode.com/gh_mirrors/pr/Presences
PreMiD Activities是一款强…
📅 2026/7/22 18:43:33
1. 项目概述:从硬件引脚到软件配置的桥梁 在嵌入式系统开发中,尤其是基于德州仪器(TI)AM335x这类高度集成的应用处理器时,我们经常会遇到一个核心矛盾:芯片内部集成了丰富的外设,如以太网MAC&am…
📅 2026/7/22 18:43:33
7月21日,《人工智能 智能体互联》系列国家标准应用推广专题会在北京中关村展示中心召开,会上正式举行智能体身份码节点首批发放仪式。360集团获颁首批智能体身份码节点,成为我国智能体互联国家标准落地进程的核心参与方。本次专题会由全国信息…
📅 2026/7/22 18:43:33
CM2221是士模推出的一款全正向自研16位单通道1MSPS SAR ADC, CM2221(完全兼容AD7980, VDD2.5V)适用于工业自动化设备、精密仪表、医疗仪器模拟量采集等场景。【CM2221产品亮点】1、完美替代 AD7980: 引脚定义、SPI 时序…
📅 2026/7/22 20:25:06
博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…
📅 2026/7/22 20:25:06
CM2220是士模推出的全正向自研16位单通道1MSPS SAR ADC,CM2220管脚兼容AD7982, VDD1.8V,适用于仪器仪表、自动化测试设备、高精度数据采集卡、医疗仪器和工业自动化设备等场景。【产品亮点】1、管脚兼容 AD7980,VDD1.8V2、性能对标、谐波指标更优&#x…
📅 2026/7/22 20:25:06
由于博主自己的电脑总是喜欢弹出“更新并关机”这个强制选项,而且每次更新都不成功,占用大量时间,如下图: 于是在github上找到了一款开源的自动更新软件:
Hudrig0/Windows-Update-Blocker: A simple and effective to…
📅 2026/7/22 20:25:06
1.嘉立创新建个图纸放置需要的元件,然后更新到PCB图。2.嘉立创导出3D模型3.使用SolidWorks打开文件,隐藏掉元件底部的PCB板。4.文件另存为STEP AP214格式,高版本格式无法导入AD。5.AD16打开元件封装库编辑页面,放置 3D元件体&…
📅 2026/7/22 20:25:06
上周二,老张在自家后院挖个游泳池,结果一铲子下去,火花四溅。不是比喻,是真的短路了。那一刻,他脑子里除了“完了”,就是“谁赔”。很多人觉得,挖土挖断管线是运气不好,是倒霉蛋专属。但在我看来,这根本不是运气问题,而是认知盲区。你以为是挖坑,其实是拆炸弹。而 G…
📅 2026/7/22 20:23:47
1. 项目概述与SYSCFG模块的核心价值在嵌入式系统,尤其是像TI C6000系列这样的高性能DSP开发中,我们常常会与芯片手册里那些密密麻麻的寄存器打交道。很多开发者可能更关注算法实现、内存优化或者外设驱动,但对于一个稳定、高效的系统而言&…
📅 2026/7/22 0:00:13
1. 为什么我们需要"最次"的通知方案? 在数字化协作环境中,消息通知系统的重要性不言而喻明。但现实情况是,企业级通知方案往往需要复杂的API对接(如企业微信、钉钉、飞书),个人开发者的小项目又经…
📅 2026/7/22 0:00:13
甲方说"简洁一点",乙方听到的是"少做几页"。甲方说"不要太复杂",乙方理解成"别放图表了"。结果交过去,甲方说"我说的简洁不是这个意思"。"简洁"这个词在PPT语境里,是…
📅 2026/7/22 0:00:13
1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…
📅 2026/7/22 1:05:21
1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…
📅 2026/7/22 1:05:21
更多请点击:
https://intelliparadigm.com
第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…
📅 2026/7/22 1:05:21
目录
第一步:选对模板,省心一半
第二步:打开扫码点餐功能
开启功能按钮
桌台管理与桌码生成
第三步:个性化设计,打造品牌感
调整点餐页面
设置点餐规则 你还在让顾客站着排队点餐吗?2025年ÿ…
📅 2026/7/22 7:05:39
在业务中快速构建一个能理解私有文档、准确回答专业问题的智能助手,是很多开发团队面临的共同挑战。传统方案往往需要从零开始搭建复杂的 RAG(检索增强生成)系统,涉及文档解析、向量化、检索、大模型调用等多个环节,整…
📅 2026/7/22 17:06:14
FAE放射组学分析工具:医学影像特征探索的完整解决方案 【免费下载链接】FAE FeAture Explorer 项目地址: https://gitcode.com/gh_mirrors/fae/FAE
你是否曾经面对海量医学影像数据感到无从下手?想要从CT、MRI等影像中提取有价值的定量特征&#…
📅 2026/7/22 5:05:32