ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

AAAI 2025 | LAPT:基于大语言模型的神经架构搜索设计原理迁移

AAAI 2025 | LAPT:基于大语言模型的神经架构搜索设计原理迁移 AAAI 2025 | LAPT基于大语言模型的神经架构搜索设计原理迁移01 论文信息02 论文主要贡献03 方法3.1 可迁移神经架构搜索TNAS3.2 大语言模型用于神经架构搜索3.3 问题定义3.4LAPT 整体框架3.5 设计原理学习模块3.6 原理迁移与自适应模块3.6.1 原理迁移生成精简搜索空间3.6.2 原理自适应解决域偏移3.7 提示工程04 实验分析4.1 测试搜索空间4.2 实验环境与超参设置4.3 对比实验结果4.3.1 NAS201 对比4.3.2 Trans101 六任务对比4.3.3 DARTS 搜索空间对比4.4 消融实验05 个人声明01 论文信息论文题目Design Principle Transfer in Neural Architecture Search via Large Language Models论文作者Xun Zhou, Xingyu Wu, Liang Feng, Zhichao Lu, Kay Chen Tan发表会议\期刊AAAI2025代码链接https://github.com/milkmilk511/LAPT.02 论文主要贡献本文首次提出设计原理迁移全新范式通过构建精简搜索子空间同步提升 NAS 的搜索精度与效率在本工作中各种结构组件例如层或连接对架构性能影响的语言描述被称为设计原理。这些原理从先前任务开发的架构中提取。然后这些原理被应用于消除具有不太关键组件的架构从而为新任务生成一个优化的子空间。提出 LLM 驱动的LAPT框架实现跨任务设计原理迁移具备三大优势①基于大模型自动学习通用网络设计原理②原理自适应策略缓解域偏移影响③搜索空间压缩过程具备完整可解释性在多套标准搜索空间、多类视觉任务上完成大规模对比实验即便搭配基础 NAS 搜索算法在 LAPT 精简后的子空间内检索也能取得当前 SOTA最优效果证明设计原理迁移是 NAS 领域极具潜力的研究方向。03 方法3.1 可迁移神经架构搜索TNAS大多数NAS方法专注于为单个任务构建架构,为了解决这一限制,可迁移NAS应运而生。TNAS利用从先前搜索过程中获得的架构知识来加速新任务的架构搜索,复用历史搜索得到的完整网络引导新任务向更优结构收敛;复用历史任务训练的性能预测器降低新架构的评估开销。但仍存在搜索空间大计算成本高和迁移知识与特定搜索技术绑定通用性差的问题。3.2 大语言模型用于神经架构搜索设计原则迁移的实际实施面临着挑战自动化程度低DNN架构的复杂性和多样性使得提炼通用设计原则变得困难。当前方法通常需要专门的工具将架构映射到共享的潜在空间然后通过专家分析来提取底层设计规则这降低了自动化程度。资源消耗大学习这些原则的过程需要大量标记的架构知识转化难自然语言描述难以转化为实际的架构设计操作LLM提供了有效的解决方案。通过用编程语言表示架构学习设计原则的任务可以被构建为一个语言归纳学习问题。自动化LLM可以自动从架构代码中学习设计原则无需专家分析少量样本利用上下文学习只需少量架构样本即可学习原则知识转化LLM可以将自然语言描述的原则自动转化为可操作的架构设计规则3.3 问题定义给定一个带标注的数据集D \mathcal{D}D及其对应的任务T \mathcal{T}T我们的目标是从预定义的搜索空间Ω \OmegaΩ中找到一个最优的神经网络架构a ∗ a^*a∗使得该架构在任务T \mathcal{T}T上达到最高的准确率A C C \mathrm{ACC}ACC。与传统神经架构搜索NAS方法需要遍历整个搜索空间不同本文提出仅在高潜力的精简子空间Ω r \Omega_rΩr​内进行搜索。该优化问题的数学表达如下a ∗ arg ⁡ max ⁡ a ∈ Ω r A C C ( a , D ) , s . t . Ω r ⊂ Ω . \begin{aligned} a^* \mathop{\arg\max}_{a\in\Omega_r} \mathrm{ACC}(a,\mathcal{D}), \\ \mathrm{s.t.} \quad \Omega_r \subset \Omega. \end{aligned}a∗s.t.​argmaxa∈Ωr​​ACC(a,D),Ωr​⊂Ω.​上述公式的核心难点在于如何构建最优的精简子空间Ω r \Omega_rΩr​。原始搜索空间Ω \OmegaΩ的定义搜索空间Ω \OmegaΩ包含了目标任务所有可行的前馈神经网络这些网络需满足以下约束网络的总层数不超过L LL第i ii层l i l_ili​从候选算子集合C i \mathcal{C}_iCi​例如池化、卷积等中选择一个算子来处理特征前馈结构约束第i ii层仅接收来自其前序层集合S i { l 1 , . . . , l i − 1 } \mathcal{S}_i\{l_1,...,l_{i-1}\}Si​{l1​,...,li−1​}的特征其中s i s_isi​表示第i ii层实际选择的输入来源子集。一个完整网络的参数可以表示为A ⋃ i 1 L { l i , s i } A\bigcup_{i1}^{L}\{l_i,s_i\}A⋃i1L​{li​,si​}。因此原始搜索空间定义为Ω { A ∣ l i ∈ C i , s i ⊂ S i , i ∈ { 1 , . . . , L } } . \Omega\{A \mid l_i\in\mathcal{C}_i,\; s_i\subset\mathcal{S}_i,\; i\in\{1,...,L\}\}.Ω{A∣li​∈Ci​,si​⊂Si​,i∈{1,...,L}}.精简搜索子空间Ω r \Omega_rΩr​的定义本文利用从历史任务中学习到的设计原理来描述不同算子及连接方式对模型精度的影响。基于这些原理可以剔除每一层中性能低效的算子以及无效的输入来源从而为每一层得到精简后的候选算子集合C i r ⊂ C i \mathcal{C}_i^r \subset \mathcal{C}_iCir​⊂Ci​和精简后的输入来源集合S i r ⊂ S i \mathcal{S}_i^r \subset \mathcal{S}_iSir​⊂Si​。最终的精简子空间定义为Ω r { a ∣ l i ∈ C i r , s i ⊂ S i r , a ∈ Ω } . \Omega_r\{a \mid l_i\in\mathcal{C}_i^r,\; s_i\subset\mathcal{S}_i^r,\; a\in\Omega\}.Ωr​{a∣li​∈Cir​,si​⊂Sir​,a∈Ω}.在Ω r \Omega_rΩr​中高性能架构的占比远高于原始空间Ω \OmegaΩ。在此子空间内进行搜索能够更快地收敛到优质的网络结构。本文 LAPT 框架通过剔除无潜力架构实现搜索空间剪枝生成高性能架构占比更高的精简子空间。为定量验证该优化效果提出eEDF量化指标量化指标误差经验分布函数 eEDFF ( e ) 1 n ∑ i 1 n 1 [ e i ≤ e ] F(e) \frac{1}{n}\sum_{i1}^{n}\mathbb{1}\big[e_i \le e\big]F(e)n1​i1∑n​1[ei​≤e]F ( e ) F(e)F(e)神经网络架构测试误差低于e ee的模型占全部网络的比例n nn当前搜索空间总架构数量。3.4LAPT 整体框架整体框架分为两大阶段设计原理学习阶段、新任务架构搜索阶段3.5 设计原理学习模块本模块设计了专用的提示词Prompt用于引导大语言模型LLM从给定的神经网络架构集合中归纳出通用的设计原理。提示词主要包含两部分架构实现与学习指南。首先预训练的大语言模型LLM通常接触过多种编程语言因此能够从源代码中理解神经网络的结构。然而由于模型输入长度的限制Token 限制直接将所有架构的完整源代码输入 LLM 是不可行的。为了解决这一问题本方法将架构参数即⋃ i 1 L { l i , s i } \bigcup_{i1}^{L}\{l_i, s_i\}⋃i1L​{li​,si​}封装为Python 类作为提示词。这种方式使得 LLM 仅需通过少数架构参数即可学习并吸收这些神经网络架构的知识。深度网络结构复杂直接让 LLM 总结规则难度极高借鉴思维链提示工程设计三步推理流程步骤 1向 LLM 输入全部网络的参数序列步骤 2引导 LLM 识别所有网络中重复出现的结构共性步骤 3基于共性总结通用网络设计原理。3.6 原理迁移与自适应模块3.6.1 原理迁移生成精简搜索空间将第一阶段习得的通用原理P \mathcal{P}P输入 LLM模型自动将文字规则转化为每层可用的算子、输入来源约束生成C i r \mathcal{C}_i^rCir​、S i r \mathcal{S}_i^rSir​构建精简子空间Ω r \Omega_rΩr​再使用标准 NAS 算法在Ω r \Omega_rΩr​内检索适配任务T n \mathcal{T}_nTn​的候选网络B n \mathcal{B}_nBn​。3.6.2 原理自适应解决域偏移不同任务数据分布存在域偏移通用原理生成的Ω r \Omega_rΩr​无法适配所有任务因此设计迭代自适应策略基于当前任务检索得到的网络动态更新原理逐步生成任务专属子空间。说明检索到精度更高的网络基于新优质结构迭代优化原理进一步收缩搜索空间聚焦高潜力区域 无精度提升放开约束让 LLM挖掘未纳入原理的结构组件扩大搜索探索范围避免局部最优。3.7 提示工程本文设计多套专用提示词用于引导大语言模型完成三项核心任务从网络样本归纳通用设计原理、将文字原理转化为架构约束、针对目标任务迭代自适应更新原理。整套提示词由 4 个基础模块构成任务说明告知大模型需要解决的具体问题推理策略规定模型必须遵循分步推理流程输出规范限定返回内容格式与信息类型补充备注附加约束提升模型输出效率与规范性。架构实现提示词(Prompt for architecture implementation)将抽象的网络结构转为可被 LLM 读懂的代码形式让大模型依托代码理解网络层级、前向传播数据流、各算子搭配逻辑是后续归纳设计原理的基础输入载体。设计原理学习提示词(Prompt for design principle learning)请依托你在深度神经网络领域的专业知识推导给定一批网络架构背后蕴含的设计原理。请严格分步完成推理首先分析架构内部的特征数据流走向接下来输入 50 个性能最优架构对应的 layer_list 序列序列存放于 {}中分析这些架构之间的共性模式并解释该模式形成的原因;最后从这些共性规律中提炼高性能网络的通用设计原理。除此之外需要根据总结出的设计原理为网络每一层推荐可选用的运算算子以此搭建高精度网络每层推荐可选算子数量不超过 2 个。原理自适应提示词Prompt for principle adaptation分两种迭代场景动态调整规则搜到精度更高的网络基于新架构更新设计原理进一步收窄每层可选算子无精度提升扩充每层可选算子扩大搜索范围规避局部最优两种场景均要求仅以纯字典格式输出算子编号严格限定输出格式。04 实验分析4.1 测试搜索空间实验采用三套公认标准 NAS 基准搜索空间NAS-bench-201NAS201、TransNAS-Bench-101Trans101、DARTS。NAS201基于重复单元cell搭建网络每个单元包含 6 层每层 5 种候选算子总候选架构 15000 个Trans101单元结构与 NAS201 一致每层仅 4 种算子总候选架构 4000 个DARTS双单元结构普通单元 降采样单元每个单元包含 2 输入层、4 阶段每阶段 2 层每层 8 种算子单单元候选结构约10 9 10^9109种完整网络两类单元组合总候选架构约10 18 10^{18}1018。4.2 实验环境与超参设置LAPT 框架可兼容任意 NAS 检索算法本文选用基础进化搜索算法 REARegular EA验证框架通用性超参设置见表 1LLM 统一使用GPT-4完成原理学习与自适应。4.3 对比实验结果4.3.1 NAS201 对比对比传统 NASLAPT 检索耗时仅为 REA 的 1/100、HEBO 的 1/10精度持平甚至更优对比 SOTA TNASCIFAR-10 精度与 MetaD2A、TNAS-BO 持平检索速度是 MetaD2A 的 25 倍、TNAS-BO 的 7 倍CIFAR-100 精度接近最优 TNAS-BO速度为 MetaD2A 的 12 倍、TNAS-BO 的 7 倍4.3.2 Trans101 六任务对比对比传统 NASLAPT 在 6 项任务中 5 项超越 REA全部优于 BONAS平均排名全局最优对比 SOTA TNAS5/6 任务超越 WeakNAS-T半数任务物体分类、自编码、分割优于 Arch-zero在物体分类、分割任务上超越 Arch-Graph其余任务精度持平。4.3.3 DARTS 搜索空间对比CIFAR-10 分类LAPT 精度全面碾压人工设计网络对比经典 NAS算力仅为 SNAS 的 1/15、DARTS 的 1/10精度更高对比最新 SOTA精度小幅落后但算力仅为 GibbsNAS 的 1/5、MSNAS 的 1/2.5、MFENAS 的 1/6检索效率优势巨大。ImageNet 大规模分类LAPT 精度与主流 DARTS 变体接近参数量更小算力开销降低 1.5~2 倍4.4 消融实验在 Trans101 上设置两组对照验证知识迁移、原理自适应的必要性WO Adaptation移除自适应模块仅使用初始通用原理压缩空间迭代过程不更新原理WO Transfer移除跨任务知识迁移无旧任务成熟网络仅依靠当前任务检索的网络提炼原理。跨任务设计原理迁移是高性能的核心无迁移时很难检索到高排名优质网络原理自适应负责稳定收敛加入自适应后检索结果排名方差显著降低搜索稳定性更强。05 个人声明本文为作者对原论文的学习笔记与心得分享受个人学识与理解所限文中对论文内容的解读或有不够周全之处一切以原论文正式表述为准。本文仅用于学术交流与传播内容均由作者独立整理完成不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议请及时与作者联系作者将在第一时间核实并妥善处理。
返回列表