LLMENAS大语言模型引导的进化神经架构搜索前言神经架构搜索NAS是AutoML的核心方向但传统方法始终绕不开早熟收敛到局部最优的痛点可微NASDARTS易因跳连操作堆积导致性能坍缩进化式NAS搜索成本极高现有LLM-based NAS又存在输出多样性低、易生成无效架构的问题。会议IEEE Transactions on Evolutionary ComputationTEVC年份2026源码已开源https://github.com/LLMENAS/LLMENAS一、研究背景传统NAS的三大核心问题可微NASDARTS架构参数与超网权重强耦合易选择无参数的跳连操作陷入局部最优并引发性能坍缩进化式NAS全局搜索能力强但依赖随机探索搜索成本动辄上千GPU天如AmoebaNet-A需3150 GPU天现有LLM-based NAS将LLM直接作为架构生成器存在输出多样性低易局部收敛、幻觉问题复杂空间生成无效架构的缺陷。LLMENAS的核心思路不改变LLM和进化算法的底层逻辑而是重新定义二者的协作方式——让LLM做「搜索策略指导者」而非「架构生成者」。二、LLMENAS核心框架与核心图解读2.1 整体框架Fig.1分层优化闭环协作这是论文的核心框架图清晰展示了LLMENAS的上层LLM轨迹感知适应度设计和下层进化架构搜索的闭环协作逻辑分为6个核心步骤历史轨迹记忆LLM获取前δ\deltaδ代的进化轨迹HgH_gHg​含性能、架构多样性指标、上一轮策略代码LLM生成策略LLM基于轨迹生成自然语言策略和可执行的适应度函数Python代码输出验证对生成代码做语法检查、功能测试失败则重生成多次失败则启用兜底策略下层进化搜索CMA-ES基于LLM设计的适应度函数完成种群采样、评估、选择与更新性能反馈将进化搜索的验证损失变化量ΔLval\Delta \mathcal{L}_{val}ΔLval​反馈给LLMLLM自改进根据反馈触发自反思/自精修优化下一轮的适应度设计策略。核心亮点框架实现了**数值进化下层CMA-ES和语义推理上层LLM**的深度协同且通过反馈形成闭环让整个搜索过程具备「自学习、自优化」能力。2.2 核心组件4大关键设计含创新点1轨迹感知的LLM适应度设计器核心定位创新首次将LLM从架构生成器改为适应度函数设计器从根源解决LLM的幻觉和低多样性问题LLM通过滑动窗口构建历史上下文HgH_gHg​固定δ5\delta5δ5代保证足够的趋势判断依据基于轨迹动态生成适应度函数fg1πLLM(Hg)f_{g1}\pi_{LLM}(H_g)fg1​πLLM​(Hg​)目标是最小化未来验证损失引导进化搜索向有潜力的区域探索而非在局部最优中停滞。2双指标驱动的适应度设计解决局部最优的核心LLM设计适应度函数时基于**开发Exploitation和探索Exploration**双指标动态平衡二者缺一不可L1L_1L1​开发交叉熵损失衡量候选架构的验证性能最小化L1L_1L1​引导种群向高性能区域收敛L2L_2L2​探索架构相似度指标L2≈1L_2≈1L2​≈1表示种群结构停滞所有架构高度相似此时LLM会自动调整适应度函数权重强制增强探索。3闭环自改进机制论文核心亮点Fig.1核心分支根据**验证损失变化量ΔLvalg\Delta \mathcal{L}_{val}^gΔLvalg​**触发两种模式让LLM能根据进化反馈迭代优化自身策略自反思ΔLvalg≥0\Delta \mathcal{L}_{val}^g \geq0ΔLvalg​≥0验证性能停滞/恶化说明当前策略失效LLM诊断原有代码问题重新设计全新的适应度函数强制逃离局部最优自精修ΔLvalg0\Delta \mathcal{L}_{val}^g 0ΔLvalg​0验证性能显著提升说明当前策略有效LLM保留核心逻辑微调数学系数加速种群向最优区域收敛。4生成输出验证机制工程化保障Fig.1验证环节针对LLM的幻觉问题生成语法错误/功能无效的代码设计多轮验证兜底策略确保搜索不中断验证流程语法检查→功能测试→测试实例验证迭代重生成验证失败则基于错误信息重生成最多3次兜底策略多次失败则使用仅关注性能的鲁棒函数fL1fL_1fL1​保证进化搜索的连续性。2.3 进化搜索底层CMA-ES的应用下层采用**协方差矩阵自适应进化策略CMA-ES**作为进化算子相比传统进化算法和梯度方法CMA-ES通过精细的采样策略和自适应协方差矩阵调整能更高效地探索复杂搜索空间避免早熟收敛对架构参数构建高斯分布随机采样生成候选架构用LLM设计的适应度函数评估候选架构选取最优的⌊λ/2⌋\lfloor\lambda/2\rfloor⌊λ/2⌋个个体基于最优个体更新高斯分布的均值、方差和协方差矩阵引导种群向更优区域探索。三、论文核心实验图解读关键实验结果3.1 核心实验图解读1Fig.2CIFAR-10搜索过程中跳连操作数量变化这张图直接验证了LLMENAS解决性能坍缩的效果对比了DARTS、固定适应度函数、自适应函数引导、LLMENAS四种方法的跳连数变化DARTS蓝线快速饱和到最大跳连数4典型的性能坍缩表现依赖无参数跳连放弃有效卷积操作固定适应度红线也迅速陷入局部最优稳定在3个跳连数自适应函数绿线虽有改善但后期仍堆积跳连操作LLMENAS橙线始终保持低且稳定的跳连数证明其能有效识别并惩罚「路径最省力」的跳连操作强制探索更有价值的卷积操作从根源避免性能坍缩。2Fig.3Fig.4超参T/δ对性能和搜索成本的影响这两张图验证了LLMENAS核心超参的合理性也是工程复现的关键Fig.3更新间隔TT表示LLM更新适应度函数的epoch间隔T1时验证准确率最高86.15%虽搜索成本略有上升但提升幅度远大于成本增加因此论文设置T1每代更新实时指导Fig.4观察窗口δδ表示LLM分析的历史轨迹代际数δ5时实现准确率最高86.15%搜索成本最优0.15 GPU天δ过小则轨迹信息不足δ过大则冗余且成本上升因此论文设置δ5。3Fig.5CIFAR-10损失景观可视化这张图解释了LLMENAS泛化能力强的根本原因对比了基线方法、自适应函数引导、LLMENAS的损失景观基线方法左收敛到尖锐最小值损失等高线密集参数轻微扰动就会导致损失骤升泛化能力差自适应函数中收敛到较宽盆地但边缘梯度仍陡峭抗扰动能力一般LLMENAS右收敛到平坦最小值损失等高线稀疏即使参数大幅扰动损失仍保持稳定泛化能力和鲁棒性显著提升。3.2 关键实验结果性能效率双SOTALLMENAS在CIFAR-10/100、ImageNet-1k、NAS-Bench-201四大基准上测试平民级硬件即可复现CIFAR用单RTX3090ImageNet用单RTX4090核心结果如下数据集Top-1准确率搜索成本GPU天测试误差核心优势CIFAR-1097.58%0.152.42%低于ADARTS/GENAS等SOTA方法CIFAR-10083.52%0.1516.48%仅3.5M参数兼顾轻量与性能ImageNet-1k75.6%2.024.4%远低于传统进化NAS的3150 GPU天核心效率亮点LLM的推理延迟可忽略CIFAR-10仅0.002 GPU天整体搜索成本远低于高效梯度NAS如DARTS 0.4 GPU天和进化NAS如NSGANetV1 27 GPU天。3.3 消融实验验证组件必要性论文通过消融实验证明移除任意核心组件均会导致性能显著下降验证了设计的合理性LLMENAS-V1移除自改进机制CIFAR-10测试误差从2.42%升至2.51%无法自适应优化策略搜索后期易停滞LLMENAS-V2移除LLM适应度设计CIFAR-10测试误差骤升至3.19%陷入局部最优发现的架构仅2.6M参数过度简单不同进化算法适配LLMENAS可适配CMA-ES/DE/PSO添加LLM指导后所有算法的测试误差均显著下降验证了框架的通用性。四、结论与未来展望4.1 研究结论LLMENAS的核心贡献在于重新定义了LLM在NAS中的角色通过四大关键设计实现了三大突破解决了传统NAS早熟收敛到局部最优的核心痛点有效避免性能坍缩实现了SOTA性能极致搜索效率的双重突破平民级硬件可复现提出了LLM与进化算法的闭环协作范式为后续融合研究提供了新思路。用一句话概括LLMENAS让LLM做NAS的「战略指导者」通过动态适应度设计引导进化搜索而非直接做「手工设计师」生成架构。4.2 未来研究方向高维轨迹表示当前LLM仅基于标量轨迹推理未来将融入架构拓扑等高维信息实现更精细的机制化推理提升可解释性解决LLM决策的「黑箱问题」让适应度函数的设计过程更透明多目标优化扩展将框架应用于「精度-参数量」「精度-推理速度」等多目标NAS场景实际任务落地将LLMENAS应用于目标检测、语义分割、NLP等复杂任务验证实际部署价值。总结LLMENAS是一款兼顾创新性、实用性、可复现性的NAS算法其核心价值不仅在于实现了性能和效率的突破更在于提出了一种全新的LLM与进化计算的协作方式。论文中的核心图表Fig.1-Fig.5层层递进从框架设计、问题解决、超参优化到泛化能力完整验证了算法的有效性也是理解该论文的关键。对于开发者和研究者而言LLMENAS的开源代码和平民级复现成本让其成为NAS领域值得深入学习和二次开发的优秀算法。论文DOI10.1109/TEVC.2026.3670336源码地址https://github.com/LLMENAS/LLMENAS收藏关注后续持续拆解顶刊顶会核心论文图表解读