知识卡片:基于最优控制与后验误差估计的神经网络深度自适应
英文标题:An optimal control approach for neural network architecture adaptation with a posteriori error estimation
英文关键词:foundation-model, optimal control, posteriori error estimation, neural network architecture adaptation, depth adaptation, dual weighted residual, piecewise linear weights, Navier-Stokes
一句话结论
本文提出一种将神经网络训练视为连续时间最优控制问题,并利用后验误差估计指导网络深度自适应的方法——通过将总近似误差分解为层间贡献,在误差最大的位置插入新层,从而在科学数据集(如Navier-Stokes方程的可观测到参数映射学习)上获得优于现有架构自适应方法的泛化性能。
事件概述或研究问题
神经网络架构(尤其是深度)通常依赖人工经验或网格搜索确定,缺乏理论指导。本文旨在解决如何根据逼近误差的分布来自适应地调整网络深度的问题,提出一种基于后验误差估计的严格框架,将离散网络层与连续最优控制解之间的差异量化为可计算的误差上界,并据此决定新层的插入位置。
方法/产品要点
- 最优控制问题形式化:将神经网络的训练重新表述为一个连续时间最优控制问题,网络的权重和偏置被建模为随层索引连续变化的分段线性函数。
- 后验误差估计:借鉴有限元分析中的对偶加权残量法,推导出泛函误差的可计算上界,并将总近似误差分解为每个区间(对应网络层)的贡献。
- 深度自适应策略:基于误差分解,在估计误差最大的区间处插入新层(即增加分段线性函数的节点),从而高效捕捉底层问题的复杂非线性变化。
- 新网络架构:权重和偏置作为层间分段线性函数,误差估计器界定了这种离散表示与真实连续最优控制解之间的差距。
主要结果或产业意义
- 理论贡献:给出了显式误差界,将总近似误差分解为区间贡献,为有针对性的架构细化提供了严格基础。
- 数值结果:在科学数据集(尤其是学习Navier-Stokes方程的可观测到参数映射)上,该方法在泛化性能方面持续优于现有的架构自适应方法。
- 产业意义:为需要高精度逼近的物理信息神经网络、科学计算等领域提供了一种自动、可解释的深度扩展方法。
为什么重要
- 将有限元分析中的成熟误差估计技术引入神经网络架构搜索,架起了数值分析与深度学习之间的桥梁。
- 解决了“在哪里增加层”这一关键问题,避免了盲目增加深度带来的计算浪费和过拟合风险。
- 提供了严格的误差理论,使得网络结构的变化有可解释的数学依据。
局限与不确定性
- 当前实验仅针对科学数据集(如Navier-Stokes),在通用图像/文本任务上的表现待核实。
- 计算开销:对偶加权残量的计算在生产环境中的实际效率待核实。
- 方法依赖连续时间最优控制的形式化,对于非连续或离散输入的网络适用性待核实。
可用于图书/PPT/简报的角度
- 科学计算+深度学习:展示如何用数值分析工具(对偶加权残量法)“校准”神经网络深度。
- 自动机器学习:作为“可解释的神经架构搜索”案例,强调误差驱动的层插入而非黑箱搜索。
- 物理信息神经网络:针对PDE求解场景,本方法可直接用于自适应增加网络容量以捕捉多尺度物理特征。
- 方法论教学:可用“分段线性函数逼近连续控制——误差分解——节点插入”的流程演示自适应网格细化思想。
原始材料
- URL:https://arxiv.org/abs/2607.07637v1
- arXiv ID:2607.07637v1
- 作者:C G Krishnanunni, Thomas Scott, Tan Bui-Thanh
- 发布日期:2026-07-08
- 分类:cs.LG, math.NA, math.OC
- 摘要原文:见下(略,同所给材料)