知识卡片:仿射潜参数化神经网络的尖锐逼近率
英文标题:Sharp Approximation Rates for Neural Networks with Affine Latent Parameterizations
英文关键词:sharp approximation rates; neural networks; affine latent parameterizations; hypernetworks; ReLU; Hölder functions
原始来源:arXiv:2608.31157v1 [cs.LG, stat.ML] — https://arxiv.org/abs/2608.31157v1
一句话结论
对于仿射潜参数生成器和全连接 ReLU 网络,在定义于 [0,1]^d 上的 α-Hölder 函数单位球(0<α≤1)上,最优最坏情况一致逼近误差的阶为 (P·min{M,P})^{-α/d};因此即使潜空间维度 M 固定,增大网络预算 P 仍可使逼近误差趋于零。
研究问题
许多参数高效方法用低维潜表示生成大网络的参数。本文研究这一框架的逼近能力:给定架构 Φ(有 P_Φ 个参数位),目标函数 f 表示为潜向量 ξ_f∈R^M,参数生成器 G:R^M→R^{P_Φ} 将其映射为网络参数,最终网络 Φ_{G(ξ_f)} 逼近 f。架构和生成器在整个目标类上共享,每个目标函数只对应各自的潜向量。该框架涵盖超网络、低维参数化、参数高效适配和模型压缩。核心问题是:潜维度 M 与网络预算 P 之间的权衡如何决定表达效率。
方法要点
- 数学框架:f ↦ ξ_f ↦ θ_f = G(ξ_f),实际网络为 Φ_{G(ξ_f)}。
- 研究范围:仿射生成器 G、全连接 ReLU 架构 Φ。
- 优化目标:在约束 P_Φ≤P 下,联合优化架构 Φ 和仿射生成器 G,求 α-Hölder 函数单位球上的最坏情况一致逼近误差的最优阶。
- 结果形式:以网络预算 P 和潜维度 M 共同刻画误差阶。
主要结果
- 最优最坏情况一致逼近误差的阶为: (P·min{M,P})^{-α/d}。
- 推论:潜空间维度 M 可以固定,不需要随网络预算 P 增加而增加;随着 P 增大,误差仍趋于零。
- 该结果将 M 与 P 的权衡显式体现在 min{M,P} 中:潜维度相对较小时,误差随 P 增大而衰减;潜维度不小于 P 时,min{M,P}=P,衰减阶更高。
为什么重要
- 这是关于潜参数化表达效率的理论结果,不是具体算法或应用系统。
- 它为超网络、参数高效适配、模型压缩等方法提供了渐进误差界,说明“低维潜生成大网络参数”在理论上可以保持逼近误差收敛。
- 与既有脉络的关系:已有相关卡片分别涉及能量结构化潜世界模型、神经网络深度自适应、区间/模糊物理增强神经网络;本条不重复这些工作,而是补充了一个更基础的理论问题——仿射潜参数化下,潜维度与网络预算的权衡如何决定逼近率。
局限与不确定性
- 本卡片仅依据论文摘要;证明细节、常数大小和准确条件需查看原文 PDF(待核实)。
- 结果针对“仿射生成器 + 全连接 ReLU”和 0<α≤1 的 Hölder 函数类;对非仿射生成器、其他架构或更光滑函数类是否成立,待核实。
- “固定潜维度仍可趋于零误差”是渐近意义下的说法;具体需要多大的 M 或 P 才能达到给定误差,摘要未给出(待核实)。
可用于图书/PPT/简报的角度
- 解释“低维潜空间是否限制网络表达能力”:在仿射生成器与 ReLU 网络下,给出明确的误差阶。
- 比较 M 与 P 的相对大小对收敛速率的影响,突出 min{M,P} 这一关键项。
- 用“固定 M 也能随 P 增大而收敛”作为参数高效方法的一个理论论据。
原始材料
- 标题:Sharp Approximation Rates for Neural Networks with Affine Latent Parameterizations
- arXiv ID:2608.31157v1
- 作者:Shijun Zhang
- 提交/更新:2026-08-31
- 分类:cs.LG; stat.ML
- 链接:https://arxiv.org/abs/2608.31157v1