知识卡片:协变量偏移下基于依赖数据的自适应深度非参数回归
一句话结论
本文提出稀疏惩罚深度神经网络(SPDNN)估计器,在协变量偏移与依赖数据(包括多种混合过程)的设定下,可自适应地达到(至多对数因子)极小化最优收敛率,适用于分位数回归和Huber回归。
事件概述或研究问题
在实际应用中,源分布与目标分布常不相同导致协变量偏移,此时以源分布为标准评估模型不再合适。同时,观测数据可能具有时间依赖性(如时间序列)。本研究旨在解决协变量偏移下,基于依赖观测的非参数分位数回归和Huber回归问题。
方法/产品要点
- 提出稀疏惩罚深度神经网络(SPDNN)估计器,显式考虑源分布与目标分布之间的差异。
- 当协变量密度比未知时,采用两步骤预训练:第一步用最小二乘SPDNN估计密度比;第二步用该密度比对损失重加权,训练重加权SPDNN回归函数。
- 处理依赖数据时,利用广义Bernstein型不等式,覆盖i.i.d.观测、φ-混合、强混合、C-混合等经典模型。
- 理论分析假设回归函数属于Hölder光滑函数类,为分位数和Huber回归建立了非渐近误差界。
主要结果或产业意义
- SPDNN估计器在分位数回归和Huber回归中,能从i.i.d.数据以及多种经典时间序列模型自适应地实现(至多对数因子)极小化最优收敛率。
- 实际价值:当训练数据与测试数据分布不同且存在时间依赖时(如金融风险建模、传感器网络等),该框架提供了有理论保证的深度回归方法。
为什么重要
现有深度非参数回归多数假设i.i.d.且无协变量偏移。本研究首次同时处理依赖数据与协变量偏移,拓宽了深度回归在现实复杂场景(如非平稳时间序列)中的适用性,并给出了非渐近收敛率保证。
局限与不确定性
- 理论结果依赖密度比估计的准确性,两步骤预训练中的误差传递机制尚未在摘要中详细分析(待核实)。
- 摘要未提及实验验证,实际性能需通过仿真和真实数据集确认(待核实)。
- 假设回归函数属于Hölder光滑类,对非光滑或高维情形的扩展未讨论(待核实)。
可用于图书/PPT/简报的角度
- 作为深度神经网络应对分布偏移与时间依赖的联合解决方案案例,强调“先估计密度比,再重加权训练”的两步直觉。
- 对比传统协变量偏移方法(如重要性加权)与深度神经网络的结合,展示理论收敛速率提升。
- 在“非参数回归与深度学习”章节中,作为自适应估计的现代例子。
原始材料
- 英文标题:Adaptive deep nonparametric regression from dependent data under covariate shift
- 英文关键词:covariate shift, deep neural network, nonparametric regression, dependent data, quantile regression, Huber regression
- 来源:arXiv:2607.20309v1 (stat.ML, cs.LG)
- 作者:William Kengne, Ehud Mossa Ockegna
- 发布日期:2026-07-22
- 摘要URL:https://arxiv.org/abs/2607.20309v1