High-dimensional ridgeless least squares interpolation under spiked covariance structures
arXiv 论文 2608.07281v1 研究高维无岭最小二乘插值在尖峰协方差结构下的渐近预测风险,发现预测行为由回归系数与尖峰特征空间的对齐决定,信号能量沿潜在尖峰方向的分布决定良性、温和或灾难性过拟合。
发展脉络
- 首次出现High-dimensional ridgeless least squares interpolation under spiked covariance structuresarXiv cs.LG
- 当前判断该理论为理解高维插值模型的泛化提供了新视角,可能影响对过参数化模型(如神经网络)的理论解释。尽管是纯理论,但可能引导实践者关注数据协方差结构对模型性能的影响。可验证信号是相关理论是否被引用到实际模型分析中。Agent Pulse · 分析
该论文分析了当特征维度 p 和样本量 n 成比例增长时,高维无岭最小二乘估计器的样本外预测风险的渐近行为。研究采用广义尖峰总体协方差模型,包含多个潜在因子,尖峰特征值的数量可能有限或随 n 增加,尖峰特征值可能有界或以任意速率发散。除了刻画协方差谱的影响,论文揭示了良性过拟合的新机制:无岭插值的预测行为从根本上由回归系数 β 与总体协方差矩阵的尖峰特征空间的对齐决定。具体而言,沿潜在尖峰方向分布的信号能量决定了插值导致良性、温和还是灾难性过拟合。理论框架在最小矩条件下建立了尖锐的预测风险极限,仅需有限四阶矩而非高斯性。论文刻画了尖峰的数量、强度和几何结构对预测风险的影响。
该结果将过拟合行为与数据协方差结构联系起来,表明在尖峰协方差下,无岭插值的风险不仅取决于特征值谱,还取决于信号与尖峰子空间的对齐。这为设计正则化策略提供了理论依据:当信号主要沿尖峰方向时,插值可能良性;否则可能灾难。可验证的下一信号是后续工作是否将这一分析扩展到非线性模型或实际数据集。
该理论为理解高维插值模型的泛化提供了新视角,可能影响对过参数化模型(如神经网络)的理论解释。尽管是纯理论,但可能引导实践者关注数据协方差结构对模型性能的影响。可验证信号是相关理论是否被引用到实际模型分析中。
该研究为机器学习模型的可解释性提供理论基础,可能帮助从业者理解模型何时会过拟合,从而优化数据收集和特征工程。但短期商业价值有限,主要影响长期研究。
未来可能将这一框架扩展到更复杂的模型(如神经网络),或用于指导数据预处理和正则化选择。可验证信号是后续论文是否引用此结果并扩展。