Analytical and Bootstrap Confidence Intervals of Double Machine Learning: Simulation studies and an application to rural-urban difference in obesity prevalence
Double Machine Learning (DML) 是治疗效应估计的常用方法,允许使用灵活的机器学习方法进行 nuisance 参数估计,同时保持有效推断。一项模拟研究比较了 DML 置信区间的覆盖概率,对比了分析置信区间与 bootstrap 置信区间,使用了普通最小二乘、LASSO、随机森林、LightGBM 和神经网络等学习器,在不同数据生成设置下评估偏差、置信区间宽度和覆盖概率。结果显示覆盖性能在分析区间和 bootstrap 区间之间存在显著变异性,学习器选择起关键作用。
Development
- First ReportAnalytical and Bootstrap Confidence Intervals of Double Machine Learning: Simulation studies and an application to rural-urban difference in obesity prevalencearXiv cs.LG
- Current Assessment该研究对因果推断工具在行业中的应用具有指导意义,特别是在需要可靠治疗效应估计的领域(如医疗、经济政策评估)。它强调了模型选择在统计推断中的重要性,可能推动工具链中集成更稳健的方差估计方法。Agent Pulse · analysis
一项针对 Double Machine Learning (DML) 的模拟研究系统比较了不同机器学习算法对置信区间覆盖概率的影响。研究对比了 DML 理论推导的分析置信区间与 bootstrap 置信区间,在多种数据生成设置下评估了普通最小二乘、LASSO、随机森林、LightGBM 和神经网络等学习器。结果显示覆盖性能在不同方法和区间类型间存在显著差异,表明学习器选择对推断有效性有重要影响。该研究为应用研究者提供了关于如何选择 nuisance 模型以保持有效推断的实证指导。
研究揭示了 DML 中 nuisance 模型选择对置信区间覆盖概率的显著影响,表明不同学习器(如线性模型与树模型)在方差估计上存在系统性差异。分析置信区间与 bootstrap 区间在不同设置下表现不一,提示理论方差公式可能对某些学习器不稳健。这要求实践者在应用 DML 时进行敏感性分析,并考虑使用 bootstrap 作为补充验证。
该研究对因果推断工具在行业中的应用具有指导意义,特别是在需要可靠治疗效应估计的领域(如医疗、经济政策评估)。它强调了模型选择在统计推断中的重要性,可能推动工具链中集成更稳健的方差估计方法。
对于依赖因果推断进行决策的企业,该研究提供了选择机器学习模型时的实证依据,有助于避免因模型选择不当导致的错误推断,从而降低决策风险。
未来研究可能扩展至更多学习器类型和复杂数据生成场景,并探索自适应选择 nuisance 模型的方法。也可能推动开发更稳健的置信区间构造技术,以提升 DML 在实际应用中的可靠性。