or
本练习是课程的一部分
在本章中,您将了解为什么在分析数据集时,缺失数据可能带来风险。我们将介绍三种缺失机制,并讲解如何使用统计检验与可视化工具识别它们。
了解填补方法的分类体系,并学习三种基于供体的技术:均值填补、热甲板(hot-deck)填补和 k-近邻(k-Nearest-Neighbors)填补。您将深入其原理,理解这些方法如何工作,并学习如何将它们应用到真实的热带天气数据集。过程中,您还会掌握一些实用技巧,帮助这些方法更好地解决您的问题。
现在是时候学习如何使用统计与机器学习模型(如线性回归、逻辑回归与随机森林)来填补缺失数据了。本章将探讨这些模型如何进行预测,并据此从条件分布中抽取填补值。这一点很重要,因为它能确保您的填补结果更加多样且合理,更接近真实数据。
填补得到的数值并非板上钉钉。它们只是估计,而估计总伴随不确定性。在最后一章中,您将了解如何使用自助法(bootstrapping)与基于链式方程的多重填补(借助 mice 包),把填补不确定性纳入模型与分析,使其更可靠、更稳健。
当前练习