当我们进一步进行分析时,需要对数据做出一些假设。
以下关于 MCAR 和 MAR 的说法中,哪一项是正确的?
MCAR
MAR
正确
本练习是课程的一部分
通过我们的互动练习之一,将理论转化为实践
第 1 章将向您介绍缺失数据,说明什么是缺失值、它们在 R 中的行为、如何检测它们以及如何计数。随后,我们介绍缺失数据的汇总方法,以及如何在个案、变量层面汇总缺失情况,并在数据中的不同分组内进行探索。最后,我们讨论缺失数据的可视化,如何为整个数据集以及各变量、各个案和其他汇总生成概览式可视化,并学习如何在不同分组间进行比较与探索。
在第 2 章中,您将学习如何识别诸如 "missing" 或 "N/A" 之类隐藏的缺失值,并将它们替换为 `NA`。您将学习如何高效处理隐式缺失值——即未被显式列出、但可推断为缺失的值。我们还将讨论如何探索缺失数据的依赖性,介绍完全随机缺失(MCAR)、随机缺失(MAR)、非随机缺失(MNAR),以及这些情形对您的数据分析意味着什么。
当前练习
在本章中,您将学习处理缺失数据的工作流程。我们将介绍特殊的数据结构:shadow 矩阵与 nabular 数据,并演示如何在探索缺失数据的工作流程中使用它们,从而将缺失性的汇总结果与原始数据中的取值对应起来。您将学习如何使用 ggplot 来探索和可视化:当其他变量出现缺失时,某个变量的取值如何变化。最后,您将学习如何可视化两个变量之间的缺失情况,以及为何与如何在散点图中展示缺失。
本章将讲解如何填补数据中的缺失值,即插补。您将学习如何进行插补与跟踪缺失值,并了解插补的优缺点,以便将插补数据与原始取值进行可视化、探索与评估。您将学习如何使用、评估并比较不同的插补模型,并探索不同插补模型如何影响您基于模型得出的推断。