经验法则
我们在数据分析中使用的许多统计量(包括样本均值和样本比例)都有一些良好性质,有助于更好地理解所关注的总体参数。
其中一项性质是:如果样本比例的变异性(称为"标准误",记为 $SE\()已知,那么来自不同样本的约 95% 的 \)\hat{p}$ 值会落在真实总体比例两侧各 \(2SE\) 的范围内。
要检验这一点在当前情境下是否成立,我们回到从同一总体抽取多个样本所得到的民调结果。
数据集 all_polls 包含从一个总体中抽取的 1000 个样本,每个样本容量为 30,该总体对候选人 X 投票的概率为 0.6。
注意,您将使用 R 函数 sd() 来计算任意一组数的变异性。在统计学中,当 sd() 作用于一个"变量"(例如房价)时,我们称之为"标准差"。当 sd() 作用于一个"统计量"(例如一组样本比例)时,我们称之为"标准误"。
本练习是课程的一部分
R 推断基础
练习说明
- 运行代码以生成
props,即每次民调中计划投票 yes 的个体比例。此结果基于之前练习中的ex1_props。 - 新增一列
is_in_conf_int:当样本中 yes 票的比例距离总体中 yes 票的真实比例小于 2 个标准误时取为TRUE。也就是说,prop_yes与true_prop_yes的abs()差值小于prop_yes的sd()的两倍。 - 通过对
is_in_conf_int取mean(),计算置信区间内的样本统计量比例prop_in_conf_int。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Proportion of yes votes by poll
props <- all_polls %>%
group_by(poll) %>%
summarize(prop_yes = mean(vote == "yes"))
# The true population proportion of yes votes
true_prop_yes <- 0.6
# Proportion of polls within 2SE
props %>%
# Add column: is prop_yes in 2SE of 0.6
mutate(is_in_conf_int = ___(___ - ___) < ___ * ___(___)) %>%
# Calculate proportion in conf int
summarize(prop_in_conf_int = ___(___))