开始使用免费开始使用

经验法则

我们在数据分析中使用的许多统计量(包括样本均值和样本比例)都有一些良好性质,有助于更好地理解所关注的总体参数。

其中一项性质是:如果样本比例的变异性(称为"标准误",记为 $SE\()已知,那么来自不同样本的约 95% 的 \)\hat{p}$ 值会落在真实总体比例两侧各 \(2SE\) 的范围内。

要检验这一点在当前情境下是否成立,我们回到从同一总体抽取多个样本所得到的民调结果。

数据集 all_polls 包含从一个总体中抽取的 1000 个样本,每个样本容量为 30,该总体对候选人 X 投票的概率为 0.6。

注意,您将使用 R 函数 sd() 来计算任意一组数的变异性。在统计学中,当 sd() 作用于一个"变量"(例如房价)时,我们称之为"标准差"。当 sd() 作用于一个"统计量"(例如一组样本比例)时,我们称之为"标准误"。

本练习是课程的一部分

R 推断基础

查看课程

练习说明

  • 运行代码以生成 props,即每次民调中计划投票 yes 的个体比例。此结果基于之前练习中的 ex1_props
  • 新增一列 is_in_conf_int:当样本中 yes 票的比例距离总体中 yes 票的真实比例小于 2 个标准误时取为 TRUE。也就是说,prop_yestrue_prop_yesabs() 差值小于 prop_yessd() 的两倍。
  • 通过对 is_in_conf_intmean(),计算置信区间内的样本统计量比例 prop_in_conf_int

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Proportion of yes votes by poll
props <- all_polls %>% 
  group_by(poll) %>% 
  summarize(prop_yes = mean(vote == "yes"))

# The true population proportion of yes votes
true_prop_yes <- 0.6

# Proportion of polls within 2SE
props %>%
  # Add column: is prop_yes in 2SE of 0.6
  mutate(is_in_conf_int = ___(___ - ___) < ___ * ___(___)) %>%
  # Calculate  proportion in conf int
  summarize(prop_in_conf_int = ___(___))
编辑并运行代码