Kiểm định giả thuyết với tương quan Pearson
Tương quan quan sát giữa mù chữ ở nữ và tỷ suất sinh có thể chỉ do ngẫu nhiên; tỷ suất sinh của một quốc gia thực ra có thể hoàn toàn độc lập với mức mù chữ. Bạn sẽ kiểm định giả thuyết này. Để làm vậy, hoán vị các giá trị mù chữ nhưng giữ nguyên các giá trị tỷ suất sinh. Cách này mô phỏng giả thuyết rằng chúng hoàn toàn độc lập với nhau. Với mỗi hoán vị, hãy tính hệ số tương quan Pearson và đánh giá xem có bao nhiêu bản sao hoán vị của bạn có hệ số tương quan Pearson lớn hơn giá trị quan sát được.
Hàm pearson_r() mà bạn đã viết trong phần tiền truyện của khóa học này để tính hệ số tương quan Pearson đã được cung cấp sẵn cho bạn.
Bài tập này là một phần của khóa học
Tư duy Thống kê với Python (Phần 2)
Hướng dẫn bài tập
- Tính hệ số tương quan Pearson quan sát được giữa
illiteracyvàfertility. - Khởi tạo một mảng để lưu các bản sao hoán vị.
- Viết vòng lặp
forđể rút 10.000 bản sao:- Hoán vị các giá trị
illiteracybằngnp.random.permutation(). - Tính tương quan Pearson giữa mảng mù chữ đã hoán vị,
illiteracy_permuted, vàfertility.
- Hoán vị các giá trị
- Tính và in ra p-value từ các bản sao.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Compute observed correlation: r_obs
r_obs = ____
# Initialize permutation replicates: perm_replicates
perm_replicates = np.empty(10000)
# Draw replicates
for ____ in ____:
# Permute illiteracy measurments: illiteracy_permuted
illiteracy_permuted = ____
# Compute Pearson correlation
perm_replicates[i] = ____
# Compute p-value: p
p = ____
print('p-val =', p)