Bắt đầu ngayBắt đầu miễn phí

EDA cho dữ liệu biết chữ/sinh suất

Trong vài bài tập tiếp theo, chúng ta sẽ xem xét mối tương quan giữa tỷ lệ biết chữ của nữ giới và sinh suất (được định nghĩa là số con trung bình trên mỗi phụ nữ) trên toàn thế giới. Để dễ phân tích và diễn giải, chúng ta sẽ làm việc với tỷ lệ chữ.

Luôn là ý hay khi thực hiện EDA trước khi phân tích. Vì vậy, hãy vẽ biểu đồ sinh suất theo mù chữ và tính hệ số tương quan Pearson. Mảng NumPy illiteracy chứa tỷ lệ mù chữ ở nữ giới cho phần lớn các quốc gia trên thế giới. Mảng fertility chứa dữ liệu sinh suất tương ứng.

Ở đây, bạn có thể tham khảo lại hàm bạn đã viết ở khóa trước để tính hệ số tương quan Pearson.

Bài tập này là một phần của khóa học

Tư duy Thống kê với Python (Phần 2)

Xem khóa học

Hướng dẫn bài tập

  • Vẽ biểu đồ phân tán fertility (trục y) theo illiteracy (trục x).
  • Đặt lề 2%.
  • Tính và in ra hệ số tương quan Pearson giữa illiteracyfertility.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Plot the illiteracy rate versus fertility
_ = plt.plot(____, ____, ____='.', ____='none')

# Set the margins and label axes
plt.margins(____)
_ = plt.xlabel('percent illiterate')
_ = plt.ylabel('fertility')

# Show the plot
plt.show()

# Show the Pearson correlation coefficient
print(pearson_r(____, ____))
Chỉnh sửa và Chạy Mã