EDA для даних про грамотність/народжуваність
У наступних вправах ми розглянемо кореляцію між жіночою грамотністю та народжуваністю (визначеною як середня кількість народжених дітей на одну жінку) у світі. Для зручності аналізу та інтерпретації ми працюватимемо з рівнем неграмотності.
Завжди корисно зробити попередню розвідку даних (EDA) перед основним аналізом. Для цього побудуйте графік залежності народжуваності від неграмотності та обчисліть коефіцієнт кореляції Пірсона. Масив NumPy illiteracy містить рівні жіночої неграмотності для більшості країн світу. Масив fertility містить відповідні дані про народжуваність.
Тут може стати в пригоді функція, яку ви писали в попередньому курсі для обчислення коефіцієнта кореляції Пірсона.
Ця вправа є частиною курсу
Статистичне мислення в Python (Частина 2)
Інструкції до вправи
- Побудуйте точкову діаграму
fertility(вісь y) відносноilliteracy(вісь x). - Встановіть відступ 2%.
- Обчисліть і виведіть коефіцієнт кореляції Пірсона між
illiteracyіfertility.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Plot the illiteracy rate versus fertility
_ = plt.plot(____, ____, ____='.', ____='none')
# Set the margins and label axes
plt.margins(____)
_ = plt.xlabel('percent illiterate')
_ = plt.ylabel('fertility')
# Show the plot
plt.show()
# Show the Pearson correlation coefficient
print(pearson_r(____, ____))