EDA ของข้อมูลการรู้หนังสือและอัตราการเจริญพันธุ์
ในแบบฝึกหัดถัดไปหลายข้อ เราจะศึกษาความสัมพันธ์ระหว่างการรู้หนังสือของผู้หญิงกับอัตราการเจริญพันธุ์ (ซึ่งนิยามว่าจำนวนเด็กเฉลี่ยที่ผู้หญิงหนึ่งคนให้กำเนิด) ทั่วโลก เพื่อให้วิเคราะห์และแปลผลได้ง่ายขึ้น เราจะใช้อัตราการไม่รู้หนังสือแทน
ก่อนเริ่มวิเคราะห์ ควรทำ EDA ก่อนเสมอ ให้พล็อตกราฟอัตราการเจริญพันธุ์เทียบกับอัตราการไม่รู้หนังสือ และคำนวณค่าสัมประสิทธิ์สหสัมพันธ์เพียร์สัน NumPy array illiteracy เก็บอัตราการไม่รู้หนังสือในกลุ่มผู้หญิงของประเทศส่วนใหญ่ทั่วโลก ส่วน array fertility เก็บข้อมูลอัตราการเจริญพันธุ์ที่สอดคล้องกัน
อาจเป็นประโยชน์หากกลับไปดูฟังก์ชันที่เขียนไว้ในคอร์สก่อนหน้า เพื่อคำนวณค่าสัมประสิทธิ์สหสัมพันธ์เพียร์สัน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Statistical Thinking in Python (ตอนที่ 2)
คำแนะนำการฝึกหัด
- พล็อต
fertility(แกน y) เทียบกับilliteracy(แกน x) ในรูปแบบ scatter plot - กำหนด margin ที่ 2%
- คำนวณและพิมพ์ค่าสัมประสิทธิ์สหสัมพันธ์เพียร์สันระหว่าง
illiteracyและfertility
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Plot the illiteracy rate versus fertility
_ = plt.plot(____, ____, ____='.', ____='none')
# Set the margins and label axes
plt.margins(____)
_ = plt.xlabel('percent illiterate')
_ = plt.ylabel('fertility')
# Show the plot
plt.show()
# Show the Pearson correlation coefficient
print(pearson_r(____, ____))