ค้นหาค่าสุดขั้ว
หลังจากสร้าง DataFrame ที่มีข้อมูลสัดส่วนการระบุเชื้อชาติฮิสแปนิกจำแนกตามรัฐแล้ว ขั้นตอนต่อไปคือสำรวจข้อมูลเพิ่มเติม โดยเริ่มจากการสร้าง boxplot ด้วย seaborn
นอกจากนี้ยังค้นหารัฐที่มีสัดส่วนสูงสุดหรือต่ำสุดของชาวฮิสแปนิกที่ระบุเชื้อชาติต่างๆ ได้ด้วย โดยใช้เมธอด squeeze() ซึ่งแปลง DataFrame ที่มีแถวเดียวให้กลายเป็น Series (หาก DataFrame มีมากกว่าหนึ่งแถว เมธอดนี้จะไม่มีผล)
มีการนำเข้า pandas แล้ว และโหลด DataFrame states_hr ไว้แล้ว ซึ่งมีข้อมูลสัดส่วนการระบุเชื้อชาติ 7 หมวดหมู่
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python
คำแนะนำการฝึกหัด
- สร้าง boxplot โดยกำหนดพารามิเตอร์
dataเป็นชื่อ DataFrame (orient = "h"จะพล็อต boxplot ในแนวนอน) - ใช้
squeezeเพื่อแสดงรัฐที่มีค่ามากที่สุดในคอลัมน์hispanic_white - ใช้
squeezeเพื่อแสดงรัฐที่มีค่าน้อยที่สุดในคอลัมน์hispanic_other - สังเกตว่าชาวฮิสแปนิกที่ระบุเชื้อชาติว่าเป็นเอเชียนมีจำนวนน้อยมาก แต่มีหนึ่งรัฐที่เป็น outlier สูงผิดปกติ ใช้
squeezeเพื่อแสดงรัฐที่มีค่ามากที่สุดในคอลัมน์hispanic_asian
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import seaborn and matplotlib.plt
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()
# Create a boxplot
sns.boxplot(data = ____, orient = "h")
plt.show()
# Show states with extreme values in various columns
print(states_hr.nlargest(1, ____).squeeze())
print(states_hr.nsmallest(____).____)
print(____)