โจมตีแบบผสม!
ได้เรียนรู้การจัดการข้อมูล 4 รูปแบบที่ใช้บ่อยที่สุดไปแล้ว ได้แก่ การเรียงลำดับแถว การเลือกคอลัมน์ การกรองแถว และการเพิ่มคอลัมน์ใหม่ ในการวิเคราะห์ข้อมูลจริง สามารถนำทั้ง 4 วิธีนี้มาผสมผสานกันเพื่อตอบคำถามได้หลากหลาย
ในแบบฝึกหัดนี้ จะตอบคำถามว่า "รัฐใดมีจำนวนผู้ไร้บ้านต่อประชากร 10,000 คนสูงที่สุด?" ลองนำทักษะ pandas ที่เพิ่งเรียนมาใช้ดูกัน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การจัดการข้อมูลด้วย pandas
คำแนะนำการฝึกหัด
- เพิ่มคอลัมน์
indiv_per_10kลงในhomelessnessโดยคำนวณจำนวนผู้ไร้บ้านต่อประชากรหนึ่งหมื่นคนในแต่ละรัฐ โดยใช้state_popเป็นจำนวนประชากรของรัฐ - กรองแถวที่
indiv_per_10kมีค่ามากกว่า20แล้วกำหนดผลลัพธ์ให้กับตัวแปรhigh_homelessness - เรียงลำดับ
high_homelessnessตามindiv_per_10kจากมากไปน้อย แล้วกำหนดผลลัพธ์ให้กับตัวแปรhigh_homelessness_srt - เลือกเฉพาะคอลัมน์
stateและindiv_per_10kจากhigh_homelessness_srtแล้วบันทึกเป็นresultดูผลลัพธ์ในresult
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create indiv_per_10k col as homeless individuals per 10k state pop
homelessness["indiv_per_10k"] = 10000 * ____ / ____
# Subset rows for indiv_per_10k greater than 20
high_homelessness = ____
# Sort high_homelessness by descending indiv_per_10k
high_homelessness_srt = ____
# From high_homelessness_srt, select the state and indiv_per_10k cols
result = ____
# See the result
print(result)