การจัดการกับหมวดหมู่ที่พบไม่บ่อย
ฟีเจอร์บางอย่างอาจมีหมวดหมู่จำนวนมาก แต่การกระจายตัวของข้อมูลในแต่ละหมวดหมู่กลับไม่สม่ำเสมอ ตัวอย่างเช่น ภาษาที่นักวิทยาศาสตร์ข้อมูลนิยมใช้เขียนโค้ด เช่น Python, R และ Julia ซึ่งเป็นตัวเลือกยอดนิยม แต่ก็มีบางคนที่เลือกใช้ภาษาเฉพาะทาง เช่น FORTRAN หรือ C เป็นต้น ในกรณีเช่นนี้ แทนที่จะสร้างฟีเจอร์สำหรับทุกค่า ควรเลือกเฉพาะหมวดหมู่ที่พบบ่อยเท่านั้น
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering สำหรับ Machine Learning ใน Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create a series out of the Country column
countries = so_survey_df.____
# Get the counts of each category
country_counts = countries.____
# Print the count values for each category
print(country_counts)