เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การจัดการกับหมวดหมู่ที่พบไม่บ่อย

ฟีเจอร์บางอย่างอาจมีหมวดหมู่จำนวนมาก แต่การกระจายตัวของข้อมูลในแต่ละหมวดหมู่กลับไม่สม่ำเสมอ ตัวอย่างเช่น ภาษาที่นักวิทยาศาสตร์ข้อมูลนิยมใช้เขียนโค้ด เช่น Python, R และ Julia ซึ่งเป็นตัวเลือกยอดนิยม แต่ก็มีบางคนที่เลือกใช้ภาษาเฉพาะทาง เช่น FORTRAN หรือ C เป็นต้น ในกรณีเช่นนี้ แทนที่จะสร้างฟีเจอร์สำหรับทุกค่า ควรเลือกเฉพาะหมวดหมู่ที่พบบ่อยเท่านั้น

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering สำหรับ Machine Learning ใน Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create a series out of the Country column
countries = so_survey_df.____

# Get the counts of each category
country_counts = countries.____

# Print the count values for each category
print(country_counts)
แก้ไขและรันโค้ด