การเลือกฟีเจอร์ที่เกี่ยวข้อง
ในแบบฝึกหัดนี้ จะต้องระบุคอลัมน์ที่ซ้ำซ้อนในชุดข้อมูล volunteer แล้วทำการ feature selection เพื่อให้ได้ DataFrame ที่มีเฉพาะฟีเจอร์ที่เกี่ยวข้อง
ตัวอย่างเช่น เมื่อลองสำรวจชุดข้อมูล volunteer ใน console จะพบฟีเจอร์ 3 ตัวที่เกี่ยวกับตำแหน่งที่ตั้ง ได้แก่ locality, region, และ postalcode ซึ่งมีข้อมูลที่เกี่ยวเนื่องกัน จึงควรเก็บไว้เพียงฟีเจอร์เดียว
ลองใช้เวลาตรวจสอบฟีเจอร์ต่าง ๆ ของ volunteer ใน console เพื่อระบุฟีเจอร์ที่ซ้ำซ้อน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การเตรียมข้อมูลสำหรับ Machine Learning ด้วย Python
คำแนะนำการฝึกหัด
- สร้างรายการชื่อคอลัมน์ที่ซ้ำซ้อนและเก็บไว้ในตัวแปร
to_drop:- จากฟีเจอร์ทั้งหมดที่เกี่ยวกับตำแหน่งที่ตั้ง ให้เก็บไว้เฉพาะ
postalcode - ฟีเจอร์ที่ผ่านกระบวนการ feature engineering แล้วก็ถือว่าซ้ำซ้อนเช่นกัน
- จากฟีเจอร์ทั้งหมดที่เกี่ยวกับตำแหน่งที่ตั้ง ให้เก็บไว้เฉพาะ
- ลบคอลัมน์ใน
to_dropออกจากชุดข้อมูล - แสดงผล
.head()ของvolunteer_subsetเพื่อดูคอลัมน์ที่เลือกไว้
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create a list of redundant column names to drop
to_drop = ["____", "____", "____", "____", "____"]
# Drop those columns from the dataset
volunteer_subset = ____.____(____, ____)
# Print out the head of volunteer_subset
print(____)