เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การเลือกฟีเจอร์ที่เกี่ยวข้อง

ในแบบฝึกหัดนี้ จะต้องระบุคอลัมน์ที่ซ้ำซ้อนในชุดข้อมูล volunteer แล้วทำการ feature selection เพื่อให้ได้ DataFrame ที่มีเฉพาะฟีเจอร์ที่เกี่ยวข้อง

ตัวอย่างเช่น เมื่อลองสำรวจชุดข้อมูล volunteer ใน console จะพบฟีเจอร์ 3 ตัวที่เกี่ยวกับตำแหน่งที่ตั้ง ได้แก่ locality, region, และ postalcode ซึ่งมีข้อมูลที่เกี่ยวเนื่องกัน จึงควรเก็บไว้เพียงฟีเจอร์เดียว

ลองใช้เวลาตรวจสอบฟีเจอร์ต่าง ๆ ของ volunteer ใน console เพื่อระบุฟีเจอร์ที่ซ้ำซ้อน

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การเตรียมข้อมูลสำหรับ Machine Learning ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้างรายการชื่อคอลัมน์ที่ซ้ำซ้อนและเก็บไว้ในตัวแปร to_drop:
    • จากฟีเจอร์ทั้งหมดที่เกี่ยวกับตำแหน่งที่ตั้ง ให้เก็บไว้เฉพาะ postalcode
    • ฟีเจอร์ที่ผ่านกระบวนการ feature engineering แล้วก็ถือว่าซ้ำซ้อนเช่นกัน
  • ลบคอลัมน์ใน to_drop ออกจากชุดข้อมูล
  • แสดงผล .head() ของ volunteer_subset เพื่อดูคอลัมน์ที่เลือกไว้

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create a list of redundant column names to drop
to_drop = ["____", "____", "____", "____", "____"]

# Drop those columns from the dataset
volunteer_subset = ____.____(____, ____)

# Print out the head of volunteer_subset
print(____)
แก้ไขและรันโค้ด