การเลือกชุดข้อมูลที่เหมาะสม
ถึงเวลากำจัดฟีเจอร์ที่ไม่จำเป็นออกจากชุดข้อมูล ufo แล้ว เนื่องจากคอลัมน์ country ถูกเข้ารหัสเป็น country_enc แล้ว จึงสามารถเก็บคอลัมน์นั้นไว้และตัดคอลัมน์ที่เกี่ยวข้องกับตำแหน่งที่ตั้งออก ได้แก่ city, country, lat, long, และ state
เนื่องจากได้สร้างคอลัมน์ month และ year ขึ้นมาแล้ว จึงไม่จำเป็นต้องใช้คอลัมน์ date หรือ recorded อีกต่อไป และเนื่องจากมีการ standardize คอลัมน์ seconds เป็น seconds_log แล้ว จึงสามารถตัดคอลัมน์ seconds และ minutes ออกได้
คอลัมน์ desc ถูก vectorize ไปแล้ว จึงสามารถลบออกได้ ส่วนคอลัมน์ type จะเก็บไว้ก่อน
นอกจากนี้ยังสามารถตัดคอลัมน์ length_of_time ออกได้ เนื่องจากไม่จำเป็นแล้วหลังจากดึงค่า minutes ออกมา
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การเตรียมข้อมูลสำหรับ Machine Learning ด้วย Python
คำแนะนำการฝึกหัด
- สร้างลิสต์ของคอลัมน์ทั้งหมดที่ต้องการตัดออก โดยเก็บไว้ในตัวแปร
to_drop - ตัดคอลัมน์เหล่านั้นออกจาก
ufo - ใช้ฟังก์ชัน
words_to_filter()ที่สร้างไว้ก่อนหน้านี้ โดยส่งvocab,vec.vocabulary_,desc_tfidfเข้าไป และกำหนดพารามิเตอร์สุดท้ายเป็น4เพื่อเก็บคำที่มีความสำคัญสูงสุด 4 คำ
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Make a list of features to drop
to_drop = [____]
# Drop those features
ufo_dropped = ufo.____
# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)