ค้นหาคำที่พบบ่อยที่สุด
หลังจากสร้างฟีเจอร์แล้ว ควรตรวจสอบผลลัพธ์เสมอเพื่อให้แน่ใจว่าข้อมูลเป็นไปตามที่คาดหวัง วิธีนี้ช่วยให้จับข้อผิดพลาดได้ตั้งแต่เนิ่นๆ และอาจช่วยกำหนดทิศทางของการทำ feature engineering ในขั้นตอนถัดไปด้วย
ใน workspace มี vectorizer (cv) ที่ fit ไว้จากแบบฝึกหัดก่อนหน้า และ sparse array ของจำนวนคำ (cv_trigram) พร้อมใช้งานแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering สำหรับ Machine Learning ใน Python
คำแนะนำการฝึกหัด
- สร้าง DataFrame จากฟีเจอร์ (จำนวนคำ)
- รวมจำนวนการปรากฏของแต่ละคำ แล้วแสดง 5 คำที่พบบ่อยที่สุด
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create a DataFrame of the features
cv_tri_df = ____(____,
columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')
# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())