เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ค้นหาคำที่พบบ่อยที่สุด

หลังจากสร้างฟีเจอร์แล้ว ควรตรวจสอบผลลัพธ์เสมอเพื่อให้แน่ใจว่าข้อมูลเป็นไปตามที่คาดหวัง วิธีนี้ช่วยให้จับข้อผิดพลาดได้ตั้งแต่เนิ่นๆ และอาจช่วยกำหนดทิศทางของการทำ feature engineering ในขั้นตอนถัดไปด้วย

ใน workspace มี vectorizer (cv) ที่ fit ไว้จากแบบฝึกหัดก่อนหน้า และ sparse array ของจำนวนคำ (cv_trigram) พร้อมใช้งานแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering สำหรับ Machine Learning ใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง DataFrame จากฟีเจอร์ (จำนวนคำ)
  • รวมจำนวนการปรากฏของแต่ละคำ แล้วแสดง 5 คำที่พบบ่อยที่สุด

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create a DataFrame of the features
cv_tri_df = ____(____, 
                 columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')

# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())
แก้ไขและรันโค้ด