สร้าง TF-IDF Model
โดยค่าเริ่มต้น TF-IDF จะสร้างคอลัมน์สำหรับทุกคำในเอกสารทั้งหมด (ในกรณีนี้คือเรื่องย่อของภาพยนตร์) ซึ่งทำให้ได้ชุดข้อมูลที่ใหญ่มากและไม่เป็นระเบียบ เนื่องจากจะมีทั้งคำที่พบบ่อยมากในทุกเอกสาร และคำที่พบน้อยมากจนไม่มีประโยชน์ในการหาความคล้ายคลึงระหว่างรายการต่าง ๆ
ในแบบฝึกหัดนี้ จะได้ทำงานกับ DataFrame ชื่อ df_plots ซึ่งเก็บชื่อภาพยนตร์ไว้ในคอลัมน์ Title และเรื่องย่อไว้ในคอลัมน์ Plot
จากนั้นจะใช้ DataFrame นี้เพื่อสร้างค่า TF-IDF แบบค่าเริ่มต้น และตรวจสอบว่ามีคอลัมน์ที่ไม่มีประโยชน์ปรากฏอยู่หรือไม่
แล้วจึงรันการคำนวณ TF-IDF อีกครั้ง คราวนี้จะจำกัดจำนวนคอลัมน์โดยใช้อาร์กิวเมนต์ min_df และ max_df เพื่อดูความแตกต่างที่เกิดขึ้น
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การสร้าง Recommendation Engine ด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
from sklearn.feature_extraction.text import TfidfVectorizer
# Instantiate the vectorizer object to the vectorizer variable
vectorizer = ____()
# Fit and transform the plot column
vectorized_data = vectorizer.____(df_plots['Plot'])
# Look at the features generated
print(____.____())