เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

สร้าง TF-IDF Model

โดยค่าเริ่มต้น TF-IDF จะสร้างคอลัมน์สำหรับทุกคำในเอกสารทั้งหมด (ในกรณีนี้คือเรื่องย่อของภาพยนตร์) ซึ่งทำให้ได้ชุดข้อมูลที่ใหญ่มากและไม่เป็นระเบียบ เนื่องจากจะมีทั้งคำที่พบบ่อยมากในทุกเอกสาร และคำที่พบน้อยมากจนไม่มีประโยชน์ในการหาความคล้ายคลึงระหว่างรายการต่าง ๆ

ในแบบฝึกหัดนี้ จะได้ทำงานกับ DataFrame ชื่อ df_plots ซึ่งเก็บชื่อภาพยนตร์ไว้ในคอลัมน์ Title และเรื่องย่อไว้ในคอลัมน์ Plot

จากนั้นจะใช้ DataFrame นี้เพื่อสร้างค่า TF-IDF แบบค่าเริ่มต้น และตรวจสอบว่ามีคอลัมน์ที่ไม่มีประโยชน์ปรากฏอยู่หรือไม่

แล้วจึงรันการคำนวณ TF-IDF อีกครั้ง คราวนี้จะจำกัดจำนวนคอลัมน์โดยใช้อาร์กิวเมนต์ min_df และ max_df เพื่อดูความแตกต่างที่เกิดขึ้น

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การสร้าง Recommendation Engine ด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

from sklearn.feature_extraction.text import TfidfVectorizer

# Instantiate the vectorizer object to the vectorizer variable
vectorizer = ____()

# Fit and transform the plot column
vectorized_data = vectorizer.____(df_plots['Plot'])

# Look at the features generated
print(____.____())
แก้ไขและรันโค้ด