การสร้าง TF-IDF DataFrame
เมื่อสร้างฟีเจอร์ TF-IDF แล้ว ขั้นตอนต่อไปคือจัดรูปแบบข้อมูลให้พร้อมสำหรับการสร้างคำแนะนำ
ครั้งนี้จะใช้ pandas อีกครั้งโดยนำอาร์เรย์มาครอบด้วย DataFrame
เนื่องจากจะใช้ชื่อภาพยนตร์ในการกรองข้อมูล จึงสามารถกำหนดชื่อเรื่องให้เป็น index ของ DataFrame ได้
โหลด DataFrame df_plots ไว้ให้แล้ว โดยมีชื่อภาพยนตร์อยู่ในคอลัมน์ Title และเนื้อเรื่องอยู่ในคอลัมน์ Plot
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การสร้าง Recommendation Engine ด้วย Python
คำแนะนำการฝึกหัด
- สร้าง
TfidfVectorizerแล้ว fit และ transform เหมือนที่ทำในแบบฝึกหัดก่อนหน้า - นำ
vectorized_dataที่ได้มาครอบด้วย DataFrame โดยใช้ชื่อฟีเจอร์ที่สร้างในขั้นตอน fit และ transform เป็นชื่อคอลัมน์ และกำหนดให้ DataFrame ใหม่นี้เป็นtfidf_df - กำหนดชื่อภาพยนตร์ต้นฉบับให้เป็น index ของ DataFrame
tfidf_dfที่สร้างขึ้น
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
from sklearn.feature_extraction.text import TfidfVectorizer
# Instantiate the vectorizer object and transform the plot column
vectorizer = ____(max_df=0.7, min_df=2)
vectorized_data = vectorizer.____(df_plots['Plot'])
# Create Dataframe from TF-IDFarray
tfidf_df = pd.____(____.toarray(), columns=vectorizer.____())
# Assign the movie titles to the index and inspect
tfidf_df.____ = ____['Title']
print(tfidf_df.head())