เปรียบเทียบภาพยนตร์ทั้งหมดด้วย TF-IDF
หลังจากที่ได้เตรียมข้อมูล TF-IDF ให้พร้อมใช้งานแล้ว ถึงเวลานำมันมาใช้จริงเพื่อหาความคล้ายคลึงและสร้างคำแนะนำ
เนื่องจากคะแนน TF-IDF เป็นค่าทศนิยม (float) ไม่ใช่ค่าบูลีน จึงใช้ cosine similarity เป็นเมตริกในการวัดความคล้ายคลึงระหว่างรายการ ในแบบฝึกหัดนี้ จะสร้างเมทริกซ์ของค่า cosine similarity ระหว่างภาพยนตร์ทุกเรื่อง และจัดเก็บไว้ใน DataFrame เพื่อให้ค้นหาได้สะดวก ซึ่งจะช่วยให้เปรียบเทียบภาพยนตร์และหาคำแนะนำได้อย่างรวดเร็ว
โหลด DataFrame tfidf_df ที่สร้างไว้ในแบบฝึกหัดก่อนหน้า ซึ่งมีแถวสำหรับภาพยนตร์แต่ละเรื่อง ไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การสร้าง Recommendation Engine ด้วย Python
คำแนะนำการฝึกหัด
- คำนวณค่า cosine similarity ระหว่างภาพยนตร์ทุกเรื่อง แล้วกำหนดผลลัพธ์ให้กับตัวแปร
cosine_similarity_array - สร้าง DataFrame จาก
cosine_similarity_arrayโดยใช้tfidf_summary_df.indexเป็นทั้งแถวและคอลัมน์ - แสดง 5 แถวแรกของ DataFrame และตรวจสอบค่าคะแนนความคล้ายคลึง
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import cosine_similarity measure
from sklearn.metrics.pairwise import ____
# Create the array of cosine similarity values
cosine_similarity_array = ____(tfidf_summary_df)
# Wrap the array in a pandas DataFrame
cosine_similarity_df = pd.____(cosine_similarity_array, ____=____.____, ____=____.____)
# Print the top 5 rows of the DataFrame
print(cosine_similarity_df.head())