เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

เปรียบเทียบภาพยนตร์ทั้งหมดด้วย TF-IDF

หลังจากที่ได้เตรียมข้อมูล TF-IDF ให้พร้อมใช้งานแล้ว ถึงเวลานำมันมาใช้จริงเพื่อหาความคล้ายคลึงและสร้างคำแนะนำ

เนื่องจากคะแนน TF-IDF เป็นค่าทศนิยม (float) ไม่ใช่ค่าบูลีน จึงใช้ cosine similarity เป็นเมตริกในการวัดความคล้ายคลึงระหว่างรายการ ในแบบฝึกหัดนี้ จะสร้างเมทริกซ์ของค่า cosine similarity ระหว่างภาพยนตร์ทุกเรื่อง และจัดเก็บไว้ใน DataFrame เพื่อให้ค้นหาได้สะดวก ซึ่งจะช่วยให้เปรียบเทียบภาพยนตร์และหาคำแนะนำได้อย่างรวดเร็ว

โหลด DataFrame tfidf_df ที่สร้างไว้ในแบบฝึกหัดก่อนหน้า ซึ่งมีแถวสำหรับภาพยนตร์แต่ละเรื่อง ไว้ให้แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การสร้าง Recommendation Engine ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • คำนวณค่า cosine similarity ระหว่างภาพยนตร์ทุกเรื่อง แล้วกำหนดผลลัพธ์ให้กับตัวแปร cosine_similarity_array
  • สร้าง DataFrame จาก cosine_similarity_array โดยใช้ tfidf_summary_df.index เป็นทั้งแถวและคอลัมน์
  • แสดง 5 แถวแรกของ DataFrame และตรวจสอบค่าคะแนนความคล้ายคลึง

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import cosine_similarity measure
from sklearn.metrics.pairwise import ____

# Create the array of cosine similarity values
cosine_similarity_array = ____(tfidf_summary_df)

# Wrap the array in a pandas DataFrame
cosine_similarity_df = pd.____(cosine_similarity_array, ____=____.____, ____=____.____)

# Print the top 5 rows of the DataFrame
print(cosine_similarity_df.head())
แก้ไขและรันโค้ด