ความเบาบางของเมทริกซ์
ความท้าทายที่พบบ่อยในข้อมูลการให้คะแนนในโลกจริงคือ ผู้ใช้ส่วนใหญ่จะไม่ได้ให้คะแนนไว้ครบทุกรายการ และแต่ละรายการก็มักจะมีผู้ใช้เพียงไม่กี่คนที่ให้คะแนน ทำให้ได้ DataFrame ที่มีข้อมูลกระจัดกระจายหรือที่เรียกว่า sparse
ในแบบฝึกหัดนี้ จะคำนวณระดับความเบาบาง (sparsity) ของข้อมูลการให้คะแนนใน movie_lens โดยนับจำนวนเซลล์ที่มีข้อมูลและเปรียบเทียบกับขนาดทั้งหมดของ DataFrame
โดย DataFrame ชื่อ user_ratings_df ที่ใช้ในแบบฝึกหัดก่อนหน้า ซึ่งมีแถวแทนผู้ใช้และคอลัมน์แทนภาพยนตร์แต่ละเรื่อง ได้ถูกโหลดไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การสร้าง Recommendation Engine ด้วย Python
คำแนะนำการฝึกหัด
- นับจำนวนเซลล์ที่ไม่ว่างเปล่าใน
user_ratings_dfและเก็บผลลัพธ์ไว้ในตัวแปรsparsity_count - นับจำนวนเซลล์ทั้งหมดใน DataFrame
user_ratings_dfและเก็บไว้ในตัวแปรfull_count - คำนวณค่า sparsity ของ DataFrame โดยหารจำนวนเซลล์ที่มีข้อมูลด้วยจำนวนเซลล์ทั้งหมด แล้วแสดงผลลัพธ์
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Count the occupied cells
sparsity_count = user_ratings_df.____().____.____()
# Count all cells
full_count = user_ratings_df.____
# Find the sparsity of the DataFrame
sparsity = ____ / ____
print(sparsity)