शुरू करेंमुफ़्त में शुरू करें

MovieLens सारांश सांख्यिकी

आइए groupBy() मेथड को थोड़ा और आगे बढ़ाते हैं.

जब आप किसी डेटाफ़्रेम पर .groupBy() मेथड लगाते हैं, तो आप उसके बाद .sum(), .avg(), .min() जैसी एग्रीगेट फंक्शन चला सकते हैं और उनके नतीजे ग्रुप हो जाते हैं. यह अभ्यास आपको दिखाएगा कि यह कैसे किया जाता है. आपके लिए pyspark.sql.functions से min और avg फंक्शन इम्पोर्ट कर दिए गए हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Recommendation Engines बनाना

पाठ्यक्रम देखें

अभ्यास निर्देश

  • डेटा को movieId के आधार पर group करें और .count() मेथड का उपयोग करके निकालें कि हर मूवी को कितनी ratings मिली हैं. इसके बाद, .select() मेथड कॉल करें और निम्नलिखित मेट्रिक्स चुनें:
    • min("count") ताकि पता चले कि डेटासेट में किसी भी मूवी को मिलने वाली ratings की न्यूनतम संख्या क्या है. पहला उदाहरण आपके लिए दिया गया है.
    • avg("count") ताकि प्रति मूवी ratings की औसत संख्या मिले
  • यही काम दोबारा करें, लेकिन इस बार userId के आधार पर group करें ताकि ratings की min और avg संख्या मिल सके.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Min num ratings for movies
print("Movie with the fewest ratings: ")
ratings.groupBy("movieId").count().select(min("count")).show()

# Avg num ratings per movie
print("Avg num ratings per movie: ")
____.groupBy("____").count().____(avg("____")).____()

# Min num ratings for user
print("User with the fewest ratings: ")
ratings.____("userId").____().select(____("____")).____()

# Avg num ratings per users
print("Avg num ratings per user: ")
____.____("____").____().____(____("____")).____()
कोड संपादित करें और चलाएँ