Ratings के डेटा टाइप्स
Markus बहुत सी फ़िल्में देखते हैं — डॉक्यूमेंट्री, सुपरहीरो मूवीज़, क्लासिक्स, और ड्रामा तक. Spark के अपने पिछले अनुभव का उपयोग करते हुए markus_ratings डेटाफ़्रेम का इस्तेमाल कीजिए, जिसमें अलग-अलग जेनर में Markus ने कितनी बार फ़िल्में देखीं उसका डेटा है, और सोचिए कि ये implicit हैं या explicit ratings. groupBy() मेथड का उपयोग करके यह निर्धारित करें कि किस जेनर की रेटिंग सबसे अधिक है, जो संभवतः यह प्रभावित करेगा कि ALS Markus के लिए क्या सिफारिशें जनरेट करेगा.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Recommendation Engines बनाना
अभ्यास निर्देश
groupBy()मेथड का उपयोग करकेmarkus_ratingsडेटाफ़्रेम को"Genre"के अनुसार group करें.- हर जेनर के लिए देखी गई फ़िल्मों की कुल संख्या पाने के लिए
.sum()मेथड लगाएँ. - काउंट देखने के लिए अंत में
.show()मेथड ज़रूर जोड़ें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Group the data by "Genre"
markus_ratings.____("____").____().____()