GroupBy और Filter मेथड्स
अब जब हमें डेटासेट के बारे में थोड़ा और पता है, तो आइए ratings डेटासेट के कुछ सामान्य सारांश मेट्रिक्स देखें और जानें कि फिल्मों के पास कितनी रेटिंग्स हैं और हर यूज़र ने कितनी रेटिंग्स दी हैं.
Spark में सारांश सांख्यिकी को एग्रीगेट करते समय आपके लिए उपयोगी दो सामान्य मेथड्स हैं: .filter() और .groupBy(). .filter() मेथड आपको आपके तय मानदंडों को पूरा न करने वाले डेटा को हटा देने देता है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Recommendation Engines बनाना
अभ्यास निर्देश
pyspark.sql.functionsसेcolइम्पोर्ट करें, और.show()का उपयोग करकेratingsडेटासेट देखें.- पेरेंथेसिस के अंदर दिए गए इस फ़िल्टर के साथ
ratingsडेटासेट पर.filter()मेथड लगाएँ ताकि केवल वेuserIdशामिल हों जो 100 से कम हैं:col("userId") < 100. - डेटा को
userIdके आधार पर ग्रुप करने के लिएratingsडेटासेट पर.groupBy()मेथड कॉल करें. प्रत्येकuserIdने कितनी फ़िल्मों को रेट किया है, यह देखने के लिए.count()मेथड कॉल करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import the requisite packages
from pyspark.sql.____ import ____
# View the ratings dataset
____.____()
# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()
# Group data by userId, count ratings
ratings.____("____").count().show()