RDDs को Collect करना
इस अभ्यास में, आप PySpark में RDDs और DataFrames दोनों के साथ काम करेंगे. उद्देश्य यह है कि डेटा को group करें और aggregation को RDD operations और DataFrame methods, दोनों से करें.
आप एक CSV फ़ाइल जिसमें employee salary डेटा है, उसे PySpark में RDD के रूप में लोड करेंगे. फिर आप experience level के आधार पर group करेंगे और प्रत्येक experience level के लिए अधिकतम वेतन को DataFrame से calculate करेंगे. ऐसा करने पर, आप दोनों डेटा फ़ॉर्मैट्स की relative strengths को देख पाएँगे.
जो डेटासेट आप उपयोग कर रहे हैं वह Data Scientist Salaries से संबंधित है, इसलिए मार्केट ट्रेंड्स ढूँढना आपके हित में है! हमने आपके लिए डेटा पहले से लोड और normalize कर दिया है! याद रखें, आपके workspace में spark नाम का एक SparkSession पहले से मौजूद है!
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark परिचय
अभ्यास निर्देश
- एक DataFrame से RDD बनाएँ.
- RDD और DataFrame, दोनों के परिणाम collect करें और दिखाएँ.
"experience_level"के आधार पर group करें और प्रत्येक के लिए अधिकतम वेतन calculate करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____
# Collect and print the results
print(rdd_salaries.____)
# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})
# Show the results
dataframe_results.____