अनुमान लगाएँ और फ़िल्टर करें
मान लीजिए आपके पास एक census डेटासेट है, जिसके बारे में आपको पता है कि उसमें header और schema है। आइए उस डेटासेट को लोड करें और PySpark को schema infer करने दें। अगर आप 40 से अधिक उम्र के वयस्कों पर फ़िल्टर करें, तो आपको क्या दिखाई देता है?
याद रखें, आपके वर्कस्पेस में पहले से एक SparkSession मौजूद है जिसका नाम spark है!
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark परिचय
अभ्यास निर्देश
adults.jsonनाम की JSON फ़ाइल लोड करें.- डेटा को फ़िल्टर करें ताकि केवल वे वयस्क शामिल हों जिनकी
age40से अधिक है. - परिणाम दिखाएँ.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load the dataframe
census_df = spark.read.json("adults.json")
# Filter rows based on age condition
salary_filtered_census = census_df.____(census_df[____]____)
# Show the result
____