शुरू करेंमुफ़्त में शुरू करें

अनुमान लगाएँ और फ़िल्टर करें

मान लीजिए आपके पास एक census डेटासेट है, जिसके बारे में आपको पता है कि उसमें header और schema है। आइए उस डेटासेट को लोड करें और PySpark को schema infer करने दें। अगर आप 40 से अधिक उम्र के वयस्कों पर फ़िल्टर करें, तो आपको क्या दिखाई देता है?

याद रखें, आपके वर्कस्पेस में पहले से एक SparkSession मौजूद है जिसका नाम spark है!

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

  • adults.json नाम की JSON फ़ाइल लोड करें.
  • डेटा को फ़िल्टर करें ताकि केवल वे वयस्क शामिल हों जिनकी age 40 से अधिक है.
  • परिणाम दिखाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Load the dataframe
census_df = spark.read.json("adults.json")

# Filter rows based on age condition
salary_filtered_census = census_df.____(census_df[____]____)

# Show the result
____
कोड संपादित करें और चलाएँ