शुरू करेंमुफ़्त में शुरू करें

अपने DataFrame को फ़िल्टर करना

पिछले अभ्यास में, आपने select() ऑपरेटर का उपयोग करके डेटा को सबसेट किया था, जो मुख्य रूप से DataFrame को कॉलम-वाइज सबसेट करने के लिए उपयोग होता है। अगर आप किसी कंडीशन के आधार पर DataFrame को सबसेट करना चाहें (जैसे, वे सभी पंक्तियाँ चुनना जहाँ sex Female है) तो क्या करेंगे? इस अभ्यास में, आप people_df DataFrame की उन पंक्तियों को फ़िल्टर करेंगे जिनमें 'sex' female और male है, और दो अलग-अलग डेटासेट बनाएँगे। अंत में, आप इन दोनों डेटासेट में पंक्तियों की संख्या गिनेंगे।

ध्यान रखें, आपके वर्कस्पेस में पहले से एक SparkSession spark और एक DataFrame people_df मौजूद है।

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Big Data Fundamentals

पाठ्यक्रम देखें

अभ्यास निर्देश

  • people_df DataFrame को फ़िल्टर करके वे सभी पंक्तियाँ चुनें जहाँ sex female है, और उन्हें people_df_female DataFrame में रखें।
  • people_df DataFrame को फ़िल्टर करके वे सभी पंक्तियाँ चुनें जहाँ sex male है, और उन्हें people_df_male DataFrame में रखें।
  • people_df_female और people_df_male DataFrames में पंक्तियों की संख्या गिनें।

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Filter people_df to select females 
people_df_female = people_df.____(people_df.____ == "female")

# Filter people_df to select males
people_df_male = people_df.____(____ == "____")

# Count the number of rows 
print("There are {} rows in the people_df_female DataFrame and {} rows in the people_df_male DataFrame".format(people_df_female.____(), people_df_male.____()))
कोड संपादित करें और चलाएँ