अपने DataFrame को फ़िल्टर करना
पिछले अभ्यास में, आपने select() ऑपरेटर का उपयोग करके डेटा को सबसेट किया था, जो मुख्य रूप से DataFrame को कॉलम-वाइज सबसेट करने के लिए उपयोग होता है। अगर आप किसी कंडीशन के आधार पर DataFrame को सबसेट करना चाहें (जैसे, वे सभी पंक्तियाँ चुनना जहाँ sex Female है) तो क्या करेंगे? इस अभ्यास में, आप people_df DataFrame की उन पंक्तियों को फ़िल्टर करेंगे जिनमें 'sex' female और male है, और दो अलग-अलग डेटासेट बनाएँगे। अंत में, आप इन दोनों डेटासेट में पंक्तियों की संख्या गिनेंगे।
ध्यान रखें, आपके वर्कस्पेस में पहले से एक SparkSession spark और एक DataFrame people_df मौजूद है।
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Big Data Fundamentals
अभ्यास निर्देश
people_dfDataFrame को फ़िल्टर करके वे सभी पंक्तियाँ चुनें जहाँ sex female है, और उन्हेंpeople_df_femaleDataFrame में रखें।people_dfDataFrame को फ़िल्टर करके वे सभी पंक्तियाँ चुनें जहाँ sex male है, और उन्हेंpeople_df_maleDataFrame में रखें।people_df_femaleऔरpeople_df_maleDataFrames में पंक्तियों की संख्या गिनें।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Filter people_df to select females
people_df_female = people_df.____(people_df.____ == "female")
# Filter people_df to select males
people_df_male = people_df.____(____ == "____")
# Count the number of rows
print("There are {} rows in the people_df_female DataFrame and {} rows in the people_df_male DataFrame".format(people_df_female.____(), people_df_male.____()))