टेबिल को फ़िल्टर करने के लिए SQL क्वेरीज़
पिछले अभ्यास में, आपने एक DataFrame पर एक सरल SQL क्वेरी चलाई थी। आप और भी परिष्कृत क्वेरीज़ बना सकते हैं ताकि मनचाहा परिणाम मिल सके और उसे आगे के विश्लेषण, जैसे डेटा विज़ुअलाइज़ेशन और मशीन लर्निंग, में उपयोग कर सकें। इस अभ्यास में, हम पहले से बनाई गई अस्थायी टेबल people का उपयोग करेंगे, उन पंक्तियों को फ़िल्टर करेंगे जहाँ "sex" male और female है, और दो DataFrames बनाएँगे।
कृपया ध्यान दें, SQL कमांड्स के लिए "solution" case sensitive है (उदाहरण के लिए, यह केवल FROM स्वीकार करता है, from नहीं)। "solution" केवल "==" स्वीकार करता है, "=" नहीं।
याद रखिए, आपके वर्कस्पेस में SparkSession spark और अस्थायी टेबल people पहले से उपलब्ध हैं।
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Big Data Fundamentals
अभ्यास निर्देश
peopleटेबल को फ़िल्टर करके वे सभी पंक्तियाँ चुनें जहाँ sex female है, और उन्हेंpeople_female_dfDataFrame में रखें।peopleटेबल को फ़िल्टर करके वे सभी पंक्तियाँ चुनें जहाँ sex male है, और उन्हेंpeople_male_dfDataFrame में रखें।people_femaleऔरpeople_maleदोनों DataFrames में पंक्तियों की संख्या गिनें।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Filter the people table to select female sex
people_female_df = spark.____('SELECT * FROM ____ WHERE sex=="____"')
# Filter the people table DataFrame to select male sex
people_male_df = spark.____('SELECT * ____ people ____ ____=="____"')
# Count the number of rows in both people_df_female and people_male_df DataFrames
print("There are {} rows in the people_female_df and {} rows in the people_male_df DataFrames".format(people_female_df.____(), people_male_df.____()))