शुरू करेंमुफ़्त में शुरू करें

टेबिल को फ़िल्टर करने के लिए SQL क्वेरीज़

पिछले अभ्यास में, आपने एक DataFrame पर एक सरल SQL क्वेरी चलाई थी। आप और भी परिष्कृत क्वेरीज़ बना सकते हैं ताकि मनचाहा परिणाम मिल सके और उसे आगे के विश्लेषण, जैसे डेटा विज़ुअलाइज़ेशन और मशीन लर्निंग, में उपयोग कर सकें। इस अभ्यास में, हम पहले से बनाई गई अस्थायी टेबल people का उपयोग करेंगे, उन पंक्तियों को फ़िल्टर करेंगे जहाँ "sex" male और female है, और दो DataFrames बनाएँगे।

कृपया ध्यान दें, SQL कमांड्स के लिए "solution" case sensitive है (उदाहरण के लिए, यह केवल FROM स्वीकार करता है, from नहीं)। "solution" केवल "==" स्वीकार करता है, "=" नहीं।

याद रखिए, आपके वर्कस्पेस में SparkSession spark और अस्थायी टेबल people पहले से उपलब्ध हैं।

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Big Data Fundamentals

पाठ्यक्रम देखें

अभ्यास निर्देश

  • people टेबल को फ़िल्टर करके वे सभी पंक्तियाँ चुनें जहाँ sex female है, और उन्हें people_female_df DataFrame में रखें।
  • people टेबल को फ़िल्टर करके वे सभी पंक्तियाँ चुनें जहाँ sex male है, और उन्हें people_male_df DataFrame में रखें।
  • people_female और people_male दोनों DataFrames में पंक्तियों की संख्या गिनें।

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Filter the people table to select female sex 
people_female_df = spark.____('SELECT * FROM ____ WHERE sex=="____"')

# Filter the people table DataFrame to select male sex
people_male_df = spark.____('SELECT * ____ people ____ ____=="____"')

# Count the number of rows in both people_df_female and people_male_df DataFrames
print("There are {} rows in the people_female_df and {} rows in the people_male_df DataFrames".format(people_female_df.____(), people_male_df.____()))
कोड संपादित करें और चलाएँ