DataFrames पर SQL चलाना
PySpark में SQL क्वेरियों के जरिए DataFrames को आसानी से मैनीपुलेट किया जा सकता है। SparkSession की .sql() मेथड एप्लिकेशन को प्रोग्रामेटिक तरीके से SQL क्वेरियाँ चलाने देती है और परिणाम एक दूसरे DataFrame के रूप में लौटाती है। इस अभ्यास में, आप पहले से बनाए गए एक DataFrame की अस्थायी टेबल बनाएँगे, फिर अस्थायी टेबल से लोगों के नाम चुनने की क्वेरी बनाएँगे और परिणाम को एक नए DataFrame में असाइन करेंगे।
ध्यान रखें, आपके वर्कस्पेस में पहले से SparkSession spark और DataFrame df उपलब्ध हैं।
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark परिचय
अभ्यास निर्देश
dfDataFrame से"people"नाम की अस्थायी टेबल बनाएँ।- अस्थायी टेबल
peopleसे लोगों के नाम चुनने की क्वेरी बनाएँ। - Spark की क्वेरी के परिणाम को
people_df_namesनाम के नए DataFrame में असाइन करें। people_df_namesDataFrame से शीर्ष 10 लोगों के नाम प्रिंट करें।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create a temporary table "people"
df.____("people")
# Select the names from the temporary table people
query = """SELECT name FROM ____"""
# Assign the result of Spark's query to people_df_names
people_df_names = spark.sql(____)
# Print the top 10 names of the people
people_df_names.____(____)