प्रोग्रामैटिक तरीके से SQL क्वेरी चलाना
PySpark में SQL क्वेरी का उपयोग करके DataFrames को आसानी से मैनीपुलेट किया जा सकता है. SparkSession की sql() फंक्शन आपके एप्लिकेशन को प्रोग्रामैटिक रूप से SQL क्वेरी चलाने देती है और परिणाम एक अन्य DataFrame के रूप में लौटाती है. इस अभ्यास में, आप पहले से बनाए गए DataFrame की एक अस्थायी टेबल बनाएँगे, फिर अस्थायी टेबल से लोगों के नाम चुनने के लिए एक क्वेरी लिखेंगे और परिणाम को एक नए DataFrame में असाइन करेंगे.
ध्यान रखें, आपके वर्कस्पेस में पहले से एक SparkSession spark और एक DataFrame मौजूद है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Big Data Fundamentals
अभ्यास निर्देश
- एक अस्थायी टेबल
peopleबनाएँ. - अस्थायी टेबल
peopleसे लोगों के नाम चुनने के लिए एकqueryबनाएँ. - Spark की
queryके परिणाम को एक नए DataFrame -people_df_namesमें असाइन करें. people_df_namesDataFrame से लोगों के शीर्ष 10 नाम प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create a temporary table "people"
people_df.____("people")
# Construct a query to select the names of the people from the temporary table "people"
query = '''SELECT name FROM ____'''
# Assign the result of Spark's query to people_df_names
people_df_names = spark.sql(____)
# Print the top 10 names of the people
people_df_names.____(____)