शुरू करेंमुफ़्त में शुरू करें

SQL और Parquet

Spark में SQL क्वेरीज़ के लिए Parquet फ़ाइलें बैकिंग डेटा स्टोर के रूप में बेहतरीन होती हैं. हालाँकि वही क्वेरीज़ सीधे Spark की Python फंक्शंस से चलाना संभव है, कई बार Python विकल्पों के साथ SQL क्वेरी चलाना ज़्यादा आसान रहता है.

इस उदाहरण में, आप पिछली एक्सरसाइज़ में बनाई गई Parquet फ़ाइल को पढ़ेंगे और उसे एक SQL टेबल के रूप में रजिस्टर करेंगे. रजिस्टर होने के बाद, हम उस टेबल (यानी Parquet फ़ाइल) पर एक छोटी-सी क्वेरी चलाएँगे.

spark ऑब्जेक्ट और AA_DFW_ALL.parquet फ़ाइल आपके लिए पहले से उपलब्ध हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ डेटा क्लीनिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • AA_DFW_ALL.parquet फ़ाइल को flights_df में इम्पोर्ट करें.
  • createOrReplaceTempView मेथड का उपयोग करके टेबल का नाम flights रखें.
  • flights टेबल पर एक Spark SQL क्वेरी चलाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Read the Parquet file into flights_df
flights_df = spark.read.____(____)

# Register the temp table
flights_df.____('flights')

# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)
कोड संपादित करें और चलाएँ