शुरू करेंमुफ़्त में शुरू करें

Are you query-ious?

DataFrame इंटरफ़ेस का एक फ़ायदा यह है कि आप अपने Spark क्लस्टर की टेबल्स पर SQL क्वेरी चला सकते हैं। अगर आपके पास SQL का अनुभव नहीं है तो चिंता न करें — हम आपको क्वेरी देंगे! (SQL और सीखने के लिए, हमारे Introduction to SQL कोर्स से शुरू कीजिए.)

पिछले अभ्यास में आपने देखा था कि आपके क्लस्टर में flights नाम की एक टेबल है। इस टेबल में हर उस फ्लाइट की एक पंक्ति है जो 2014 और 2015 में Portland International Airport (PDX) या Seattle-Tacoma International Airport (SEA) से उड़ी थी।

इस टेबल पर क्वेरी चलाना उतना ही आसान है जितना कि अपनी SparkSession पर .sql() मेथड का इस्तेमाल करना। यह मेथड क्वेरी वाली एक string लेता है और परिणामों के साथ एक DataFrame लौटाता है!

ध्यान से देखें तो पाएँगे कि क्वेरी में सिर्फ flights टेबल का उल्लेख है, किसी मेथड के आर्ग्युमेंट के रूप में नहीं। इसका कारण है कि आपके environment में उस डेटा को रखने वाला कोई local ऑब्जेक्ट नहीं है, इसलिए टेबल को आर्ग्युमेंट की तरह पास करना उचित नहीं होगा।

ध्यान रखें, आपके workspace में हमने पहले से spark नाम की एक SparkSession बना दी है। (अब इसे my_spark नहीं कहते क्योंकि यह हमने आपके लिए तैयार की है!)

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark की नींव

पाठ्यक्रम देखें

अभ्यास निर्देश

  • .sql() मेथड का उपयोग करके flights टेबल की पहली 10 पंक्तियाँ निकालें और परिणाम को flights10 में सेव करें। वैरिएबल query में उपयुक्त SQL क्वेरी है।
  • DataFrame मेथड .show() का उपयोग करके flights10 प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Don't change this query
query = "FROM flights SELECT * LIMIT 10"

# Get the first 10 rows of flights
flights10 = ____

# Show the results
flights10.____
कोड संपादित करें और चलाएँ