शुरू करेंमुफ़्त में शुरू करें

Aggregate dot SQL

नीचे दिया गया कोड SQL का उपयोग करके df नाम के एक dataframe का मान सेट करता है.

df = spark.sql("""
SELECT *, 
LEAD(time,1) OVER(PARTITION BY train_id ORDER BY time) AS time_next 
FROM schedule
""")
  • LEAD क्लॉज़ का एक समकक्ष फंक्शन pyspark.sql.functions में उपलब्ध है.
  • PARTITION BY और ORDER BY क्लॉज़ के लिए डॉट नोटेशन में समकक्ष फंक्शन होते हैं, जिन्हें Window ऑब्जेक्ट पर कॉल किया जाता है.
  • निम्नलिखित इम्पोर्ट उपलब्ध हैं:
    • from pyspark.sql import Window
    • from pyspark.sql.functions import lead

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Spark SQL परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

  • SQL की जगह डॉट नोटेशन का उपयोग करते हुए, df जैसा ही परिणाम देने वाला dot_df नाम का एक dataframe बनाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Obtain the identical result using dot notation 
dot_df = df.withColumn('time_next', ____('time', 1)
        .over(____.____('train_id')
        .____('time')))
कोड संपादित करें और चलाएँ