शुरू करेंमुफ़्त में शुरू करें

समय घटकों पर Joining

अक्सर आप अन्य जानकारी के सेट से जोड़ने के लिए date components का उपयोग करेंगे। लेकिन इस उदाहरण में, हमें वही डेटा चाहिए जो घर खरीदने पर विचार कर रहे लोगों के पास उपलब्ध होता। इसका मतलब है कि अपने विश्लेषण के लिए हमें पिछले वर्ष के रिपोर्टिंग डेटा का उपयोग करना होगा।

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • LISTDATE से year() का उपयोग करके year निकालें और withColumn() के साथ उसे list_year नाम के नए कॉलम में रखें
  • list_year में से 1 घटाकर report_year नाम का एक और नया कॉलम बनाएँ
  • ऐसा join condition बनाएँ जो df['CITY'] को price_df['City'] से और df['report_year'] को price_df['Year'] से मिलाए
  • df और price_df के बीच एक left join करें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

from pyspark.sql.functions import year

# Initialize dataframes
df = real_estate_df
price_df = median_prices_df

# Create year column
df = df.____(____, ____(____))

# Adjust year to match
df = df.withColumn(____, (df[____] - 1))

# Create join condition
condition = [df[____] == price_df[____], df[____] == price_df[____]]

# Join the dataframes together
df = ____.join(____, on=condition, how=____)
# Inspect that new columns are available
df[['MedianHomeValue']].show()
कोड संपादित करें और चलाएँ