Zaman Bileşenleri Üzerinden Join
Çoğu zaman başka bilgi kümelerini birleştirmek için tarih bileşenlerini kullanırsın. Ancak bu örnekte, ev almayı düşünenlerin erişebileceği verileri kullanmamız gerekiyor. Bu da analizimiz için bir önceki yılın raporlama verilerini kullanacağımız anlamına geliyor.
Bu egzersiz, kursun bir parçasıdır
PySpark ile Özellik Mühendisliği
Egzersiz talimatları
year()ileLISTDATEiçinden yılı çıkar vewithColumn()kullanaraklist_yearadlı yeni bir sütuna koylist_yeardeğerinden 1 çıkararakreport_yearadlı başka bir sütun oluşturdf['CITY']ileprice_df['City']vedf['report_year']ileprice_df['Year']eşleşecek şekilde bir join koşulu oluşturdfileprice_dfarasında left join gerçekleştir
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
from pyspark.sql.functions import year
# Initialize dataframes
df = real_estate_df
price_df = median_prices_df
# Create year column
df = df.____(____, ____(____))
# Adjust year to match
df = df.withColumn(____, (df[____] - 1))
# Create join condition
condition = [df[____] == price_df[____], df[____] == price_df[____]]
# Join the dataframes together
df = ____.join(____, on=condition, how=____)
# Inspect that new columns are available
df[['MedianHomeValue']].show()