BaşlayınÜcretsiz başlayın

Zaman Bileşenleri Üzerinden Join

Çoğu zaman başka bilgi kümelerini birleştirmek için tarih bileşenlerini kullanırsın. Ancak bu örnekte, ev almayı düşünenlerin erişebileceği verileri kullanmamız gerekiyor. Bu da analizimiz için bir önceki yılın raporlama verilerini kullanacağımız anlamına geliyor.

Bu egzersiz, kursun bir parçasıdır

PySpark ile Özellik Mühendisliği

Kursa Göz Atın

Egzersiz talimatları

  • year() ile LISTDATE içinden yılı çıkar ve withColumn() kullanarak list_year adlı yeni bir sütuna koy
  • list_year değerinden 1 çıkararak report_year adlı başka bir sütun oluştur
  • df['CITY'] ile price_df['City'] ve df['report_year'] ile price_df['Year'] eşleşecek şekilde bir join koşulu oluştur
  • df ile price_df arasında left join gerçekleştir

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

from pyspark.sql.functions import year

# Initialize dataframes
df = real_estate_df
price_df = median_prices_df

# Create year column
df = df.____(____, ____(____))

# Adjust year to match
df = df.withColumn(____, (df[____] - 1))

# Create join condition
condition = [df[____] == price_df[____], df[____] == price_df[____]]

# Join the dataframes together
df = ____.join(____, on=condition, how=____)
# Inspect that new columns are available
df[['MedianHomeValue']].show()
Kodu Düzenle ve Çalıştır