Zacznij terazZacznij za darmo

Łączenie na podstawie składowych daty

Często będziesz używać składowych daty, aby połączyć zbiory danych z dodatkowymi informacjami. W tym przykładzie potrzebujemy danych, które byłyby dostępne dla osób rozważających zakup domu. Oznacza to, że do analizy użyjemy danych raportowych z poprzedniego roku.

To ćwiczenie jest częścią kursu

Inżynieria cech z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Wyodrębnij rok z kolumny LISTDATE za pomocą funkcji year() i zapisz go w nowej kolumnie o nazwie list_year, korzystając z withColumn()
  • Utwórz kolejną nową kolumnę o nazwie report_year, odejmując 1 od wartości list_year
  • Utwórz warunek złączenia, który dopasowuje df['CITY'] do price_df['City'] oraz df['report_year'] do price_df['Year']
  • Wykonaj lewe złączenie (left join) między df a price_df

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

from pyspark.sql.functions import year

# Initialize dataframes
df = real_estate_df
price_df = median_prices_df

# Create year column
df = df.____(____, ____(____))

# Adjust year to match
df = df.withColumn(____, (df[____] - 1))

# Create join condition
condition = [df[____] == price_df[____], df[____] == price_df[____]]

# Join the dataframes together
df = ____.join(____, on=condition, how=____)
# Inspect that new columns are available
df[['MedianHomeValue']].show()
Edytuj i uruchom kod