Łączenie na podstawie składowych daty
Często będziesz używać składowych daty, aby połączyć zbiory danych z dodatkowymi informacjami. W tym przykładzie potrzebujemy danych, które byłyby dostępne dla osób rozważających zakup domu. Oznacza to, że do analizy użyjemy danych raportowych z poprzedniego roku.
To ćwiczenie jest częścią kursu
Inżynieria cech z PySpark
Instrukcje do ćwiczenia
- Wyodrębnij rok z kolumny
LISTDATEza pomocą funkcjiyear()i zapisz go w nowej kolumnie o nazwielist_year, korzystając zwithColumn() - Utwórz kolejną nową kolumnę o nazwie
report_year, odejmując 1 od wartościlist_year - Utwórz warunek złączenia, który dopasowuje
df['CITY']doprice_df['City']orazdf['report_year']doprice_df['Year'] - Wykonaj lewe złączenie (left join) między
dfaprice_df
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
from pyspark.sql.functions import year
# Initialize dataframes
df = real_estate_df
price_df = median_prices_df
# Create year column
df = df.____(____, ____(____))
# Adjust year to match
df = df.withColumn(____, (df[____] - 1))
# Create join condition
condition = [df[____] == price_df[____], df[____] == price_df[____]]
# Join the dataframes together
df = ____.join(____, on=condition, how=____)
# Inspect that new columns are available
df[['MedianHomeValue']].show()