Spojení podle časových složek
Při práci s daty často využiješ datové složky pro spojení s dalšími datovými sadami. V tomto příkladu ale potřebujeme pracovat pouze s daty, která by byla dostupná potenciálním kupcům nemovitostí v daném okamžiku. Proto budeme pro analýzu používat data z předchozího roku.
Toto cvičení je součástí kurzu
Feature Engineering with PySpark
Pokyny k cvičení
- Extrahuj rok z
LISTDATEpomocíyear()a ulož ho do nového sloupcelist_yearpomocíwithColumn() - Vytvoř další nový sloupec
report_yeartak, že odlist_yearodečteš 1 - Vytvoř podmínku joinu, která páruje
df['CITY']sprice_df['City']adf['report_year']sprice_df['Year'] - Proveď left join mezi
dfaprice_df
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from pyspark.sql.functions import year
# Initialize dataframes
df = real_estate_df
price_df = median_prices_df
# Create year column
df = df.____(____, ____(____))
# Adjust year to match
df = df.withColumn(____, (df[____] - 1))
# Create join condition
condition = [df[____] == price_df[____], df[____] == price_df[____]]
# Join the dataframes together
df = ____.join(____, on=condition, how=____)
# Inspect that new columns are available
df[['MedianHomeValue']].show()