Začněte nyníZačněte zdarma

Spojení podle časových složek

Při práci s daty často využiješ datové složky pro spojení s dalšími datovými sadami. V tomto příkladu ale potřebujeme pracovat pouze s daty, která by byla dostupná potenciálním kupcům nemovitostí v daném okamžiku. Proto budeme pro analýzu používat data z předchozího roku.

Toto cvičení je součástí kurzu

Feature Engineering with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Extrahuj rok z LISTDATE pomocí year() a ulož ho do nového sloupce list_year pomocí withColumn()
  • Vytvoř další nový sloupec report_year tak, že od list_year odečteš 1
  • Vytvoř podmínku joinu, která páruje df['CITY'] s price_df['City'] a df['report_year'] s price_df['Year']
  • Proveď left join mezi df a price_df

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

from pyspark.sql.functions import year

# Initialize dataframes
df = real_estate_df
price_df = median_prices_df

# Create year column
df = df.____(____, ____(____))

# Adjust year to match
df = df.withColumn(____, (df[____] - 1))

# Create join condition
condition = [df[____] == price_df[____], df[____] == price_df[____]]

# Join the dataframes together
df = ____.join(____, on=condition, how=____)
# Inspect that new columns are available
df[['MedianHomeValue']].show()
Upravit a spustit kód