시작하기무료로 시작하기

시간 구성 요소로 조인하기

다른 정보 집합을 조인할 때 날짜 구성 요소를 자주 사용해요. 하지만 이 예제에서는 집을 사려는 사람이 이용할 수 있었던 데이터를 사용해야 합니다. 즉, 분석에는 전년도 보고 데이터를 사용해야 해요.

이 연습은 강의의 일부입니다

PySpark로 하는 Feature Engineering

강의 보기

연습 안내

  • year()를 사용해 LISTDATE에서 연도를 추출하고, withColumn()으로 list_year라는 새 열에 넣으세요
  • list_year에서 1을 빼서 report_year라는 또 다른 새 열을 만드세요
  • df['CITY']price_df['City']와, df['report_year']price_df['Year']와 일치시키는 조인 조건을 만드세요
  • dfprice_df 사이에 left join을 수행하세요

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

from pyspark.sql.functions import year

# Initialize dataframes
df = real_estate_df
price_df = median_prices_df

# Create year column
df = df.____(____, ____(____))

# Adjust year to match
df = df.withColumn(____, (df[____] - 1))

# Create join condition
condition = [df[____] == price_df[____], df[____] == price_df[____]]

# Join the dataframes together
df = ____.join(____, on=condition, how=____)
# Inspect that new columns are available
df[['MedianHomeValue']].show()
코드 편집 및 실행