시간 구성 요소로 조인하기
다른 정보 집합을 조인할 때 날짜 구성 요소를 자주 사용해요. 하지만 이 예제에서는 집을 사려는 사람이 이용할 수 있었던 데이터를 사용해야 합니다. 즉, 분석에는 전년도 보고 데이터를 사용해야 해요.
이 연습은 강의의 일부입니다
PySpark로 하는 Feature Engineering
연습 안내
year()를 사용해LISTDATE에서 연도를 추출하고,withColumn()으로list_year라는 새 열에 넣으세요list_year에서 1을 빼서report_year라는 또 다른 새 열을 만드세요df['CITY']를price_df['City']와,df['report_year']를price_df['Year']와 일치시키는 조인 조건을 만드세요df와price_df사이에 left join을 수행하세요
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
from pyspark.sql.functions import year
# Initialize dataframes
df = real_estate_df
price_df = median_prices_df
# Create year column
df = df.____(____, ____(____))
# Adjust year to match
df = df.withColumn(____, (df[____] - 1))
# Create join condition
condition = [df[____] == price_df[____], df[____] == price_df[____]]
# Join the dataframes together
df = ____.join(____, on=condition, how=____)
# Inspect that new columns are available
df[['MedianHomeValue']].show()