시작하기무료로 시작하기

평점과 조인하기

동영상 연습 문제에서 PySpark 변환을 사용해 filmratings 테이블을 조인하고, 고객별 평균 평점을 저장하는 새 열을 만드는 방법을 보셨습니다. 이번 연습에서는 같은 기법을 활용해 filmratings 테이블 간의 시너지를 더 키우면서, 영화별 평균 평점을 계산해 볼 거예요.

영화 정보가 담긴 PySpark DataFrame film_df와 평점 정보가 담긴 PySpark DataFrame rating_df가 작업 공간에 준비되어 있어요.

이 연습은 강의의 일부입니다

데이터 엔지니어링 입문

강의 보기

연습 안내

  • film_id별 평균 평점을 계산해서 ratings_per_film_df에 할당하세요.
  • .join() 구문을 완성해 film_id 열을 기준으로 조인하세요.
  • 결과 DataFrame의 처음 5개 결과를 보여 주세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Use groupBy and mean to aggregate the column
ratings_per_film_df = rating_df.____('____').____('____')

# Join the tables using the film_id column
film_df_with_ratings = film_df.join(
    ratings_per_film_df,
    film_df.film_id==____
)

# Show the 5 first results
print(film_df_with_ratings.____)
코드 편집 및 실행