평점과 조인하기
동영상 연습 문제에서 PySpark 변환을 사용해 film과 ratings 테이블을 조인하고, 고객별 평균 평점을 저장하는 새 열을 만드는 방법을 보셨습니다.
이번 연습에서는 같은 기법을 활용해 film과 ratings 테이블 간의 시너지를 더 키우면서, 영화별 평균 평점을 계산해 볼 거예요.
영화 정보가 담긴 PySpark DataFrame film_df와 평점 정보가 담긴 PySpark DataFrame rating_df가 작업 공간에 준비되어 있어요.
이 연습은 강의의 일부입니다
데이터 엔지니어링 입문
연습 안내
film_id별 평균 평점을 계산해서ratings_per_film_df에 할당하세요..join()구문을 완성해film_id열을 기준으로 조인하세요.- 결과 DataFrame의 처음
5개 결과를 보여 주세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Use groupBy and mean to aggregate the column
ratings_per_film_df = rating_df.____('____').____('____')
# Join the tables using the film_id column
film_df_with_ratings = film_df.join(
ratings_per_film_df,
film_df.film_id==____
)
# Show the 5 first results
print(film_df_with_ratings.____)