시작하기무료로 시작하기

평점 데이터 타입

Markus는 다큐멘터리, 슈퍼히어로 영화, 고전, 드라마 등 다양한 영화를 많이 봅니다. 이전에 Spark를 다뤄본 경험을 바탕으로, 여러 장르에서 Markus가 영화를 본 횟수가 담긴 markus_ratings 데이터프레임을 사용해 이것이 암시적 평점인지 명시적 평점인지 생각해 보세요. groupBy() 메서드를 사용해 어떤 장르의 평점(시청 수 합계)이 가장 높은지 확인하고, 이것이 ALS가 Markus에게 생성할 추천에 어떻게 영향을 줄지 가늠해 보세요.

이 연습은 강의의 일부입니다

PySpark로 추천 엔진 만들기

강의 보기

연습 안내

  • groupBy() 메서드를 사용해 markus_ratings 데이터프레임을 "Genre" 기준으로 그룹화하세요.
  • 각 장르별로 본 영화 수의 합계를 구하려면 .sum() 메서드를 적용하세요.
  • 마지막에 .show() 메서드를 추가해 집계 결과를 확인하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Group the data by "Genre"
markus_ratings.____("____").____().____()
코드 편집 및 실행