시작하기무료로 시작하기

GroupBy와 Filter 메서드

이제 데이터셋에 대해 조금 더 알게 되었으니, ratings 데이터셋의 전반적인 요약 지표를 살펴보고 영화가 받은 평점 수와 각 사용자가 남긴 평점 수를 확인해 보겠습니다.

Spark에서 요약 통계를 집계할 때 유용한 두 가지 일반적인 메서드는 .filter().groupBy()입니다. .filter() 메서드는 지정한 조건을 만족하지 않는 데이터를 걸러낼 수 있게 해 줍니다.

이 연습은 강의의 일부입니다

PySpark로 추천 엔진 만들기

강의 보기

연습 안내

  • pyspark.sql.functions에서 col을 임포트하고, .show()를 사용해 ratings 데이터셋을 확인하세요.
  • 괄호 안에 다음 필터를 넣어 ratings 데이터셋에 .filter() 메서드를 적용해 userId가 100 미만인 행만 포함하세요: col("userId") < 100.
  • ratings 데이터셋에 .groupBy() 메서드를 호출해 데이터를 userId 기준으로 그룹화하세요. 이어서 .count() 메서드를 호출해 각 userId가 평가한 영화의 개수를 확인하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Import the requisite packages
from pyspark.sql.____ import ____

# View the ratings dataset
____.____()

# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()

# Group data by userId, count ratings
ratings.____("____").count().show()
코드 편집 및 실행