GroupBy와 Filter 메서드
이제 데이터셋에 대해 조금 더 알게 되었으니, ratings 데이터셋의 전반적인 요약 지표를 살펴보고 영화가 받은 평점 수와 각 사용자가 남긴 평점 수를 확인해 보겠습니다.
Spark에서 요약 통계를 집계할 때 유용한 두 가지 일반적인 메서드는 .filter()와 .groupBy()입니다. .filter() 메서드는 지정한 조건을 만족하지 않는 데이터를 걸러낼 수 있게 해 줍니다.
이 연습은 강의의 일부입니다
PySpark로 추천 엔진 만들기
연습 안내
pyspark.sql.functions에서col을 임포트하고,.show()를 사용해ratings데이터셋을 확인하세요.- 괄호 안에 다음 필터를 넣어
ratings데이터셋에.filter()메서드를 적용해userId가 100 미만인 행만 포함하세요:col("userId") < 100. ratings데이터셋에.groupBy()메서드를 호출해 데이터를userId기준으로 그룹화하세요. 이어서.count()메서드를 호출해 각userId가 평가한 영화의 개수를 확인하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import the requisite packages
from pyspark.sql.____ import ____
# View the ratings dataset
____.____()
# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()
# Group data by userId, count ratings
ratings.____("____").count().show()