MSD 요약 통계
Million Songs Echo Nest Taste Profile 데이터 하위 집합에 익숙해져 볼까요? 이 강의에서는 간단히 Million Songs 데이터셋 또는 msd라고 부를게요. 사용자 수와 곡 수를 구해 봅시다. 또한 이 하위 집합에서 어떤 곡이 재생 수가 가장 많은지도 확인해 보세요.
이 연습은 강의의 일부입니다
PySpark로 추천 엔진 만들기
연습 안내
.show()메서드를 사용해 데이터 형태를 확인하세요.- 고유한
userId개수를 세는 코드를 완성하세요.userId열을 선택한 뒤.distinct()와.count()를 호출하면 됩니다. - 이제 같은 방식으로
songId에 대해서도 고유한songId개수를 세세요.songId열을 선택하고.distinct()와.count()를 호출하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Look at the data
msd.____()
# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)
# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)