시작하기무료로 시작하기

MSD 요약 통계

Million Songs Echo Nest Taste Profile 데이터 하위 집합에 익숙해져 볼까요? 이 강의에서는 간단히 Million Songs 데이터셋 또는 msd라고 부를게요. 사용자 수와 곡 수를 구해 봅시다. 또한 이 하위 집합에서 어떤 곡이 재생 수가 가장 많은지도 확인해 보세요.

이 연습은 강의의 일부입니다

PySpark로 추천 엔진 만들기

강의 보기

연습 안내

  • .show() 메서드를 사용해 데이터 형태를 확인하세요.
  • 고유한 userId 개수를 세는 코드를 완성하세요. userId 열을 선택한 뒤 .distinct().count()를 호출하면 됩니다.
  • 이제 같은 방식으로 songId에 대해서도 고유한 songId 개수를 세세요. songId 열을 선택하고 .distinct().count()를 호출하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Look at the data
msd.____()

# Count the number of distinct userIds
user_count = msd.select("____").____().count()
print("Number of users: ", user_count)

# Count the number of distinct songIds
song_count = msd.select("____").____().count()
print("Number of songs: ", song_count)
코드 편집 및 실행