pandas での単純サンプリング
この章を通して、Spotify の楽曲データを探索していきます。母集団データセットでは各行が1曲を表し、行数は4万件以上あります。列には曲名、アーティスト、リリース年に加えて、再生時間、テンポ、ダンサビリティなどの属性が含まれます。まずは再生時間に注目しましょう。
最初のタスクは、Spotify データセットからサンプルを抽出し、母集団とサンプルの平均再生時間を比較することです。
spotify_population が利用可能で、pandas は pd として読み込まれています。
この演習はコースの一部です
Pythonで学ぶサンプリング
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Sample 1000 rows from spotify_population
spotify_sample = ____
# Print the sample
print(spotify_sample)