各行のデータが限られている場合
このようなデータのスパース性は、前の章で扱ったK-nearest neighborsのような手法で問題になることがあります。KNNは、あるアイテムに評価を付けたユーザーの中から最も似ているユーザーを k 人見つける必要がありますが、そのアイテムに評価を付けたユーザーが k 人以下しかいない場合、すべての評価が「最も類似している」と見なされてしまいます。
この演習では、user_ratings_df DataFrame 内で各映画が何回評価されたかを数え、1件または2件の評価しかない映画がどれくらいあるかを確認します。
この演習はコースの一部です
Pythonでつくるレコメンデーションエンジン
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Count the occupied cells per column
occupied_count = user_ratings_df.____().____()
print(occupied_count)