評価データの型
Markus はドキュメンタリー、スーパーヒーロー映画、名作、ドラマなど多くの映画を観ています。これまでの Spark の経験を活かして、さまざまなジャンルで Markus が何回そのジャンルの映画を観たかを含む markus_ratings データフレームを使い、これらの評価が暗黙的か明示的かを考えてみましょう。groupBy() メソッドを使って、どのジャンルの評価が最も高いかを確認してください。これは、ALS が Markus に対してどのようなレコメンデーションを生成するかに影響する可能性があります。
この演習はコースの一部です
PySpark で作る Recommendation Engines
演習の手順
groupBy()メソッドを使って、markus_ratingsデータフレームを"Genre"でグループ化しましょう。- 各ジャンルで視聴した映画の合計数を得るために
.sum()メソッドを適用しましょう。 - 件数を確認するため、最後に必ず
.show()メソッドを追加しましょう。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Group the data by "Genre"
markus_ratings.____("____").____().____()