始める無料で始める

評価データの型

Markus はドキュメンタリー、スーパーヒーロー映画、名作、ドラマなど多くの映画を観ています。これまでの Spark の経験を活かして、さまざまなジャンルで Markus が何回そのジャンルの映画を観たかを含む markus_ratings データフレームを使い、これらの評価が暗黙的か明示的かを考えてみましょう。groupBy() メソッドを使って、どのジャンルの評価が最も高いかを確認してください。これは、ALS が Markus に対してどのようなレコメンデーションを生成するかに影響する可能性があります。

この演習はコースの一部です

PySpark で作る Recommendation Engines

コースを見る

演習の手順

  • groupBy() メソッドを使って、markus_ratings データフレームを "Genre" でグループ化しましょう。
  • 各ジャンルで視聴した映画の合計数を得るために .sum() メソッドを適用しましょう。
  • 件数を確認するため、最後に必ず .show() メソッドを追加しましょう。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Group the data by "Genre"
markus_ratings.____("____").____().____()
コードを編集して実行