.show() メソッドや .columns メソッドを使って df データフレームを確認し、「collaborative filtering」「content-based filtering」「both」のうち、どれに最も適しているかを判断しましょう。
.show()
.columns
df
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
この章では、レコメンデーションエンジンの強力さを示し、協調フィルタリングとコンテンツベースのエンジンの重要な違い、そしてレコメンデーションエンジンが利用できる暗黙的データと明示的データの種類を整理します。さらに、顧客データセットに存在するかもしれない隠れた特徴(潜在特徴)を見つけ出す非常に有効な方法についても学びます。
現在の演習
この章では、行列の乗算と行列分解の基本を復習し、Alternating Least Squares アルゴリズムがどのように動作するのか、最適なレコメンデーションを返すためにどのような引数やハイパーパラメーターを用いるのかを掘り下げます。あわせて、Spark で ALS を適用するためにデータを適切に前処理する重要な手法も学びます。
この章では MovieLens データセットを紹介します。ALS に適しているかを評価する手順を確認し、クロスバリデーション付きの ALS モデルを一から構築し、その性能を評価する方法を学びます。これは、今後 PySpark を使って構築するすべての ALS モデルの基盤となります。
現実の多くの場面では、ALS モデルの構築に理想的な顧客データは手に入りません。この章では、顧客の行動データから評価を「推定」し、その推定評価を使って ALS のレコメンデーションエンジンを構築する方法を学びます。Million Songs データセットと別バージョンの MovieLens データセットを使い、手元のデータを活用して ALS によるレコメンデーションエンジンを構築し、その性能を評価する方法を示します。