行列積の知識を使って、User_3 に最も高くおすすめされる映画を判断しましょう。評価行列は ALS によって U と P に分解されています。
User_3
U
P
この演習はコースの一部です
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# View left factor matrix print(____)
この章では、レコメンデーションエンジンの強力さを示し、協調フィルタリングとコンテンツベースのエンジンの重要な違い、そしてレコメンデーションエンジンが利用できる暗黙的データと明示的データの種類を整理します。さらに、顧客データセットに存在するかもしれない隠れた特徴(潜在特徴)を見つけ出す非常に有効な方法についても学びます。
この章では、行列の乗算と行列分解の基本を復習し、Alternating Least Squares アルゴリズムがどのように動作するのか、最適なレコメンデーションを返すためにどのような引数やハイパーパラメーターを用いるのかを掘り下げます。あわせて、Spark で ALS を適用するためにデータを適切に前処理する重要な手法も学びます。
現在の演習
この章では MovieLens データセットを紹介します。ALS に適しているかを評価する手順を確認し、クロスバリデーション付きの ALS モデルを一から構築し、その性能を評価する方法を学びます。これは、今後 PySpark を使って構築するすべての ALS モデルの基盤となります。
現実の多くの場面では、ALS モデルの構築に理想的な顧客データは手に入りません。この章では、顧客の行動データから評価を「推定」し、その推定評価を使って ALS のレコメンデーションエンジンを構築する方法を学びます。Million Songs データセットと別バージョンの MovieLens データセットを使い、手元のデータを活用して ALS によるレコメンデーションエンジンを構築し、その性能を評価する方法を示します。