추천 엔진을 구축하는 방법을 배워야 하는 이유는 무엇인가요?
이 연습은 강의의 일부입니다
이론을 실습으로 바꾸는 인터랙티브 연습 중 하나를 만나보세요
이 장에서는 추천 엔진이 얼마나 강력한지 살펴보고, 협업 필터링 엔진과 콘텐츠 기반 엔진의 중요한 차이점, 그리고 추천 엔진이 사용할 수 있는 암묵적/명시적 데이터의 유형을 소개합니다. 또한 고객 데이터셋에 존재하는지조차 몰랐던 숨은 특징(잠재 특징)을 찾아내는 매우 강력한 방법도 배우게 됩니다.
현재 연습
이 장에서는 행렬 곱셈과 행렬 분해의 기본 개념을 복습하고, Alternating Least Squares 알고리즘이 어떻게 작동하는지, 최적의 추천을 반환하기 위해 어떤 인자와 하이퍼파라미터를 사용하는지 깊이 있게 알아봅니다. 또한 Spark에서 ALS를 위해 데이터를 올바르게 준비하는 데 필요한 중요한 기법도 학습합니다.
이 장에서는 MovieLens 데이터셋을 소개합니다. 해당 데이터셋이 ALS에 적합한지 평가하는 방법을 살펴보고, 교차 검증을 갖춘 전체 ALS 모델을 구축한 뒤, 그 성능을 평가하는 방법을 배웁니다. 이는 이후 PySpark로 구축할 모든 ALS 모델의 기반이 됩니다.
대부분의 실제 상황에서는 ALS 모델을 구축하는 데 필요한 "완벽한" 고객 데이터를 갖추지 못하는 경우가 많습니다. 이 장에서는 고객 행동 데이터를 활용해 고객 평점을 "추론"하고, 그 추론된 평점을 사용해 ALS 추천 엔진을 만드는 방법을 배웁니다. Million Songs 데이터셋과 또 다른 버전의 MovieLens 데이터셋을 사용하여, 가용한 데이터를 바탕으로 ALS로 추천 엔진을 구축하고 그 성능을 평가하는 방법을 보여드립니다.