Vytvoř trénovací a testovací sady a sestav model ALS
Jak sestavit model ALS už víš – dělal/a jsi to v předchozí kapitole. Uděláme to znovu, ale tentokrát přidáme několik kroků, abychom model plně připravili pro křížovou validaci.
Nejdřív naimportujeme potřebné funkce a vytvoříme trénovací a testovací datové sady pro krok křížové validace.
Toto cvičení je součástí kurzu
Tvorba doporučovacích systémů s PySparkem
Pokyny k cvičení
- Naimportuj
RegressionEvaluatorzml.evaluation, algoritmusALSzml.recommendationa třídyParamGridBuilderaCrossValidatorzml.tuning. - Rozděl data
ratingsna trénovací a testovací sadu v poměru 80/20 pomocí metodyrandomSplit. Datové sady pojmenujtrainatesta nastav náhodný seed na1234. - Sestav model ALS – řekni Sparku, které sloupce dataframu
ratingsodpovídajíuserCol,itemColaratingCol. Argumentnonnegativenastav naTrue,coldStartStrategyna"drop"aimplicitPrefsnaFalse, aby Spark věděl, že nepracujeme s implicitními preferencemi. Model pojmenujals. - Ověř, že byl model vytvořen – zavolej funkci
type()na proměnnéals. Výstup by měl ukázat, o jaký typ modelu se jedná.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the required functions
from pyspark.ml.evaluation import ____
from pyspark.ml.recommendation import ____
from pyspark.ml.tuning import ____, ____
# Create test and train set
(train, test) = ratings.___([0.____, 0.____], seed = ____)
# Create ALS model
als = ALS(userCol="____", itemCol="____", ratingCol="____", nonnegative = ____, implicitPrefs = ____)
# Confirm that a model called "als" was created
type(____)