Začněte nyníZačněte zdarma

Přiřazení celočíselných ID filmům

Udělejme totéž pro filmy. Pak spojíme nová uživatelská ID a ID filmů do jednoho dataframu.

Toto cvičení je součástí kurzu

Tvorba doporučovacích systémů s PySparkem

Zobrazit kurz

Pokyny k cvičení

  • Pomocí metod .select() a .distinct() vyextrahuj všechny unikátní hodnoty Movie z dataframu ratings.
  • Přerozděl dataframe movies na jeden oddíl pomocí coalesce().
  • Doplň připravený kód tak, aby každému filmu přiřadil unikátní celočíselné ID. Nový sloupec pojmenuj movieId a na výsledný dataframe zavolej metodu .persist().
  • Spoj dataframe ratings s dataframem users a následně s dataframem movies. Výsledek pojmenuj movie_ratings.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Extract the distinct movie id's
movies = ratings.select("____").distinct() 

# Repartition the data to have only one partition.
movies = movies.coalesce(____) 

# Create a new column of movieId integers. 
movies = movies.withColumn("____", monotonically_increasing_id()).____() 

# Join the ratings, users and movies dataframes
movie_ratings = ratings.join(____, "User", "left").join(____, "Movie", "left")
movie_ratings.show()
Upravit a spustit kód