ÎncepețiÎncepe gratuit

Atribuirea de ID-uri întregi filmelor

Să facem același lucru și pentru filme. Apoi vom uni noile ID-uri de utilizatori și ID-urile de filme într-un singur dataframe.

Acest exercițiu face parte din cursul

Construiește motoare de recomandare cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește metodele .select() și .distinct() pentru a extrage toate filmele (Movie) unice din dataframe-ul ratings.
  • Repartizează dataframe-ul movies la o singură partiție folosind coalesce().
  • Completează codul parțial furnizat pentru a atribui ID-uri întregi unice fiecărui film. Numește noua coloană movieId și aplică metoda .persist() pe dataframe-ul rezultat.
  • Unește dataframe-ul ratings cu dataframe-ul users și apoi cu dataframe-ul movies. Numește rezultatul movie_ratings.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Extract the distinct movie id's
movies = ratings.select("____").distinct() 

# Repartition the data to have only one partition.
movies = movies.coalesce(____) 

# Create a new column of movieId integers. 
movies = movies.withColumn("____", monotonically_increasing_id()).____() 

# Join the ratings, users and movies dataframes
movie_ratings = ratings.join(____, "User", "left").join(____, "Movie", "left")
movie_ratings.show()
Editează și rulează codul