ÎncepețiÎncepe gratuit

Dispersia matricei

O provocare frecventă în lucrul cu date de evaluare reale este că majoritatea utilizatorilor nu vor fi evaluat majoritatea elementelor, iar majoritatea elementelor vor fi fost evaluate doar de un număr mic de utilizatori. Rezultatul este un DataFrame foarte gol sau dispersat.

În acest exercițiu, vei calcula gradul de dispersie al datelor de evaluare movie_lens, numărând celulele ocupate și comparând rezultatul cu dimensiunea totală a DataFrame-ului. DataFrame-ul user_ratings_df pe care l-ai folosit în exercițiile anterioare, care conține câte un rând per utilizator și câte o coloană per film, a fost deja încărcat.

Acest exercițiu face parte din cursul

Construirea motoarelor de recomandare în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Numără celulele negoale din user_ratings_df și stochează rezultatul ca sparsity_count.
  • Numără numărul total de celule din DataFrame-ul user_ratings_df și stochează-l ca full_count.
  • Calculează gradul de dispersie al DataFrame-ului împărțind numărul de celule negoale la numărul total de celule și afișează rezultatul.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Count the occupied cells
sparsity_count = user_ratings_df.____().____.____()

# Count all cells
full_count = user_ratings_df.____

# Find the sparsity of the DataFrame
sparsity = ____ / ____
print(sparsity)
Editează și rulează codul