Začněte nyníZačněte zdarma

Kompenzace chybějících dat

U většiny datových sad ohodnotí uživatelé jen malou část položek. Jak sis všiml/a v předchozím cvičení, způsob, jakým nakládáš s uživateli, kteří nemají hodnocení pro danou položku, může výrazně ovlivnit platnost tvých modelů.

V tomto cvičení doplníš chybějící data takovými hodnotami, které nezkreslí data, která již máš.

Spočítáš průměrné hodnocení každého uživatele napříč všemi jeho recenzemi a pomocí tohoto průměru vycentruješ skóre uživatelů kolem nuly. Prázdné hodnoty pak budeš moci vyplnit nulami, které teď představují neutrální skóre – minimalizují dopad na celkový profil uživatele a zároveň umožňují vzájemné porovnávání uživatelů.

Proměnná user_ratings_table s jedním řádkem na uživatele je již načtena.

Toto cvičení je součástí kurzu

Tvorba doporučovacích systémů v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Zjisti průměr hodnocení každého uživatele v user_ratings_table a výsledek ulož jako avg_ratings.
  • Odečti průměry řádků od každého řádku v user_ratings_table a výsledek ulož jako user_ratings_table_centered.
  • Vyplň prázdné hodnoty v nově vytvořené user_ratings_table_centered nulami.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Get the average rating for each user 
avg_ratings = user_ratings_table.____(axis=____)

# Center each users ratings around 0
user_ratings_table_centered = user_ratings_table.____(____, axis=0)

# Fill in the missing data with 0s
user_ratings_table_normed = user_ratings_table_centered.____(____)
Upravit a spustit kód