Kompenzace chybějících dat
U většiny datových sad ohodnotí uživatelé jen malou část položek. Jak sis všiml/a v předchozím cvičení, způsob, jakým nakládáš s uživateli, kteří nemají hodnocení pro danou položku, může výrazně ovlivnit platnost tvých modelů.
V tomto cvičení doplníš chybějící data takovými hodnotami, které nezkreslí data, která již máš.
Spočítáš průměrné hodnocení každého uživatele napříč všemi jeho recenzemi a pomocí tohoto průměru vycentruješ skóre uživatelů kolem nuly. Prázdné hodnoty pak budeš moci vyplnit nulami, které teď představují neutrální skóre – minimalizují dopad na celkový profil uživatele a zároveň umožňují vzájemné porovnávání uživatelů.
Proměnná user_ratings_table s jedním řádkem na uživatele je již načtena.
Toto cvičení je součástí kurzu
Tvorba doporučovacích systémů v Pythonu
Pokyny k cvičení
- Zjisti průměr hodnocení každého uživatele v
user_ratings_tablea výsledek ulož jakoavg_ratings. - Odečti průměry řádků od každého řádku v
user_ratings_tablea výsledek ulož jakouser_ratings_table_centered. - Vyplň prázdné hodnoty v nově vytvořené
user_ratings_table_centerednulami.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Get the average rating for each user
avg_ratings = user_ratings_table.____(axis=____)
# Center each users ratings around 0
user_ratings_table_centered = user_ratings_table.____(____, axis=0)
# Fill in the missing data with 0s
user_ratings_table_normed = user_ratings_table_centered.____(____)