Zacznij terazZacznij za darmo

Tworzenie modelu TF-IDF

TF-IDF domyślnie generuje jedną kolumnę dla każdego słowa ze wszystkich dokumentów (w naszym przypadku – opisów filmów). Powstaje w ten sposób ogromny i mało przejrzysty zbiór danych: znajdziesz w nim zarówno bardzo popularne słowa, które pojawiają się w każdym dokumencie, jak i słowa tak rzadkie, że nie pomagają w znajdowaniu podobieństw między elementami.

W tym ćwiczeniu będziesz pracować z ramką danych df_plots. Zawiera ona nazwy filmów w kolumnie Title oraz ich opisy fabularne w kolumnie Plot.

Na podstawie tej ramki danych wygenerujesz domyślne wyniki TF-IDF i sprawdzisz, czy pojawiają się w nich bezwartościowe kolumny.

Następnie ponownie obliczysz wartości TF-IDF, tym razem ograniczając liczbę kolumn za pomocą argumentów min_df i max_df, i zobaczysz, jaka będzie różnica.

To ćwiczenie jest częścią kursu

Budowanie systemów rekomendacji w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

from sklearn.feature_extraction.text import TfidfVectorizer

# Instantiate the vectorizer object to the vectorizer variable
vectorizer = ____()

# Fit and transform the plot column
vectorized_data = vectorizer.____(df_plots['Plot'])

# Look at the features generated
print(____.____())
Edytuj i uruchom kod