Tworzenie modelu TF-IDF
TF-IDF domyślnie generuje jedną kolumnę dla każdego słowa ze wszystkich dokumentów (w naszym przypadku – opisów filmów). Powstaje w ten sposób ogromny i mało przejrzysty zbiór danych: znajdziesz w nim zarówno bardzo popularne słowa, które pojawiają się w każdym dokumencie, jak i słowa tak rzadkie, że nie pomagają w znajdowaniu podobieństw między elementami.
W tym ćwiczeniu będziesz pracować z ramką danych df_plots. Zawiera ona nazwy filmów w kolumnie Title oraz ich opisy fabularne w kolumnie Plot.
Na podstawie tej ramki danych wygenerujesz domyślne wyniki TF-IDF i sprawdzisz, czy pojawiają się w nich bezwartościowe kolumny.
Następnie ponownie obliczysz wartości TF-IDF, tym razem ograniczając liczbę kolumn za pomocą argumentów min_df i max_df, i zobaczysz, jaka będzie różnica.
To ćwiczenie jest częścią kursu
Budowanie systemów rekomendacji w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
from sklearn.feature_extraction.text import TfidfVectorizer
# Instantiate the vectorizer object to the vectorizer variable
vectorizer = ____()
# Fit and transform the plot column
vectorized_data = vectorizer.____(df_plots['Plot'])
# Look at the features generated
print(____.____())