Vytvoření modelu TF-IDF
TF-IDF ve výchozím nastavení vytváří jeden sloupec pro každé slovo ze všech tvých dokumentů (v našem případě filmových shrnutí). Vznikne tak obrovský a nepřehledný dataset, který bude obsahovat jak velmi časté výrazy vyskytující se v každém dokumentu, tak slova tak vzácná, že pro hledání podobností mezi položkami nemají žádnou hodnotu.
V tomto cvičení budeš pracovat s DataFramem df_plots, který obsahuje názvy filmů ve sloupci Title a jejich zápletky ve sloupci Plot.
Z tohoto DataFramu vygeneruješ výchozí skóre TF-IDF a podíváš se, zda jsou přítomny neužitečné sloupce.
Poté TF-IDF výpočty zopakuješ – tentokrát omezíš počet sloupců pomocí argumentů min_df a max_df a uvidíš, jak se výsledek zlepší.
Toto cvičení je součástí kurzu
Tvorba doporučovacích systémů v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from sklearn.feature_extraction.text import TfidfVectorizer
# Instantiate the vectorizer object to the vectorizer variable
vectorizer = ____()
# Fit and transform the plot column
vectorized_data = vectorizer.____(df_plots['Plot'])
# Look at the features generated
print(____.____())