Začněte nyníZačněte zdarma

Vytvoření modelu TF-IDF

TF-IDF ve výchozím nastavení vytváří jeden sloupec pro každé slovo ze všech tvých dokumentů (v našem případě filmových shrnutí). Vznikne tak obrovský a nepřehledný dataset, který bude obsahovat jak velmi časté výrazy vyskytující se v každém dokumentu, tak slova tak vzácná, že pro hledání podobností mezi položkami nemají žádnou hodnotu.

V tomto cvičení budeš pracovat s DataFramem df_plots, který obsahuje názvy filmů ve sloupci Title a jejich zápletky ve sloupci Plot.

Z tohoto DataFramu vygeneruješ výchozí skóre TF-IDF a podíváš se, zda jsou přítomny neužitečné sloupce.

Poté TF-IDF výpočty zopakuješ – tentokrát omezíš počet sloupců pomocí argumentů min_df a max_df a uvidíš, jak se výsledek zlepší.

Toto cvičení je součástí kurzu

Tvorba doporučovacích systémů v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

from sklearn.feature_extraction.text import TfidfVectorizer

# Instantiate the vectorizer object to the vectorizer variable
vectorizer = ____()

# Fit and transform the plot column
vectorized_data = vectorizer.____(df_plots['Plot'])

# Look at the features generated
print(____.____())
Upravit a spustit kód