Začněte nyníZačněte zdarma

Vytvoření DataFrame pro TF-IDF

Teď, když máš vygenerované TF-IDF příznaky, je potřeba je převést do formátu vhodného pro tvorbu doporučení. Opět k tomu využiješ pandas a zabalíš pole do DataFrame. Protože při filtrování dat budeš pracovat s názvy filmů, můžeš je přiřadit jako index DataFrame.

DataFrame df_plots je opět načtený. Obsahuje názvy filmů ve sloupci Title a jejich zápletky ve sloupci Plot.

Toto cvičení je součástí kurzu

Tvorba doporučovacích systémů v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř objekt TfidfVectorizer a proveď fit a transform stejně jako v předchozím cvičení.
  • Zabal vygenerovaná data vectorized_data do DataFrame. Jako názvy sloupců použij názvy příznaků vygenerovaných během fáze fit a transform a výsledek ulož do tfidf_df.
  • Přiřaď původní názvy filmů jako index nově vytvořeného DataFrame tfidf_df.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

from sklearn.feature_extraction.text import TfidfVectorizer

# Instantiate the vectorizer object and transform the plot column
vectorizer = ____(max_df=0.7, min_df=2)
vectorized_data = vectorizer.____(df_plots['Plot']) 

# Create Dataframe from TF-IDFarray
tfidf_df = pd.____(____.toarray(), columns=vectorizer.____())

# Assign the movie titles to the index and inspect
tfidf_df.____ = ____['Title']
print(tfidf_df.head())
Upravit a spustit kód