Vytvoření DataFrame pro TF-IDF
Teď, když máš vygenerované TF-IDF příznaky, je potřeba je převést do formátu vhodného pro tvorbu doporučení.
Opět k tomu využiješ pandas a zabalíš pole do DataFrame.
Protože při filtrování dat budeš pracovat s názvy filmů, můžeš je přiřadit jako index DataFrame.
DataFrame df_plots je opět načtený. Obsahuje názvy filmů ve sloupci Title a jejich zápletky ve sloupci Plot.
Toto cvičení je součástí kurzu
Tvorba doporučovacích systémů v Pythonu
Pokyny k cvičení
- Vytvoř objekt
TfidfVectorizera proveď fit a transform stejně jako v předchozím cvičení. - Zabal vygenerovaná data
vectorized_datado DataFrame. Jako názvy sloupců použij názvy příznaků vygenerovaných během fáze fit a transform a výsledek ulož dotfidf_df. - Přiřaď původní názvy filmů jako index nově vytvořeného DataFrame
tfidf_df.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from sklearn.feature_extraction.text import TfidfVectorizer
# Instantiate the vectorizer object and transform the plot column
vectorizer = ____(max_df=0.7, min_df=2)
vectorized_data = vectorizer.____(df_plots['Plot'])
# Create Dataframe from TF-IDFarray
tfidf_df = pd.____(____.toarray(), columns=vectorizer.____())
# Assign the movie titles to the index and inspect
tfidf_df.____ = ____['Title']
print(tfidf_df.head())