Tworzenie ramki danych TF-IDF
Masz już wygenerowane cechy TF-IDF – teraz trzeba je przekształcić do formatu przydatnego przy tworzeniu rekomendacji.
Ponownie skorzystasz z biblioteki pandas i opakujesz tablicę w ramkę danych.
Ponieważ do filtrowania danych będziesz używać tytułów filmów, możesz przypisać je jako indeks ramki danych.
Ramka danych df_plots została ponownie wczytana. Zawiera tytuły filmów w kolumnie Title oraz ich fabuły w kolumnie Plot.
To ćwiczenie jest częścią kursu
Budowanie systemów rekomendacji w Pythonie
Instrukcje do ćwiczenia
- Utwórz obiekt
TfidfVectorizer, a następnie dopasuj go i przekształć dane tak jak w poprzednim ćwiczeniu. - Opakuj wygenerowane
vectorized_dataw ramkę danych. Jako nazwy kolumn użyj cech wygenerowanych podczas fazy dopasowania i transformacji, a nową ramkę danych przypisz do zmiennejtfidf_df. - Przypisz oryginalne tytuły filmów jako indeks nowo utworzonej ramki danych
tfidf_df.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
from sklearn.feature_extraction.text import TfidfVectorizer
# Instantiate the vectorizer object and transform the plot column
vectorizer = ____(max_df=0.7, min_df=2)
vectorized_data = vectorizer.____(df_plots['Plot'])
# Create Dataframe from TF-IDFarray
tfidf_df = pd.____(____.toarray(), columns=vectorizer.____())
# Assign the movie titles to the index and inspect
tfidf_df.____ = ____['Title']
print(tfidf_df.head())