Zacznij terazZacznij za darmo

Tworzenie ramki danych TF-IDF

Masz już wygenerowane cechy TF-IDF – teraz trzeba je przekształcić do formatu przydatnego przy tworzeniu rekomendacji. Ponownie skorzystasz z biblioteki pandas i opakujesz tablicę w ramkę danych. Ponieważ do filtrowania danych będziesz używać tytułów filmów, możesz przypisać je jako indeks ramki danych.

Ramka danych df_plots została ponownie wczytana. Zawiera tytuły filmów w kolumnie Title oraz ich fabuły w kolumnie Plot.

To ćwiczenie jest częścią kursu

Budowanie systemów rekomendacji w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz obiekt TfidfVectorizer, a następnie dopasuj go i przekształć dane tak jak w poprzednim ćwiczeniu.
  • Opakuj wygenerowane vectorized_data w ramkę danych. Jako nazwy kolumn użyj cech wygenerowanych podczas fazy dopasowania i transformacji, a nową ramkę danych przypisz do zmiennej tfidf_df.
  • Przypisz oryginalne tytuły filmów jako indeks nowo utworzonej ramki danych tfidf_df.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

from sklearn.feature_extraction.text import TfidfVectorizer

# Instantiate the vectorizer object and transform the plot column
vectorizer = ____(max_df=0.7, min_df=2)
vectorized_data = vectorizer.____(df_plots['Plot']) 

# Create Dataframe from TF-IDFarray
tfidf_df = pd.____(____.toarray(), columns=vectorizer.____())

# Assign the movie titles to the index and inspect
tfidf_df.____ = ____['Title']
print(tfidf_df.head())
Edytuj i uruchom kod