ÎncepețiÎncepe gratuit

Crearea DataFrame-ului TF-IDF

Acum că ai generat caracteristicile TF-IDF, trebuie să le organizezi într-un format pe care să-l poți folosi pentru a face recomandări. Vei folosi din nou pandas pentru asta și vei împacheta array-ul într-un DataFrame. Deoarece vei utiliza titlurile filmelor pentru a filtra datele, poți atribui titlurile ca index al DataFrame-ului.

DataFrame-ul df_plots a fost din nou încărcat pentru tine. Conține numele filmelor în coloana Title și rezumatele acestora în coloana Plot.

Acest exercițiu face parte din cursul

Construirea motoarelor de recomandare în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează un TfidfVectorizer și aplică fit și transform, la fel ca în exercițiul anterior.
  • Împachetează datele generate vectorized_data într-un DataFrame. Folosește numele caracteristicilor generate în faza de fit și transform ca nume de coloane și atribuie noul DataFrame variabilei tfidf_df.
  • Atribuie titlurile originale ale filmelor ca index al DataFrame-ului tfidf_df nou creat.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

from sklearn.feature_extraction.text import TfidfVectorizer

# Instantiate the vectorizer object and transform the plot column
vectorizer = ____(max_df=0.7, min_df=2)
vectorized_data = vectorizer.____(df_plots['Plot']) 

# Create Dataframe from TF-IDFarray
tfidf_df = pd.____(____.toarray(), columns=vectorizer.____())

# Assign the movie titles to the index and inspect
tfidf_df.____ = ____['Title']
print(tfidf_df.head())
Editează și rulează codul