Crearea DataFrame-ului TF-IDF
Acum că ai generat caracteristicile TF-IDF, trebuie să le organizezi într-un format pe care să-l poți folosi pentru a face recomandări.
Vei folosi din nou pandas pentru asta și vei împacheta array-ul într-un DataFrame.
Deoarece vei utiliza titlurile filmelor pentru a filtra datele, poți atribui titlurile ca index al DataFrame-ului.
DataFrame-ul df_plots a fost din nou încărcat pentru tine. Conține numele filmelor în coloana Title și rezumatele acestora în coloana Plot.
Acest exercițiu face parte din cursul
Construirea motoarelor de recomandare în Python
Instrucțiuni pentru exercițiu
- Creează un
TfidfVectorizerși aplică fit și transform, la fel ca în exercițiul anterior. - Împachetează datele generate
vectorized_dataîntr-un DataFrame. Folosește numele caracteristicilor generate în faza de fit și transform ca nume de coloane și atribuie noul DataFrame variabileitfidf_df. - Atribuie titlurile originale ale filmelor ca index al DataFrame-ului
tfidf_dfnou creat.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
from sklearn.feature_extraction.text import TfidfVectorizer
# Instantiate the vectorizer object and transform the plot column
vectorizer = ____(max_df=0.7, min_df=2)
vectorized_data = vectorizer.____(df_plots['Plot'])
# Create Dataframe from TF-IDFarray
tfidf_df = pd.____(____.toarray(), columns=vectorizer.____())
# Assign the movie titles to the index and inspect
tfidf_df.____ = ____['Title']
print(tfidf_df.head())