Instanțierea modelului TF-IDF
TF-IDF generează implicit o coloană pentru fiecare cuvânt din toate documentele tale (în cazul nostru, rezumatele filmelor). Astfel se creează un set de date voluminos și greu de interpretat, deoarece va conține atât cuvinte foarte frecvente care apar în fiecare document, cât și cuvinte atât de rare încât nu aduc nicio valoare în identificarea similarităților dintre elemente.
În acest exercițiu, vei lucra cu DataFrame-ul df_plots. Acesta conține numele filmelor în coloana Title și rezumatele lor în coloana Plot.
Folosind acest DataFrame, vei genera scorurile TF-IDF implicite și vei verifica dacă există coloane fără valoare.
Vei relua calculele TF-IDF, de data aceasta limitând numărul de coloane cu ajutorul argumentelor min_df și max_df, și vei observa îmbunătățirea obținută.
Acest exercițiu face parte din cursul
Construirea motoarelor de recomandare în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
from sklearn.feature_extraction.text import TfidfVectorizer
# Instantiate the vectorizer object to the vectorizer variable
vectorizer = ____()
# Fit and transform the plot column
vectorized_data = vectorizer.____(df_plots['Plot'])
# Look at the features generated
print(____.____())