Compararea tuturor filmelor cu TF-IDF
Acum că ai depus efortul necesar pentru a aduce datele TF-IDF într-un format utilizabil, e momentul să le pui la treabă pentru a găsi similarități și a genera recomandări.
De data aceasta, deoarece folosești scoruri TF-IDF (care sunt valori float, nu booleene), vei utiliza metrica similarității cosinus pentru a măsura asemănările dintre elemente. În acest exercițiu, vei genera o matrice cu toate similaritățile cosinus dintre filme și o vei stoca într-un DataFrame pentru a putea face căutări ușor și rapid.
DataFrame-ul tfidf_df pe care l-ai creat în exercițiul anterior, conținând câte un rând pentru fiecare film, a fost deja încărcat pentru tine.
Acest exercițiu face parte din cursul
Construirea motoarelor de recomandare în Python
Instrucțiuni pentru exercițiu
- Calculează măsurile de similaritate cosinus dintre toate filmele și atribuie rezultatele variabilei
cosine_similarity_array. - Creează un DataFrame din
cosine_similarity_array, folosindtfidf_summary_df.indexatât pentru rânduri, cât și pentru coloane. - Afișează primele cinci rânduri ale DataFrame-ului și examinează scorurile de similaritate.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import cosine_similarity measure
from sklearn.metrics.pairwise import ____
# Create the array of cosine similarity values
cosine_similarity_array = ____(tfidf_summary_df)
# Wrap the array in a pandas DataFrame
cosine_similarity_df = pd.____(cosine_similarity_array, ____=____.____, ____=____.____)
# Print the top 5 rows of the DataFrame
print(cosine_similarity_df.head())