ÎncepețiÎncepe gratuit

Compararea tuturor filmelor cu TF-IDF

Acum că ai depus efortul necesar pentru a aduce datele TF-IDF într-un format utilizabil, e momentul să le pui la treabă pentru a găsi similarități și a genera recomandări.

De data aceasta, deoarece folosești scoruri TF-IDF (care sunt valori float, nu booleene), vei utiliza metrica similarității cosinus pentru a măsura asemănările dintre elemente. În acest exercițiu, vei genera o matrice cu toate similaritățile cosinus dintre filme și o vei stoca într-un DataFrame pentru a putea face căutări ușor și rapid.

DataFrame-ul tfidf_df pe care l-ai creat în exercițiul anterior, conținând câte un rând pentru fiecare film, a fost deja încărcat pentru tine.

Acest exercițiu face parte din cursul

Construirea motoarelor de recomandare în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Calculează măsurile de similaritate cosinus dintre toate filmele și atribuie rezultatele variabilei cosine_similarity_array.
  • Creează un DataFrame din cosine_similarity_array, folosind tfidf_summary_df.index atât pentru rânduri, cât și pentru coloane.
  • Afișează primele cinci rânduri ale DataFrame-ului și examinează scorurile de similaritate.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import cosine_similarity measure
from sklearn.metrics.pairwise import ____

# Create the array of cosine similarity values
cosine_similarity_array = ____(tfidf_summary_df)

# Wrap the array in a pandas DataFrame
cosine_similarity_df = pd.____(cosine_similarity_array, ____=____.____, ____=____.____)

# Print the top 5 rows of the DataFrame
print(cosine_similarity_df.head())
Editează și rulează codul