Začněte nyníZačněte zdarma

Porovnání všech filmů pomocí TF-IDF

Teď, když máš TF-IDF data připravená v použitelném formátu, je čas je využít – najít podobnosti a generovat doporučení.

Protože pracuješ s hodnotami TF-IDF (což jsou čísla s plovoucí desetinnou čárkou, ne booleovské hodnoty), použiješ k měření podobnosti mezi položkami metriku kosinové podobnosti. V tomto cvičení sestavíš matici kosinových podobností pro všechny filmy a uložíš ji do DataFramu, aby bylo vyhledávání jednoduché a rychlé. Díky tomu budeš moct filmy snadno porovnávat a nacházet doporučení.

DataFrame tfidf_df, který jsi vytvořil/a v předchozím cvičení a který obsahuje jeden řádek pro každý film, je už načtený.

Toto cvičení je součástí kurzu

Tvorba doporučovacích systémů v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Vypočítej míry kosinové podobnosti mezi všemi filmy a výsledky ulož do proměnné cosine_similarity_array.
  • Z pole cosine_similarity_array vytvoř DataFrame, kde řádky i sloupce odpovídají indexu tfidf_summary_df.index.
  • Vypiš prvních pět řádků DataFramu a prozkoumej hodnoty podobnosti.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import cosine_similarity measure
from sklearn.metrics.pairwise import ____

# Create the array of cosine similarity values
cosine_similarity_array = ____(tfidf_summary_df)

# Wrap the array in a pandas DataFrame
cosine_similarity_df = pd.____(cosine_similarity_array, ____=____.____, ____=____.____)

# Print the top 5 rows of the DataFrame
print(cosine_similarity_df.head())
Upravit a spustit kód