Porovnání všech filmů pomocí TF-IDF
Teď, když máš TF-IDF data připravená v použitelném formátu, je čas je využít – najít podobnosti a generovat doporučení.
Protože pracuješ s hodnotami TF-IDF (což jsou čísla s plovoucí desetinnou čárkou, ne booleovské hodnoty), použiješ k měření podobnosti mezi položkami metriku kosinové podobnosti. V tomto cvičení sestavíš matici kosinových podobností pro všechny filmy a uložíš ji do DataFramu, aby bylo vyhledávání jednoduché a rychlé. Díky tomu budeš moct filmy snadno porovnávat a nacházet doporučení.
DataFrame tfidf_df, který jsi vytvořil/a v předchozím cvičení a který obsahuje jeden řádek pro každý film, je už načtený.
Toto cvičení je součástí kurzu
Tvorba doporučovacích systémů v Pythonu
Pokyny k cvičení
- Vypočítej míry kosinové podobnosti mezi všemi filmy a výsledky ulož do proměnné
cosine_similarity_array. - Z pole
cosine_similarity_arrayvytvoř DataFrame, kde řádky i sloupce odpovídají indexutfidf_summary_df.index. - Vypiš prvních pět řádků DataFramu a prozkoumej hodnoty podobnosti.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import cosine_similarity measure
from sklearn.metrics.pairwise import ____
# Create the array of cosine similarity values
cosine_similarity_array = ____(tfidf_summary_df)
# Wrap the array in a pandas DataFrame
cosine_similarity_df = pd.____(cosine_similarity_array, ____=____.____, ____=____.____)
# Print the top 5 rows of the DataFrame
print(cosine_similarity_df.head())