TF-IDF के साथ अपनी सभी फ़िल्मों की तुलना
अब जब आपने TF-IDF डेटा को उपयोगी फ़ॉर्मेट में लाने का कठिन काम कर लिया है, तो इसे समानताएँ ढूँढने और सिफारिशें जनरेट करने के लिए इस्तेमाल करने का समय है.
इस बार, क्योंकि आप TF-IDF स्कोर (जो Booleans के बजाय floats होते हैं) का उपयोग कर रहे हैं, इसलिए आप items के बीच समानता पाने के लिए cosine similarity मेट्रिक का उपयोग करेंगे. इस अभ्यास में, आप सभी फ़िल्मों के बीच cosine similarities की एक मैट्रिक्स जनरेट करेंगे और उन्हें आसान lookup के लिए एक DataFrame में स्टोर करेंगे. इससे आप फ़िल्मों की तुलना कर पाएँगे और तेज़ी से सिफारिशें ढूँढ पाएँगे.
पिछले अभ्यास में बनाया गया tfidf_df DataFrame, जिसमें हर फ़िल्म की एक पंक्ति है, आपके लिए लोड किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में रिकमेंडेशन इंजन बनाना
अभ्यास निर्देश
- सभी फ़िल्मों के बीच cosine similarity माप निकालें और परिणाम
cosine_similarity_arrayमें असाइन करें. cosine_similarity_arrayसे एक DataFrame बनाएँ, जिसकी rows और columns के लिएtfidf_summary_df.indexका उपयोग करें.- DataFrame की पहले पाँच पंक्तियाँ प्रिंट करें और similarity स्कोर जाँचें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import cosine_similarity measure
from sklearn.metrics.pairwise import ____
# Create the array of cosine similarity values
cosine_similarity_array = ____(tfidf_summary_df)
# Wrap the array in a pandas DataFrame
cosine_similarity_df = pd.____(cosine_similarity_array, ____=____.____, ____=____.____)
# Print the top 5 rows of the DataFrame
print(cosine_similarity_df.head())