TF-IDF DataFrame बनाना
अब जब आपने TF-IDF फीचर्स जनरेट कर लिए हैं, तो आपको उन्हें ऐसे फ़ॉर्मेट में लाना है जिसे आप रिकमेंडेशन बनाने के लिए उपयोग कर सकें.
इसके लिए आप एक बार फिर pandas का उपयोग करेंगे और array को एक DataFrame में रैप करेंगे.
क्योंकि आप डेटा को फ़िल्टर करने के लिए मूवी टाइटल्स का उपयोग करेंगे, आप इन टाइटल्स को DataFrame के index में असाइन कर सकते हैं.
df_plots DataFrame आपके लिए फिर से लोड किया गया है. इसमें Title कॉलम में फिल्मों के नाम और Plot कॉलम में उनके प्लॉट मौजूद हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में रिकमेंडेशन इंजन बनाना
अभ्यास निर्देश
- एक
TfidfVectorizerबनाएँ और उसे पिछले अभ्यास की तरह fit और transform करें. - जनरेट हुए
vectorized_dataको एक DataFrame में रैप करें.fitऔरtransformचरण में जनरेट हुए फीचर्स के नामों को उसकी column names के रूप में उपयोग करें और अपने नए DataFrame कोtfidf_dfमें असाइन करें. - मूल मूवी टाइटल्स को नए बनाए गए
tfidf_dfDataFrame के index में असाइन करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
from sklearn.feature_extraction.text import TfidfVectorizer
# Instantiate the vectorizer object and transform the plot column
vectorizer = ____(max_df=0.7, min_df=2)
vectorized_data = vectorizer.____(df_plots['Plot'])
# Create Dataframe from TF-IDFarray
tfidf_df = pd.____(____.toarray(), columns=vectorizer.____())
# Assign the movie titles to the index and inspect
tfidf_df.____ = ____['Title']
print(tfidf_df.head())