शुरू करेंमुफ़्त में शुरू करें

TF-IDF मॉडल इंस्टैंशिएट करें

डिफ़ॉल्ट रूप से TF-IDF आपके सभी डॉक्यूमेंट्स (हमारे मामले में मूवी समरी) में आने वाले हर शब्द के लिए एक कॉलम बनाता है. इससे डेटासेट बहुत बड़ा और कम सहज हो जाता है, क्योंकि इसमें वे बहुत सामान्य शब्द भी होंगे जो हर डॉक्यूमेंट में आते हैं, और वे अत्यंत दुर्लभ शब्द भी जो आइटम्स के बीच समानता खोजने में कोई उपयोगी जानकारी नहीं देते.

इस अभ्यास में, आप df_plots DataFrame के साथ काम करेंगे. इसमें Title कॉलम में मूवी के नाम हैं और Plot कॉलम में उनके प्लॉट हैं.

इसी DataFrame का उपयोग करके, आप डिफ़ॉल्ट TF-IDF स्कोर जनरेट करेंगे और देखेंगे कि क्या गैर-उपयोगी कॉलम मौजूद हैं.

फिर आप TF-IDF कैलकुलेशन दोबारा चलाएँगे, इस बार min_df और max_df आर्ग्युमेंट्स का उपयोग करके कॉलम्स की संख्या सीमित करेंगे, और उम्मीद है कि आपको सुधार दिखाई देगा.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में रिकमेंडेशन इंजन बनाना

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

from sklearn.feature_extraction.text import TfidfVectorizer

# Instantiate the vectorizer object to the vectorizer variable
vectorizer = ____()

# Fit and transform the plot column
vectorized_data = vectorizer.____(df_plots['Plot'])

# Look at the features generated
print(____.____())
कोड संपादित करें और चलाएँ