फीचर इंडेक्स को फीचर नामों से मैप करना
लेसन वीडियो में आपने देखा था कि CountVectorizer जरूरी नहीं कि vocabulary को alphabetical क्रम में index करे। इस अभ्यास में, आप सीखेंगे कि प्रत्येक फीचर इंडेक्स को vocabulary में उसके संबंधित फीचर नाम से कैसे मैप करें।
हम वीडियो वाले ही शेरों पर आधारित तीन वाक्य इस्तेमाल करेंगे। ये वाक्य corpus नाम की एक लिस्ट में उपलब्ध हैं और उन्हें पहले ही कंसोल पर प्रिंट किया जा चुका है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में NLP के लिए Feature Engineering
अभ्यास निर्देश
- एक
CountVectorizerऑब्जेक्ट instantiate करें। इसका नामvectorizerरखें। fit_transform()का उपयोग करकेcorpusके लिएbow_matrixजनरेट करें।get_feature_names()मेथड का उपयोग करके कॉलम नामों को vocabulary के संबंधित शब्दों से मैप करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create CountVectorizer object
vectorizer = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())
# Map the column names to vocabulary
bow_df.columns = vectorizer.____
# Print bow_df
print(bow_df)