Відповідність індексів ознак назвам ознак
У відеоуроці ми бачили, що CountVectorizer не обов'язково індексує словник в абетковому порядку. У цій вправі ви навчитеся зіставляти кожен індекс ознаки з відповідною назвою ознаки зі словника.
Ми використаємо ті самі три речення про левів із відео. Речення доступні в списку corpus і вже виведені в консоль.
Ця вправа є частиною курсу
Інженерія ознак для NLP у Python
Інструкції до вправи
- Створіть об'єкт
CountVectorizer. Назвіть йогоvectorizer. - За допомогою
fit_transform()згенеруйтеbow_matrixдляcorpus. - Використовуючи метод
get_feature_names(), зіставте назви стовпців із відповідним словом у словнику.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create CountVectorizer object
vectorizer = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())
# Map the column names to vocabulary
bow_df.columns = vectorizer.____
# Print bow_df
print(bow_df)