Сопоставление индексов признаков с их названиями
В видеоуроке мы видели, что CountVectorizer не всегда индексирует словарь в алфавитном порядке. В этом упражнении вы научитесь сопоставлять каждый индекс признака с соответствующим словом из словаря.
Мы будем использовать те же три предложения о львах, что и в видео. Предложения доступны в виде списка corpus и уже выведены в консоль.
Это упражнение является частью курса
Конструирование признаков для NLP на Python
Инструкции к упражнению
- Создайте объект
CountVectorizerи назовите егоvectorizer. - С помощью
fit_transform()получитеbow_matrixдляcorpus. - С помощью метода
get_feature_names()сопоставьте названия столбцов с соответствующими словами из словаря.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create CountVectorizer object
vectorizer = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())
# Map the column names to vocabulary
bow_df.columns = vectorizer.____
# Print bow_df
print(bow_df)