НачатьНачать бесплатно

Сопоставление индексов признаков с их названиями

В видеоуроке мы видели, что CountVectorizer не всегда индексирует словарь в алфавитном порядке. В этом упражнении вы научитесь сопоставлять каждый индекс признака с соответствующим словом из словаря.

Мы будем использовать те же три предложения о львах, что и в видео. Предложения доступны в виде списка corpus и уже выведены в консоль.

Это упражнение является частью курса

Конструирование признаков для NLP на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте объект CountVectorizer и назовите его vectorizer.
  • С помощью fit_transform() получите bow_matrix для corpus.
  • С помощью метода get_feature_names() сопоставьте названия столбцов с соответствующими словами из словаря.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create CountVectorizer object
vectorizer = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())

# Map the column names to vocabulary 
bow_df.columns = vectorizer.____

# Print bow_df
print(bow_df)
Редактировать и запускать код