НачатьНачать бесплатно

Несколько текстовых столбцов

В этом упражнении вы продолжите работу с данными Twitter об авиакомпаниях. Набор данных tweets уже импортирован.

Иногда в наборе данных может быть несколько текстовых столбцов, и для каждого из них нужно построить числовое представление. Помимо столбца text с текстом твита, здесь есть второй текстовый столбец — negativereason. Он содержит причину, по которой клиент оставил негативный отзыв.

Ваша задача — построить представления «мешка слов» для обоих столбцов и указать необходимые стоп-слова.

Это упражнение является частью курса

Анализ тональности текста на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте пакет векторизатора и стандартный список английских стоп-слов.
  • Обновите стандартный список английских стоп-слов и создайте множество my_stop_words.
  • В первом векторизаторе укажите в качестве аргумента стоп-слов обновлённое множество, а во втором — стандартный набор английских стоп-слов.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the vectorizer and default English stop words list
____

# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
 
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____) 
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)

# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())
Редактировать и запускать код