Несколько текстовых столбцов
В этом упражнении вы продолжите работу с данными Twitter об авиакомпаниях. Набор данных tweets уже импортирован.
Иногда в наборе данных может быть несколько текстовых столбцов, и для каждого из них нужно построить числовое представление. Помимо столбца text с текстом твита, здесь есть второй текстовый столбец — negativereason. Он содержит причину, по которой клиент оставил негативный отзыв.
Ваша задача — построить представления «мешка слов» для обоих столбцов и указать необходимые стоп-слова.
Это упражнение является частью курса
Анализ тональности текста на Python
Инструкции к упражнению
- Импортируйте пакет векторизатора и стандартный список английских стоп-слов.
- Обновите стандартный список английских стоп-слов и создайте множество
my_stop_words. - В первом векторизаторе укажите в качестве аргумента стоп-слов обновлённое множество, а во втором — стандартный набор английских стоп-слов.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the vectorizer and default English stop words list
____
# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____)
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)
# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())