Кілька текстових стовпців
У цій вправі ви продовжите працювати з даними Twitter авіаліній. Набір даних tweets уже імпортовано для вас.
Інколи у наборі даних може бути більше ніж один текстовий стовпець, і вам може знадобитися створити числове подання для кожного з них. Тут, окрім стовпця text, що містить основний текст твіту, є другий текстовий стовпець, negativereason. У ньому вказано причину, через яку клієнт залишив негативний відгук.
Ваше завдання — побудувати подання BOW для обох стовпців і вказати потрібні стоп-слова.
Ця вправа є частиною курсу
Аналіз тональності в Python
Інструкції до вправи
- Імпортуйте пакет для векторизації та стандартний список англійських стоп-слів.
- Оновіть стандартний список англійських стоп-слів і створіть множину
my_stop_words. - У першому векторизаторі задайте аргумент стоп-слів як оновлену множину, а в другому — як стандартний список англійських стоп-слів.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the vectorizer and default English stop words list
____
# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____)
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)
# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())