ПочатиПочніть безкоштовно

Кілька текстових стовпців

У цій вправі ви продовжите працювати з даними Twitter авіаліній. Набір даних tweets уже імпортовано для вас.

Інколи у наборі даних може бути більше ніж один текстовий стовпець, і вам може знадобитися створити числове подання для кожного з них. Тут, окрім стовпця text, що містить основний текст твіту, є другий текстовий стовпець, negativereason. У ньому вказано причину, через яку клієнт залишив негативний відгук.

Ваше завдання — побудувати подання BOW для обох стовпців і вказати потрібні стоп-слова.

Ця вправа є частиною курсу

Аналіз тональності в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте пакет для векторизації та стандартний список англійських стоп-слів.
  • Оновіть стандартний список англійських стоп-слів і створіть множину my_stop_words.
  • У першому векторизаторі задайте аргумент стоп-слів як оновлену множину, а в другому — як стандартний список англійських стоп-слів.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the vectorizer and default English stop words list
____

# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
 
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____) 
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)

# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())
Редагувати та запускати код