НачатьНачать бесплатно

Тональность авиаотзывов со стоп-словами

Вам предоставлен набор данных tweets, содержащий отзывы пассажиров и их оценки авиакомпаний. Он состоит из двух столбцов: airline_sentiment и text, где тональность может быть положительной, отрицательной или нейтральной, а text содержит текст твита.

В этом упражнении вы создадите представление в виде мешка слов с учётом стоп-слов. Напомним, что стоп-слова не несут полезной информации, поэтому их стоит убрать — это сократит словарь и в итоге уменьшит количество признаков. Имейте в виду, что стандартный список стоп-слов можно дополнить терминами, характерными для вашего контекста.

Это упражнение является частью курса

Анализ тональности текста на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте список английских стоп-слов по умолчанию.
  • Дополните список стоп-слов по умолчанию заданным списком ['airline', 'airlines', '@'], чтобы создать my_stop_words.
  • Укажите список стоп-слов в качестве аргумента векторизатора.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the stop words
from sklearn.feature_extraction.text import CountVectorizer, ____

# Define the stop words
my_stop_words = ____.____(['airline', 'airlines', '@'])

# Build and fit the vectorizer
vect = CountVectorizer(____=my_stop_words)
vect.fit(tweets.text)

# Create the bow representation
X_review = vect.transform(tweets.text)
# Create the data frame
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())
Редактировать и запускать код