Тональность авиаотзывов со стоп-словами
Вам предоставлен набор данных tweets, содержащий отзывы пассажиров и их оценки авиакомпаний. Он состоит из двух столбцов: airline_sentiment и text, где тональность может быть положительной, отрицательной или нейтральной, а text содержит текст твита.
В этом упражнении вы создадите представление в виде мешка слов с учётом стоп-слов. Напомним, что стоп-слова не несут полезной информации, поэтому их стоит убрать — это сократит словарь и в итоге уменьшит количество признаков. Имейте в виду, что стандартный список стоп-слов можно дополнить терминами, характерными для вашего контекста.
Это упражнение является частью курса
Анализ тональности текста на Python
Инструкции к упражнению
- Импортируйте список английских стоп-слов по умолчанию.
- Дополните список стоп-слов по умолчанию заданным списком
['airline', 'airlines', '@'], чтобы создатьmy_stop_words. - Укажите список стоп-слов в качестве аргумента векторизатора.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the stop words
from sklearn.feature_extraction.text import CountVectorizer, ____
# Define the stop words
my_stop_words = ____.____(['airline', 'airlines', '@'])
# Build and fit the vectorizer
vect = CountVectorizer(____=my_stop_words)
vect.fit(tweets.text)
# Create the bow representation
X_review = vect.transform(tweets.text)
# Create the data frame
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())