Настрій щодо авіаліній зі стоп-словами
Надано набір даних tweets із відгуками клієнтів та їхнім ставленням до авіаліній. Він містить два стовпці: airline_sentiment і text, де sentiment може бути позитивним, негативним або нейтральним, а text — це текст твіту.
У цій вправі ви створите представлення BOW, але з урахуванням стоп-слів. Пам'ятайте, що стоп-слова неінформативні, і їх варто вилучати. Це зменшить словник і, зрештою, кількість ознак. Майте на увазі, що до типового списку стоп-слів можна додати слова, специфічні для нашого контексту.
Ця вправа є частиною курсу
Аналіз тональності в Python
Інструкції до вправи
- Імпортуйте типовий список англійських стоп-слів.
- Оновіть типовий список стоп-слів заданим списком
['airline', 'airlines', '@']і створітьmy_stop_words. - Укажіть аргумент stop_words у векторизаторі.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the stop words
from sklearn.feature_extraction.text import CountVectorizer, ____
# Define the stop words
my_stop_words = ____.____(['airline', 'airlines', '@'])
# Build and fit the vectorizer
vect = CountVectorizer(____=my_stop_words)
vect.fit(tweets.text)
# Create the bow representation
X_review = vect.transform(tweets.text)
# Create the data frame
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())