ПочатиПочніть безкоштовно

Настрій щодо авіаліній зі стоп-словами

Надано набір даних tweets із відгуками клієнтів та їхнім ставленням до авіаліній. Він містить два стовпці: airline_sentiment і text, де sentiment може бути позитивним, негативним або нейтральним, а text — це текст твіту.

У цій вправі ви створите представлення BOW, але з урахуванням стоп-слів. Пам'ятайте, що стоп-слова неінформативні, і їх варто вилучати. Це зменшить словник і, зрештою, кількість ознак. Майте на увазі, що до типового списку стоп-слів можна додати слова, специфічні для нашого контексту.

Ця вправа є частиною курсу

Аналіз тональності в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте типовий список англійських стоп-слів.
  • Оновіть типовий список стоп-слів заданим списком ['airline', 'airlines', '@'] і створіть my_stop_words.
  • Укажіть аргумент stop_words у векторизаторі.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the stop words
from sklearn.feature_extraction.text import CountVectorizer, ____

# Define the stop words
my_stop_words = ____.____(['airline', 'airlines', '@'])

# Build and fit the vectorizer
vect = CountVectorizer(____=my_stop_words)
vect.fit(tweets.text)

# Create the bow representation
X_review = vect.transform(tweets.text)
# Create the data frame
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())
Редагувати та запускати код