НачатьНачать бесплатно

TF-IDF на данных о тональности твитов авиакомпаний

Теперь вы построите признаки с помощью метода TF-IDF. Для работы вы продолжите использовать набор данных tweets.

В этом упражнении вы применените знания из предыдущих уроков: удалите стоп-слова, зададите шаблон токена и укажете n-граммы.

Результатом станет DataFrame, столбцы которого сформированы с помощью TfidfVectorizer(). Такой DataFrame можно напрямую передать в модель обучения с учителем — именно этим мы займёмся в следующей главе.

Это упражнение является частью курса

Анализ тональности текста на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте необходимый пакет для построения TfidfVectorizer и ENGLISH_STOP_WORDS.
  • Постройте TF-IDF векторизатор на основе столбца text набора данных tweets, указав уни- и биграммы в качестве n-граммов, шаблон токена, включающий только буквенно-цифровые символы, и стоп-слова из ENGLISH_STOP_WORDS.
  • Примените векторизатор методом transform, указав тот же столбец, на котором выполнялось обучение.
  • Укажите названия столбцов в функции DataFrame().

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the required vectorizer package and stop words list
____

# Define the vectorizer and specify the arguments
my_pattern = r'\b[^\d\W][^\d\W]+\b'
vect = ____(____=(1, 2), max_features=100, ____=my_pattern, ____=ENGLISH_STOP_WORDS).fit(tweets.text)

# Transform the vectorizer
X_txt = vect.____(____.____)

# Transform to a data frame and specify the column names
X=pd.DataFrame(X_txt.toarray(), columns=____.____)
print('Top 5 rows of the DataFrame: ', X.head())
Редактировать и запускать код