TF-IDF на данных о тональности твитов авиакомпаний
Теперь вы построите признаки с помощью метода TF-IDF. Для работы вы продолжите использовать набор данных tweets.
В этом упражнении вы применените знания из предыдущих уроков: удалите стоп-слова, зададите шаблон токена и укажете n-граммы.
Результатом станет DataFrame, столбцы которого сформированы с помощью TfidfVectorizer(). Такой DataFrame можно напрямую передать в модель обучения с учителем — именно этим мы займёмся в следующей главе.
Это упражнение является частью курса
Анализ тональности текста на Python
Инструкции к упражнению
- Импортируйте необходимый пакет для построения
TfidfVectorizerиENGLISH_STOP_WORDS. - Постройте TF-IDF векторизатор на основе столбца
textнабора данныхtweets, указав уни- и биграммы в качестве n-граммов, шаблон токена, включающий только буквенно-цифровые символы, и стоп-слова изENGLISH_STOP_WORDS. - Примените векторизатор методом transform, указав тот же столбец, на котором выполнялось обучение.
- Укажите названия столбцов в функции
DataFrame().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the required vectorizer package and stop words list
____
# Define the vectorizer and specify the arguments
my_pattern = r'\b[^\d\W][^\d\W]+\b'
vect = ____(____=(1, 2), max_features=100, ____=my_pattern, ____=ENGLISH_STOP_WORDS).fit(tweets.text)
# Transform the vectorizer
X_txt = vect.____(____.____)
# Transform to a data frame and specify the column names
X=pd.DataFrame(X_txt.toarray(), columns=____.____)
print('Top 5 rows of the DataFrame: ', X.head())