TfIdf для даних настроїв авіаліній у Twitter
Тепер ви побудуєте ознаки за допомогою методу TfIdf. Ви продовжите працювати з набором даних tweets.
У цій вправі ви застосуєте те, що вивчили в попередніх уроках: приберете стоп-слова, використаєте шаблон токенів і задасте n-граму.
Підсумком буде датафрейм, стовпці якого створені за допомогою TfidfVectorizer(). Такий датафрейм можна безпосередньо передати моделі з учителем — цим ми займемося в наступному розділі.
Ця вправа є частиною курсу
Аналіз тональності в Python
Інструкції до вправи
- Імпортуйте потрібний пакет для побудови TfidfVectorizer і
ENGLISH_STOP_WORDS. - Побудуйте векторизатор TfIdf з колонки
textу наборі данихtweets, вказавши як варіанти n-грам уніграми та біграми, токени лише з алфанумеричних символів за наданим шаблоном токенів і стоп-слова, що відповідаютьENGLISH_STOP_WORDS. - Застосуйте перетворення векторизатора, указавши ту саму колонку, на якій ви виконували підгонку.
- Задайте назви стовпців у функції
DataFrame().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the required vectorizer package and stop words list
____
# Define the vectorizer and specify the arguments
my_pattern = r'\b[^\d\W][^\d\W]+\b'
vect = ____(____=(1, 2), max_features=100, ____=my_pattern, ____=ENGLISH_STOP_WORDS).fit(tweets.text)
# Transform the vectorizer
X_txt = vect.____(____.____)
# Transform to a data frame and specify the column names
X=pd.DataFrame(X_txt.toarray(), columns=____.____)
print('Top 5 rows of the DataFrame: ', X.head())