НачатьНачать бесплатно

Шаг 2: создание векторизатора

В этом упражнении вам нужно построить TfIdf-преобразование столбца review из набора данных reviews. Укажите n-граммы, стоп-слова, шаблон токенов и размер словаря.

Это последний шаг перед обучением классификатора для предсказания тональности отзыва.

Обратите особое внимание на максимальное количество признаков: слишком большой словарь может привести к разрыву сессии.

Это упражнение является частью курса

Анализ тональности текста на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте TfIdf-векторизатор и стандартный список английских стоп-слов.
  • Создайте TfIdf-векторизатор, указав — в следующем порядке — аргументы: в качестве стоп-слов используйте стандартный список английских стоп-слов; для n-грамм используйте уни- и биграммы; максимальное количество признаков должно быть равно 200; захватывайте только слова по заданному шаблону.
  • Создайте DataFrame с помощью TfIdf-векторизатора.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____

# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)

# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())
Редактировать и запускать код