ПочатиПочніть безкоштовно

Крок 2: Створення векторизатора

У цій вправі вам потрібно побудувати перетворення TfIDf для стовпця review у наборі даних reviews. Потрібно задати аргументи: n-грами, стоп-слова, шаблон токенів і розмір словника.

Це останній крок перед тренуванням класифікатора для передбачення тональності відгуку.

Переконайтеся, що ви правильно вкажете максимальну кількість ознак, адже надто великий розмір словника може розірвати ваше сеанс.

Ця вправа є частиною курсу

Аналіз тональності в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте Tfidf-векторизатор і типовий список англійських стоп-слів.
  • Побудуйте Tfidf-векторизатор, задавши — саме в такому порядку — такі аргументи: як стоп-слова використовуйте типовий список англійських стоп-слів; як n-грами використовуйте уніграм і біграм; максимальна кількість ознак має бути 200; захоплюйте лише слова за допомогою вказаного шаблону.
  • Створіть DataFrame, використовуючи Tfidf-векторизатор.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____

# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)

# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())
Редагувати та запускати код