НачатьНачать бесплатно

Преобразование новых данных

При создании векторов из текста все преобразования, которые вы применяете перед обучением модели машинного обучения, необходимо также применять к новым, ранее не виденным (тестовым) данным. Для этого воспользуйтесь тем же подходом, что и в предыдущей главе: обучите векторизатор только на обучающих данных, а затем примените его к тестовым.

В этом упражнении датафрейм speech_df разбит на две части:

  • train_speech_df: обучающая выборка, состоящая из первых 45 речей.
  • test_speech_df: тестовая выборка, состоящая из оставшихся речей.

Это упражнение является частью курса

Конструирование признаков для машинного обучения в Python

Посмотреть курс

Инструкции к упражнению

  • Создайте экземпляр TfidfVectorizer.
  • Обучите векторизатор и примените его к столбцу text_clean.
  • Примените тот же векторизатор к столбцу text_clean тестовых данных.
  • Создайте датафрейм с новыми признаками на основе тестовой выборки.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')

# Fit the vectroizer and transform the data
tv_transformed = ____

# Transform test data
test_tv_transformed = ____

# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____, 
                          columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())
Редактировать и запускать код