Преобразование новых данных
При создании векторов из текста все преобразования, которые вы применяете перед обучением модели машинного обучения, необходимо также применять к новым, ранее не виденным (тестовым) данным. Для этого воспользуйтесь тем же подходом, что и в предыдущей главе: обучите векторизатор только на обучающих данных, а затем примените его к тестовым.
В этом упражнении датафрейм speech_df разбит на две части:
train_speech_df: обучающая выборка, состоящая из первых 45 речей.test_speech_df: тестовая выборка, состоящая из оставшихся речей.
Это упражнение является частью курса
Конструирование признаков для машинного обучения в Python
Инструкции к упражнению
- Создайте экземпляр
TfidfVectorizer. - Обучите векторизатор и примените его к столбцу
text_clean. - Примените тот же векторизатор к столбцу
text_cleanтестовых данных. - Создайте датафрейм с новыми признаками на основе тестовой выборки.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')
# Fit the vectroizer and transform the data
tv_transformed = ____
# Transform test data
test_tv_transformed = ____
# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____,
columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())