Перетворення невиданих даних
Створюючи вектори з тексту, усі перетворення, які ви виконуєте перед навчанням моделі машинного навчання, потрібно застосувати й до нових, ще невиданих (тестових) даних. Для цього дотримуйтеся підходу з попереднього розділу: навчайте векторизатор лише на тренувальних даних і застосовуйте його до тестових даних.
У цій вправі датафрейм speech_df поділено на дві частини:
train_speech_df: тренувальна вибірка з перших 45 промов.test_speech_df: тестова вибірка з решти промов.
Ця вправа є частиною курсу
Feature Engineering для машинного навчання в Python
Інструкції до вправи
- Створіть екземпляр
TfidfVectorizer. - Навчіть векторизатор і застосуйте його до стовпця
text_clean. - Застосуйте той самий векторизатор до стовпця
text_cleanу тестових даних. - Створіть датафрейм із цих нових ознак для тестової вибірки.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')
# Fit the vectroizer and transform the data
tv_transformed = ____
# Transform test data
test_tv_transformed = ____
# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____,
columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())