ПочатиПочніть безкоштовно

Перетворення невиданих даних

Створюючи вектори з тексту, усі перетворення, які ви виконуєте перед навчанням моделі машинного навчання, потрібно застосувати й до нових, ще невиданих (тестових) даних. Для цього дотримуйтеся підходу з попереднього розділу: навчайте векторизатор лише на тренувальних даних і застосовуйте його до тестових даних.

У цій вправі датафрейм speech_df поділено на дві частини:

  • train_speech_df: тренувальна вибірка з перших 45 промов.
  • test_speech_df: тестова вибірка з решти промов.

Ця вправа є частиною курсу

Feature Engineering для машинного навчання в Python

Переглянути курс

Інструкції до вправи

  • Створіть екземпляр TfidfVectorizer.
  • Навчіть векторизатор і застосуйте його до стовпця text_clean.
  • Застосуйте той самий векторизатор до стовпця text_clean у тестових даних.
  • Створіть датафрейм із цих нових ознак для тестової вибірки.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')

# Fit the vectroizer and transform the data
tv_transformed = ____

# Transform test data
test_tv_transformed = ____

# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____, 
                          columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())
Редагувати та запускати код