ÎncepețiÎncepe gratuit

Transformarea datelor nevăzute

Când creezi vectori din text, orice transformări aplicate înainte de antrenarea unui model de machine learning trebuie aplicate și asupra datelor noi, nevăzute (de testare). Pentru a realiza acest lucru, urmează aceeași abordare din capitolul anterior: antrenează vectorizatorul doar pe datele de antrenament și aplică-l pe datele de testare.

Pentru acest exercițiu, DataFrame-ul speech_df a fost împărțit în două:

  • train_speech_df: Setul de antrenament, format din primele 45 de discursuri.
  • test_speech_df: Setul de testare, format din discursurile rămase.

Acest exercițiu face parte din cursul

Ingineria caracteristicilor pentru Machine Learning în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Instanțiază TfidfVectorizer.
  • Antrenează vectorizatorul și aplică-l pe coloana text_clean.
  • Aplică același vectorizator pe coloana text_clean din datele de testare.
  • Creează un DataFrame cu aceste noi caracteristici din setul de testare.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')

# Fit the vectroizer and transform the data
tv_transformed = ____

# Transform test data
test_tv_transformed = ____

# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____, 
                          columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())
Editează și rulează codul