Transformarea datelor nevăzute
Când creezi vectori din text, orice transformări aplicate înainte de antrenarea unui model de machine learning trebuie aplicate și asupra datelor noi, nevăzute (de testare). Pentru a realiza acest lucru, urmează aceeași abordare din capitolul anterior: antrenează vectorizatorul doar pe datele de antrenament și aplică-l pe datele de testare.
Pentru acest exercițiu, DataFrame-ul speech_df a fost împărțit în două:
train_speech_df: Setul de antrenament, format din primele 45 de discursuri.test_speech_df: Setul de testare, format din discursurile rămase.
Acest exercițiu face parte din cursul
Ingineria caracteristicilor pentru Machine Learning în Python
Instrucțiuni pentru exercițiu
- Instanțiază
TfidfVectorizer. - Antrenează vectorizatorul și aplică-l pe coloana
text_clean. - Aplică același vectorizator pe coloana
text_cleandin datele de testare. - Creează un DataFrame cu aceste noi caracteristici din setul de testare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')
# Fit the vectroizer and transform the data
tv_transformed = ____
# Transform test data
test_tv_transformed = ____
# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____,
columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())