Transformer des données inédites
Quand vous créez des vecteurs à partir de texte, toutes les transformations effectuées avant l'entraînement d'un modèle de Machine Learning doivent aussi être appliquées aux nouvelles données inédites (test). Pour ce faire, suivez la même approche que dans le chapitre précédent : ajustez le vectoriseur uniquement sur les données d'entraînement et appliquez-le ensuite aux données de test.
Pour cet exercice, le DataFrame speech_df a été scindé en deux :
train_speech_df: l'ensemble d'entraînement composé des 45 premiers discours.test_speech_df: l'ensemble de test composé des discours restants.
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le Machine Learning en Python
Instructions de l’exercice
- Instanciez
TfidfVectorizer. - Ajustez le vectoriseur et appliquez-le à la colonne
text_clean. - Appliquez le même vectoriseur à la colonne
text_cleandes données de test. - Créez un DataFrame avec ces nouvelles caractéristiques à partir de l'ensemble de test.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')
# Fit the vectroizer and transform the data
tv_transformed = ____
# Transform test data
test_tv_transformed = ____
# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____,
columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())