Nettoyer votre texte
Les données textuelles non structurées ne peuvent pas être utilisées directement dans la plupart des analyses. Plusieurs étapes sont nécessaires pour passer d'une longue chaîne libre à un ensemble de colonnes numériques, dans le bon format, pouvant être ingérées par un modèle de Machine Learning. La première étape consiste à standardiser les données et à éliminer tout caractère qui pourrait poser problème plus tard dans votre chaîne analytique.
Dans ce chapitre, vous travaillerez avec un nouveau jeu de données contenant les discours d'investiture des présidents des États-Unis, chargé sous speech_df, avec les discours stockés dans la colonne text.
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le Machine Learning en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Print the first 5 rows of the text column
print(____)