Recherche de fichiers
Vous n’êtes pas satisfait de votre nettoyage du jeu de données de tweets. Il reste encore des chaînes qui n’apportent aucun sentiment. Parmi elles, des chaînes qui renvoient à des noms de fichiers texte.
Vous avez également trouvé un moyen de les détecter :
- Elles apparaissent au début de la chaîne.
- Elles commencent toujours par une suite de 2 ou 3 voyelles en majuscules ou minuscules (a e i o u).
- Elles se terminent toujours par la chaîne
txt.
Vous n’êtes pas sûr de devoir les supprimer directement. Vous écrivez donc un script pour les repérer et les stocker dans un jeu de données séparé.
Vous notez quelques métacaractères utiles : ^ ancre en début, . n’importe quel caractère.
La variable sentiment_analysis contenant le texte de deux tweets ainsi que le module re sont déjà chargés dans votre session. Vous pouvez utiliser print() pour l’afficher dans l’IPython Shell.
Cet exercice fait partie du cours
<cours>Expressions rationnelles en Python</cours>Instructions de l’exercice
- Écrivez une regex qui correspond au motif des noms de fichiers texte, par exemple
aemyfile.txt. - Trouvez toutes les correspondances de la regex dans les éléments de
sentiment_analysis. Affichez le résultat. - Remplacez toutes les correspondances de la regex par une chaîne vide
"". Affichez le résultat.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))