Repérer des fichiers
Vous n'êtes pas satisfait de votre nettoyage du jeu de données de tweets. Il reste encore des chaînes qui n'apportent aucun indice de sentiment. Parmi elles, on trouve des chaînes qui renvoient à des noms de fichiers texte.
Vous avez aussi trouvé une façon de les détecter :
- Elles apparaissent au début de la chaîne.
- Elles commencent toujours par une séquence de 2 ou 3 voyelles en majuscules ou minuscules (a e i o u).
- Elles se terminent toujours par le suffixe
txt.
Vous n'êtes pas certain de devoir les supprimer directement. Vous écrivez donc un script pour les trouver et les stocker dans un jeu de données distinct.
Vous notez quelques métacaractères pour vous aider : ^ ancre au début, . n'importe quel caractère.
La variable sentiment_analysis qui contient le texte de deux tweets, ainsi que le module re, sont déjà chargés dans votre session. Vous pouvez utiliser print() pour les afficher dans l'IPython Shell.
Cette activité fait partie du cours
Expressions régulières en Python
Instructions de l’exercice
- Écrivez une regex qui met en correspondance le motif des noms de fichiers texte, p. ex.
aemyfile.txt. - Trouvez toutes les correspondances de la regex dans les éléments de
sentiment_analysis. Affichez le résultat. - Remplacez toutes les correspondances de la regex par une chaîne vide
"". Affichez le résultat.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))