Nettoyer des TED Talks dans un dataframe
Dans cet exercice, nous allons revenir sur les TED Talks du premier chapitre. On vous a fourni un dataframe ted composé de 5 TED Talks. Votre tâche consiste à nettoyer ces allocutions à l'aide des techniques vues plus tôt en écrivant une fonction preprocess et en l'appliquant à la caractéristique transcript du dataframe.
La liste des mots vides est disponible sous stopwords.
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le NLP en Python
Instructions de l’exercice
- Générez l'objet Doc pour
text. Ignorez l'argumentdisablepour le moment. - Générez les lemmes au moyen d'une compréhension de liste avec l'attribut
lemma_. - Retirez les caractères non alphabétiques en utilisant
isalpha()dans la condition if.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Function to preprocess text
def preprocess(text):
# Create Doc object
doc = nlp(____, disable=['ner', 'parser'])
# Generate lemmas
lemmas = [token.____ for token in doc]
# Remove stopwords and non-alphabetic characters
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in stopwords]
return ' '.join(a_lemmas)
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])