CommencezCommencez gratuitement

Nettoyer des TED Talks dans un dataframe

Dans cet exercice, nous allons revenir sur les TED Talks du premier chapitre. On vous a fourni un dataframe ted composé de 5 TED Talks. Votre tâche consiste à nettoyer ces allocutions à l'aide des techniques vues plus tôt en écrivant une fonction preprocess et en l'appliquant à la caractéristique transcript du dataframe.

La liste des mots vides est disponible sous stopwords.

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le NLP en Python

Voir le cours

Instructions de l’exercice

  • Générez l'objet Doc pour text. Ignorez l'argument disable pour le moment.
  • Générez les lemmes au moyen d'une compréhension de liste avec l'attribut lemma_.
  • Retirez les caractères non alphabétiques en utilisant isalpha() dans la condition if.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Function to preprocess text
def preprocess(text):
  	# Create Doc object
    doc = nlp(____, disable=['ner', 'parser'])
    # Generate lemmas
    lemmas = [token.____ for token in doc]
    # Remove stopwords and non-alphabetic characters
    a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in stopwords]
    
    return ' '.join(a_lemmas)
  
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])
Modifier et exécuter le code