LoslegenKostenlos starten

TED-Talks in einem DataFrame bereinigen

In dieser Übung greifen wir die TED-Talks aus dem ersten Kapitel wieder auf. Du hast einen DataFrame ted mit 5 TED-Talks erhalten. Deine Aufgabe ist es, diese Talks mit den zuvor besprochenen Techniken zu bereinigen, indem du eine Funktion preprocess schreibst und sie auf das Feature transcript des DataFrames anwendest.

Die Stopwortliste ist als stopwords verfügbar.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering für NLP in Python</Kurs>
Kurs ansehen

Übungsanweisungen

  • Erzeuge das Doc-Objekt für text. Ignoriere das Argument disable vorerst.
  • Erzeuge Lemmata per List Comprehension über das Attribut lemma_.
  • Entferne nicht-alphabetische Zeichen, indem du isalpha() in der if-Bedingung verwendest.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Function to preprocess text
def preprocess(text):
  	# Create Doc object
    doc = nlp(____, disable=['ner', 'parser'])
    # Generate lemmas
    lemmas = [token.____ for token in doc]
    # Remove stopwords and non-alphabetic characters
    a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in stopwords]
    
    return ' '.join(a_lemmas)
  
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])
Code bearbeiten und ausführen