TED-Talks in einem DataFrame bereinigen
In dieser Übung greifen wir die TED-Talks aus dem ersten Kapitel wieder auf. Du hast einen DataFrame ted mit 5 TED-Talks erhalten. Deine Aufgabe ist es, diese Talks mit den zuvor besprochenen Techniken zu bereinigen, indem du eine Funktion preprocess schreibst und sie auf das Feature transcript des DataFrames anwendest.
Die Stopwortliste ist als stopwords verfügbar.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering für NLP in Python</Kurs>Übungsanweisungen
- Erzeuge das Doc-Objekt für
text. Ignoriere das Argumentdisablevorerst. - Erzeuge Lemmata per List Comprehension über das Attribut
lemma_. - Entferne nicht-alphabetische Zeichen, indem du
isalpha()in der if-Bedingung verwendest.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Function to preprocess text
def preprocess(text):
# Create Doc object
doc = nlp(____, disable=['ner', 'parser'])
# Generate lemmas
lemmas = [token.____ for token in doc]
# Remove stopwords and non-alphabetic characters
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in stopwords]
return ' '.join(a_lemmas)
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])