LoslegenKostenlos starten

Einen Blogpost bereinigen

In dieser Übung bekommst du einen Auszug aus einem Blogpost. Deine Aufgabe ist es, diesen Text in ein maschinenfreundlicheres Format zu bereinigen. Dazu gehören die Umwandlung in Kleinbuchstaben, Lemmatisierung sowie das Entfernen von Stoppwörtern, Satzzeichen und nichtalphabetischen Zeichen.

Der Auszug liegt als String blog vor und wurde in der Konsole ausgegeben. Die Liste der Stoppwörter ist als stopwords verfügbar.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering für NLP in Python</Kurs>
Kurs ansehen

Übungsanweisungen

  • Nutze List Comprehension und iteriere über doc, um das lemma_ jedes Tokens zu extrahieren.
  • Entferne Stoppwörter und nichtalphabetische Tokens mit stopwords und isalpha().

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)

# Generate lemmatized tokens
lemmas = [token.____ for token in ____]

# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in ____]

# Print string after text cleaning
print(' '.join(a_lemmas))
Code bearbeiten und ausführen