Einen Blogpost bereinigen
In dieser Übung bekommst du einen Auszug aus einem Blogpost. Deine Aufgabe ist es, diesen Text in ein maschinenfreundlicheres Format zu bereinigen. Dazu gehören die Umwandlung in Kleinbuchstaben, Lemmatisierung sowie das Entfernen von Stoppwörtern, Satzzeichen und nichtalphabetischen Zeichen.
Der Auszug liegt als String blog vor und wurde in der Konsole ausgegeben. Die Liste der Stoppwörter ist als stopwords verfügbar.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering für NLP in Python</Kurs>Übungsanweisungen
- Nutze List Comprehension und iteriere über
doc, um daslemma_jedes Tokens zu extrahieren. - Entferne Stoppwörter und nichtalphabetische Tokens mit
stopwordsundisalpha().
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)
# Generate lemmatized tokens
lemmas = [token.____ for token in ____]
# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in ____]
# Print string after text cleaning
print(' '.join(a_lemmas))