Kom igångKom igång gratis

Rensa ett blogginlägg

I den här övningen får du ett utdrag från ett blogginlägg. Din uppgift är att rensa texten så att den blir mer maskinvänlig. Det innebär att du ska konvertera till gemener, använda lemmatisering samt ta bort stoppord, skiljetecken och icke-alfabetiska tecken.

Utdraget finns tillgängligt som strängen blog och har skrivits ut i konsolen. Listan med stoppord finns tillgänglig som stopwords.

Den här övningen är en del av kursen

Funktionsutveckling för NLP i Python

Visa kurs

Övningsinstruktioner

  • Använd list comprehension och loopa igenom doc för att extrahera lemma_ för varje token.
  • Ta bort stoppord och icke-alfabetiska tokens med hjälp av stopwords och isalpha().

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)

# Generate lemmatized tokens
lemmas = [token.____ for token in ____]

# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in ____]

# Print string after text cleaning
print(' '.join(a_lemmas))
Redigera och kör kod