Rensa ett blogginlägg
I den här övningen får du ett utdrag från ett blogginlägg. Din uppgift är att rensa texten så att den blir mer maskinvänlig. Det innebär att du ska konvertera till gemener, använda lemmatisering samt ta bort stoppord, skiljetecken och icke-alfabetiska tecken.
Utdraget finns tillgängligt som strängen blog och har skrivits ut i konsolen. Listan med stoppord finns tillgänglig som stopwords.
Den här övningen är en del av kursen
Funktionsutveckling för NLP i Python
Övningsinstruktioner
- Använd list comprehension och loopa igenom
docför att extraheralemma_för varje token. - Ta bort stoppord och icke-alfabetiska tokens med hjälp av
stopwordsochisalpha().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)
# Generate lemmatized tokens
lemmas = [token.____ for token in ____]
# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in ____]
# Print string after text cleaning
print(' '.join(a_lemmas))