Zacznij terazZacznij za darmo

Czyszczenie wpisu blogowego

W tym ćwiczeniu otrzymujesz fragment wpisu blogowego. Twoim zadaniem jest przekształcenie tego tekstu do formatu bardziej przyjaznego dla maszyny. Proces ten obejmuje konwersję na małe litery, lematyzację oraz usunięcie stopwords, znaków interpunkcyjnych i znaków niealfabetycznych.

Fragment jest dostępny jako string blog i został wypisany w konsoli. Lista stopwords jest dostępna jako stopwords.

To ćwiczenie jest częścią kursu

Inżynieria cech dla NLP w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Używając list comprehension, przejdź pętlą przez doc, aby wyodrębnić lemma_ każdego tokenu.
  • Usuń stopwords i tokeny niealfabetyczne, korzystając z stopwords i isalpha().

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)

# Generate lemmatized tokens
lemmas = [token.____ for token in ____]

# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in ____]

# Print string after text cleaning
print(' '.join(a_lemmas))
Edytuj i uruchom kod