Очистка текста блога
В этом упражнении вам дан отрывок из записи блога. Ваша задача — привести этот текст к формату, удобному для машинной обработки. Для этого нужно выполнить приведение к нижнему регистру, лемматизацию, а также удалить стоп-слова, знаки препинания и неалфавитные символы.
Отрывок доступен в виде строки blog и выведен в консоль. Список стоп-слов доступен в переменной stopwords.
Это упражнение является частью курса
Конструирование признаков для NLP на Python
Инструкции к упражнению
- С помощью спискового включения пройдитесь по
docи извлекитеlemma_каждого токена. - Удалите стоп-слова и неалфавитные токены, используя
stopwordsиisalpha().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)
# Generate lemmatized tokens
lemmas = [token.____ for token in ____]
# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in ____]
# Print string after text cleaning
print(' '.join(a_lemmas))