Очищення публікації в блозі
У цій вправі вам подано уривок із публікації в блозі. Ваше завдання — очистити цей текст і зробити його зручнішим для обробки алгоритмами. Для цього потрібно перетворити всі літери на нижній регістр, виконати лематизацію та вилучити стоп-слова, розділові знаки й неалфавітні символи.
Уривок доступний як рядок blog і вже виведений у консоль. Список стоп-слів доступний у змінній stopwords.
Ця вправа є частиною курсу
Інженерія ознак для NLP у Python
Інструкції до вправи
- За допомогою спискового включення пройдіться по
doc, щоб отриматиlemma_кожного токена. - Приберіть стоп-слова та неалфавітні токени за допомогою
stopwordsіisalpha().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)
# Generate lemmatized tokens
lemmas = [token.____ for token in ____]
# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in ____]
# Print string after text cleaning
print(' '.join(a_lemmas))