ПочатиПочніть безкоштовно

Очищення публікації в блозі

У цій вправі вам подано уривок із публікації в блозі. Ваше завдання — очистити цей текст і зробити його зручнішим для обробки алгоритмами. Для цього потрібно перетворити всі літери на нижній регістр, виконати лематизацію та вилучити стоп-слова, розділові знаки й неалфавітні символи.

Уривок доступний як рядок blog і вже виведений у консоль. Список стоп-слів доступний у змінній stopwords.

Ця вправа є частиною курсу

Інженерія ознак для NLP у Python

Переглянути курс

Інструкції до вправи

  • За допомогою спискового включення пройдіться по doc, щоб отримати lemma_ кожного токена.
  • Приберіть стоп-слова та неалфавітні токени за допомогою stopwords і isalpha().

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)

# Generate lemmatized tokens
lemmas = [token.____ for token in ____]

# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in ____]

# Print string after text cleaning
print(' '.join(a_lemmas))
Редагувати та запускати код