НачатьНачать бесплатно

Очистка текста блога

В этом упражнении вам дан отрывок из записи блога. Ваша задача — привести этот текст к формату, удобному для машинной обработки. Для этого нужно выполнить приведение к нижнему регистру, лемматизацию, а также удалить стоп-слова, знаки препинания и неалфавитные символы.

Отрывок доступен в виде строки blog и выведен в консоль. Список стоп-слов доступен в переменной stopwords.

Это упражнение является частью курса

Конструирование признаков для NLP на Python

Посмотреть курс

Инструкции к упражнению

  • С помощью спискового включения пройдитесь по doc и извлеките lemma_ каждого токена.
  • Удалите стоп-слова и неалфавитные токены, используя stopwords и isalpha().

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)

# Generate lemmatized tokens
lemmas = [token.____ for token in ____]

# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in ____]

# Print string after text cleaning
print(' '.join(a_lemmas))
Редактировать и запускать код