Bắt đầu ngayBắt đầu miễn phí

Làm sạch một bài đăng blog

Trong bài tập này, bạn được cung cấp một đoạn trích từ một bài đăng blog. Nhiệm vụ của bạn là làm sạch văn bản này thành định dạng thân thiện với máy hơn. Việc này bao gồm chuyển về chữ thường, lemmatization và loại bỏ stopword, dấu câu và ký tự không phải chữ cái.

Đoạn trích có sẵn dưới dạng chuỗi blog và đã được in ra console. Danh sách stopword có sẵn là stopwords.

Bài tập này là một phần của khóa học

Khai thác đặc trưng cho NLP bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Dùng list comprehension, lặp qua doc để trích xuất lemma_ của từng token.
  • Loại bỏ stopword và các token không phải chữ cái bằng stopwordsisalpha().

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)

# Generate lemmatized tokens
lemmas = [token.____ for token in ____]

# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in ____]

# Print string after text cleaning
print(' '.join(a_lemmas))
Chỉnh sửa và Chạy Mã