Bắt đầu ngayBắt đầu miễn phí

Loại bỏ stopwords

Trong các bài tập sau, bạn sẽ làm sạch email Enron để có thể dùng dữ liệu cho mô hình chủ đề. Việc làm sạch văn bản có thể khó, nên bạn sẽ học một số bước để thực hiện hiệu quả. DataFrame chứa email df đã được cung cấp. Ở bước đầu tiên, bạn cần xác định danh sách stopwords và dấu câu sẽ bị loại bỏ khỏi dữ liệu văn bản trong bài tập tiếp theo. Hãy thử nhé.

Bài tập này là một phần của khóa học

Phát hiện gian lận với Python

Xem khóa học

Hướng dẫn bài tập

  • Import stopwords từ ntlk.
  • Định nghĩa từ 'english' để dùng làm stopwords trong biến stop.
  • Lấy tập dấu câu từ gói string và gán cho exclude.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import nltk packages and string 
from nltk.corpus import ____
import string

# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))

# Define punctuations to exclude and lemmatizer
exclude = set(____.____)
Chỉnh sửa và Chạy Mã