Loại bỏ stopwords
Trong các bài tập sau, bạn sẽ làm sạch email Enron để có thể dùng dữ liệu cho mô hình chủ đề. Việc làm sạch văn bản có thể khó, nên bạn sẽ học một số bước để thực hiện hiệu quả. DataFrame chứa email df đã được cung cấp. Ở bước đầu tiên, bạn cần xác định danh sách stopwords và dấu câu sẽ bị loại bỏ khỏi dữ liệu văn bản trong bài tập tiếp theo. Hãy thử nhé.
Bài tập này là một phần của khóa học
Phát hiện gian lận với Python
Hướng dẫn bài tập
- Import stopwords từ
ntlk. - Định nghĩa từ 'english' để dùng làm stopwords trong biến
stop. - Lấy tập dấu câu từ gói
stringvà gán choexclude.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import nltk packages and string
from nltk.corpus import ____
import string
# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))
# Define punctuations to exclude and lemmatizer
exclude = set(____.____)