Pipeline tiền xử lý ngôn ngữ Shakespeare
Tại PyBooks, nhóm muốn chuyển đổi một thư viện lớn dữ liệu văn bản của Shakespeare để phục vụ phân tích tiếp theo. Cách hiệu quả nhất là xây dựng một pipeline xử lý văn bản, bắt đầu từ các bước tiền xử lý.
Những nội dung sau đã được nạp sẵn cho bạn:
torch, nltk, stopwords, PorterStemmer, get_tokenizer.
Dữ liệu văn bản Shakespeare được lưu trong shakespeare và các câu đã được trích xuất sẵn.
Bài tập này là một phần của khóa học
Deep Learning cho Văn bản với PyTorch
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a list of stopwords
stop_words = set(____(____))