Bắt đầu ngayBắt đầu miễn phí

Pipeline tiền xử lý ngôn ngữ Shakespeare

Tại PyBooks, nhóm muốn chuyển đổi một thư viện lớn dữ liệu văn bản của Shakespeare để phục vụ phân tích tiếp theo. Cách hiệu quả nhất là xây dựng một pipeline xử lý văn bản, bắt đầu từ các bước tiền xử lý.

Những nội dung sau đã được nạp sẵn cho bạn: torch, nltk, stopwords, PorterStemmer, get_tokenizer.

Dữ liệu văn bản Shakespeare được lưu trong shakespeare và các câu đã được trích xuất sẵn.

Bài tập này là một phần của khóa học

Deep Learning cho Văn bản với PyTorch

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create a list of stopwords
stop_words = set(____(____))
Chỉnh sửa và Chạy Mã