Bắt đầu ngayBắt đầu miễn phí

Bộ mã hoá ngôn ngữ Shakespeare

Với văn bản Shakespeare đã được tiền xử lý trong tay, giờ bạn cần mã hoá nó thành dạng số. Bạn sẽ cần xác định các bước mã hoá trước khi ghép thành pipeline hoàn chỉnh. Để xử lý lượng dữ liệu lớn và mã hoá hiệu quả, bạn sẽ dùng DatasetDataLoader của PyTorch để batching và xáo trộn dữ liệu.

Những thành phần sau đã được nạp sẵn cho bạn: torch, nltk, stopwords, PorterStemmer, get_tokenizer, CountVectorizer, Dataset, DataLoader, và preprocess_sentences.

processed_shakespeare từ văn bản Shakespeare cũng đã sẵn sàng cho bạn sử dụng.

Bài tập này là một phần của khóa học

Deep Learning cho Văn bản với PyTorch

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Define your Dataset class
class ____(Dataset):
    def __init__(self, data):
        self.data = ____
    def __len__(self):
        return len(self.data)
    def __getitem__(self, idx):
        return self.____[____]
Chỉnh sửa và Chạy Mã