Bộ mã hoá ngôn ngữ Shakespeare
Với văn bản Shakespeare đã được tiền xử lý trong tay, giờ bạn cần mã hoá nó thành dạng số. Bạn sẽ cần xác định các bước mã hoá trước khi ghép thành pipeline hoàn chỉnh. Để xử lý lượng dữ liệu lớn và mã hoá hiệu quả, bạn sẽ dùng Dataset và DataLoader của PyTorch để batching và xáo trộn dữ liệu.
Những thành phần sau đã được nạp sẵn cho bạn:
torch, nltk, stopwords, PorterStemmer, get_tokenizer, CountVectorizer, Dataset, DataLoader, và preprocess_sentences.
processed_shakespeare từ văn bản Shakespeare cũng đã sẵn sàng cho bạn sử dụng.
Bài tập này là một phần của khóa học
Deep Learning cho Văn bản với PyTorch
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Define your Dataset class
class ____(Dataset):
def __init__(self, data):
self.data = ____
def __len__(self):
return len(self.data)
def __getitem__(self, idx):
return self.____[____]