ตัวเข้ารหัสภาษาเชกสเปียร์
เมื่อมีข้อความของเชกสเปียร์ที่ผ่านการประมวลผลล่วงหน้าแล้ว ขั้นตอนต่อไปคือการเข้ารหัสข้อความให้อยู่ในรูปแบบตัวเลข โดยต้องกำหนดขั้นตอนการเข้ารหัสก่อน แล้วจึงนำมาประกอบเป็น pipeline เพื่อรองรับข้อมูลปริมาณมากและเข้ารหัสได้อย่างมีประสิทธิภาพ จะใช้ Dataset และ DataLoader ของ PyTorch สำหรับการแบ่งชุดข้อมูลและการสุ่มข้อมูล
มีการโหลดสิ่งต่อไปนี้ไว้ให้แล้ว:
torch, nltk, stopwords, PorterStemmer, get_tokenizer, CountVectorizer, Dataset, DataLoader และ preprocess_sentences
นอกจากนี้ processed_shakespeare ที่ได้จากข้อความของเชกสเปียร์ก็พร้อมใช้งานแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Deep Learning สำหรับข้อความด้วย PyTorch
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Define your Dataset class
class ____(Dataset):
def __init__(self, data):
self.data = ____
def __len__(self):
return len(self.data)
def __getitem__(self, idx):
return self.____[____]