เตรียมข้อมูลล่วงหน้า
คุณได้เรียนรู้ความแตกต่างของการเตรียมข้อมูลสำหรับ multi-class classification แล้ว มาลองนำไปใช้จริงด้วยการเตรียมข้อมูลเพื่อสร้างโมเดล multi-class classification แบบง่าย
ชุดข้อมูลถูกโหลดไว้ในตัวแปร news_dataset และมีแอตทริบิวต์ดังนี้:
news_dataset.data: อาร์เรย์ที่เก็บข้อความnews_dataset.target: อาร์เรย์ที่เก็บหมวดหมู่เป้าหมายในรูปแบบดัชนีตัวเลข
ข้อมูลตัวอย่างมีทั้งหมด 5,000 รายการ
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Recurrent Neural Networks (RNNs) สำหรับ Language Modeling ด้วย Keras
คำแนะนำการฝึกหัด
- สร้าง instance ของคลาส
Tokenizerแล้วเก็บไว้ในตัวแปรtokenizer - Fit ตัวแปร
tokenizerกับข้อมูลข้อความ - ใช้เมธอด
.texts_to_sequences()กับข้อมูลข้อความ - ใช้ฟังก์ชัน
to_categorical()เพื่อเตรียมดัชนีเป้าหมาย
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)
# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)
# Prepare the labels
target_labels = to_categorical(____)
# Print the shapes
print(prep_data.shape)
print(target_labels.shape)