前處理資料
你已經學過在多類別分類情境下,資料前處理有哪些不同。現在把它付諸實作,先對資料做前處理,為建立一個簡單的多類別分類模型做好準備。
資料集已載入在變數 news_dataset 中,並具備以下屬性:
news_dataset.data:文字的陣列news_dataset.target:以數值索引表示之目標類別的陣列
範例資料包含 5,000 筆觀測值。
本練習屬於課程
使用 Keras 建立語言模型的循環神經網路(RNN)
練習說明
- 在變數
tokenizer上建立Tokenizer類別的實例。 - 在文字資料上擬合
tokenizer變數。 - 在文字資料上使用
.texts_to_sequences()方法。 - 使用
to_categorical()函式將目標索引轉為類別格式。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)
# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)
# Prepare the labels
target_labels = to_categorical(____)
# Print the shapes
print(prep_data.shape)
print(target_labels.shape)