開始使用免費開始

前處理資料

你已經學過在多類別分類情境下,資料前處理有哪些不同。現在把它付諸實作,先對資料做前處理,為建立一個簡單的多類別分類模型做好準備。

資料集已載入在變數 news_dataset 中,並具備以下屬性:

  • news_dataset.data:文字的陣列
  • news_dataset.target:以數值索引表示之目標類別的陣列

範例資料包含 5,000 筆觀測值。

本練習屬於課程

使用 Keras 建立語言模型的循環神經網路(RNN)

檢視課程

練習說明

  • 在變數 tokenizer 上建立 Tokenizer 類別的實例。
  • 在文字資料上擬合 tokenizer 變數。
  • 在文字資料上使用 .texts_to_sequences() 方法。
  • 使用 to_categorical() 函式將目標索引轉為類別格式。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)

# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)

# Prepare the labels
target_labels = to_categorical(____)

# Print the shapes
print(prep_data.shape)
print(target_labels.shape)
編輯並執行程式碼