開始使用免費開始

分類建模範例

你先前已經整理過一組俄文推文,準備用來做分類。在 20,000 則推文中,你已篩選出 account_typeLeftRight 的推文,並各自選取前 2000 則。你也已把推文斷詞、移除停用字,並做了詞幹化。接著,你將詞頻轉換成以 TFIDF 值為權重的文件—詞語矩陣,並將此矩陣儲存為:left_right_matrix_small

你將使用這個矩陣來預測一則推文是由傾向左派的推文機器人產生,或是傾向右派的推文機器人產生。標籤可以在向量 left_right_labels 中找到。

本練習屬於課程

R 的自然語言處理入門

檢視課程

練習說明

  • 將隨機種子設為 1111,以利重現結果。
  • 建立訓練與測試資料集。訓練資料請使用 75% 的樣本。
  • 在訓練資料上執行隨機森林模型,將 left_right_labels 作為回應向量 y
  • 列印隨機森林的結果。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

library(randomForest)

# Create train/test split
set.___(___)
sample_size <- floor(___ * nrow(left_right_matrix_small))
train_ind <- ___(nrow(left_right_matrix_small), size = ___)
train <- left_right_matrix_small[___, ]
test <- left_right_matrix_small[-___, ]

# Create a random forest classifier
rfc <- randomForest(x = as.data.frame(as.matrix(___)), 
                    y = ___[___],
                    nTree = 50)
# Print the results
___
編輯並執行程式碼