開始使用免費開始

基準線

將分類器與合適的基準線相比非常重要。這在類別不平衡的資料集(例如廣告點擊率)中特別關鍵,因為只要永遠選擇多數類別,就很容易得到很高的 accuracy。這個練習中,你會模擬一個永遠預測多數類別(未點擊)的基準分類器,並查看它的混淆矩陣,以及它的 precision 與 recall。

X_trainy_trainX_testy_test 已在你的工作區可用。pandaspdnumpynp,以及 sklearn 也都可用。

本練習屬於課程

用 Python 透過機器學習預測 CTR

檢視課程

練習說明

  • 使用 np.asarray() 建立 y_pred,其為與 X_test 長度相同、元素全為 0 的陣列。
  • 印出產生的混淆矩陣。
  • 取得 precision 與 recall 分數。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Set up baseline predictions
y_pred = np.____([0 for x in range(len(X_test))])

# Look at confusion matrix
print("Confusion matrix: ")
print(____(y_test, y_pred))

# Check precision and recall
prec = ____(y_test, y_pred, average = 'weighted')
recall = ____(y_test, y_pred, average = 'weighted')
print("Precision: %s, Recall: %s" %(prec, recall))
編輯並執行程式碼