การปรับจูน n_neighbors
n_neighbors เป็นพารามิเตอร์ที่สำคัญที่สุดของ KNN เมื่อไม่แน่ใจว่าชุดข้อมูลมี outlier จำนวนเท่าใด (ซึ่งเกิดขึ้นบ่อยมาก) จะไม่สามารถใช้ rule of thumb ที่แนะนำให้ใช้ 20 neighbors เมื่อ contamination ต่ำกว่า 10% ได้
ในกรณีเช่นนี้ จะต้องทำการปรับจูน n_neighbors ฝึกกระบวนการนี้บนชุดข้อมูล females เวอร์ชันที่แปลงแล้วจากแบบฝึกหัดที่แล้ว ซึ่งโหลดไว้เป็น females_transformed รวมถึง KNN estimator และฟังก์ชัน evaluate_outlier_classifier กับ evaluate_regressor ด้วย
นี่คือ function body สำหรับทบทวน:
def evaluate_outlier_classifier(model, data, threshold=.75):
model.fit(data)
probs = model.predict_proba(data)
inliers = data[probs[:, 1] <= threshold]
return inliers
def evaluate_regressor(inliers):
X, y = inliers.drop("weightkg", axis=1), inliers[['weightkg']]
X_train, X_test, y_train, y_test = train_test_split(X, y, random_state=10, train_size=0.8)
lr = LinearRegression()
lr.fit(X_train, y_train)
preds = lr.predict(X_test)
rmse = root_mean_squared_error(y_test, preds)
return round(rmse, 3)
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การตรวจจับความผิดปกติใน Python
คำแนะนำการฝึกหัด
- สร้าง list ของค่าที่เป็นไปได้สำหรับ
n_neighborsตามลำดับนี้: 5, 10, 20 - สร้าง instance ของโมเดล
KNNโดยกำหนดค่าn_neighborsเป็นkปัจจุบันในลูป - หา inliers โดยใช้ฟังก์ชัน
evaluate_outlier_classifier - คำนวณ RMSE ด้วย
evaluate_regressorแล้วเก็บผลลัพธ์ไว้ในscoresโดยใช้kเป็น key และ RMSE เป็น value
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create a list of values for n_neigbors
n_neighbors = [____, ____, ____]
scores = dict()
for k in n_neighbors:
# Instantiate KNN with the current k
knn = ____(____, n_jobs=-1)
# Find the inliers with the current KNN
inliers = ____(____, ____, .50)
# Calculate and store RMSE into scores
scores[____] = ____
print(scores)