เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การปรับจูน n_neighbors

n_neighbors เป็นพารามิเตอร์ที่สำคัญที่สุดของ KNN เมื่อไม่แน่ใจว่าชุดข้อมูลมี outlier จำนวนเท่าใด (ซึ่งเกิดขึ้นบ่อยมาก) จะไม่สามารถใช้ rule of thumb ที่แนะนำให้ใช้ 20 neighbors เมื่อ contamination ต่ำกว่า 10% ได้

ในกรณีเช่นนี้ จะต้องทำการปรับจูน n_neighbors ฝึกกระบวนการนี้บนชุดข้อมูล females เวอร์ชันที่แปลงแล้วจากแบบฝึกหัดที่แล้ว ซึ่งโหลดไว้เป็น females_transformed รวมถึง KNN estimator และฟังก์ชัน evaluate_outlier_classifier กับ evaluate_regressor ด้วย

นี่คือ function body สำหรับทบทวน:

def evaluate_outlier_classifier(model, data, threshold=.75):
    model.fit(data)

    probs = model.predict_proba(data)
    inliers = data[probs[:, 1] <= threshold]

    return inliers

def evaluate_regressor(inliers):
    X, y = inliers.drop("weightkg", axis=1), inliers[['weightkg']]
    X_train, X_test, y_train, y_test = train_test_split(X, y, random_state=10, train_size=0.8)

    lr = LinearRegression()
    lr.fit(X_train, y_train)

    preds = lr.predict(X_test)
    rmse = root_mean_squared_error(y_test, preds)

    return round(rmse, 3)

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การตรวจจับความผิดปกติใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง list ของค่าที่เป็นไปได้สำหรับ n_neighbors ตามลำดับนี้: 5, 10, 20
  • สร้าง instance ของโมเดล KNN โดยกำหนดค่า n_neighbors เป็น k ปัจจุบันในลูป
  • หา inliers โดยใช้ฟังก์ชัน evaluate_outlier_classifier
  • คำนวณ RMSE ด้วย evaluate_regressor แล้วเก็บผลลัพธ์ไว้ใน scores โดยใช้ k เป็น key และ RMSE เป็น value

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create a list of values for n_neigbors
n_neighbors = [____, ____, ____]
scores = dict()

for k in n_neighbors:
    # Instantiate KNN with the current k
    knn = ____(____, n_jobs=-1)
    
    # Find the inliers with the current KNN
    inliers = ____(____, ____, .50)
    
    # Calculate and store RMSE into scores
    scores[____] = ____
    
print(scores)
แก้ไขและรันโค้ด