Justera n_neighbors
n_neighbors är den viktigaste parametern i KNN. När du är osäker på hur många avvikare som finns i datamängden – vilket ofta är fallet – kan du inte förlita dig på tumregeln om att använda 20 grannar när kontaminationsgraden är under 10 %.
I sådana fall behöver du justera n_neighbors manuellt. Öva på processen med den transformerade versionen av females-datamängden från förra övningen. Den har laddats in som females_transformed. KNN-estimatorn samt funktionerna evaluate_outlier_classifier och evaluate_regressor är också inlästa.
Här är funktionskropparna som påminnelse:
def evaluate_outlier_classifier(model, data, threshold=.75):
model.fit(data)
probs = model.predict_proba(data)
inliers = data[probs[:, 1] <= threshold]
return inliers
def evaluate_regressor(inliers):
X, y = inliers.drop("weightkg", axis=1), inliers[['weightkg']]
X_train, X_test, y_train, y_test = train_test_split(X, y, random_state=10, train_size=0.8)
lr = LinearRegression()
lr.fit(X_train, y_train)
preds = lr.predict(X_test)
rmse = root_mean_squared_error(y_test, preds)
return round(rmse, 3)
Den här övningen är en del av kursen
Avvikelsedetektering i Python
Övningsinstruktioner
- Skapa en lista med möjliga värden för
n_neighborsi följande ordning: 5, 10, 20 - Instantiera en
KNN-modell och sätt värdet pån_neighborstill det aktuellaki loopen. - Hitta inliers med funktionen
evaluate_outlier_classifier. - Beräkna RMSE med
evaluate_regressoroch lagra resultatet iscoresmedksom nyckel och RMSE som värde.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create a list of values for n_neigbors
n_neighbors = [____, ____, ____]
scores = dict()
for k in n_neighbors:
# Instantiate KNN with the current k
knn = ____(____, n_jobs=-1)
# Find the inliers with the current KNN
inliers = ____(____, ____, .50)
# Calculate and store RMSE into scores
scores[____] = ____
print(scores)