Porównanie wartości prognozowanych
W poprzednim ćwiczeniu dopasowano dwa modele regresji – liniowy oraz GLM (logistyczny) – na danych crab, prognozując y na podstawie width. Innymi słowy, celem było przewidzenie prawdopodobieństwa, że w pobliżu samicy krabika podkowy znajduje się satelitarny samiec, w zależności od jej szerokości.
W tym ćwiczeniu przyjrzysz się bliżej szacowanym prawdopodobieństwom (wynikom) obu modeli i sprawdzisz, czy dopasowanie liniowe jest odpowiednie dla tego problemu.
Standardową praktyką jest testowanie modelu na nowych, niewidzianych wcześniej danych. Taki zbiór danych nazywamy próbką testową.
Próbka test została już przygotowana i wczytana do środowiska pracy. Pamiętaj, że potrzebujesz wartości testowych dla wszystkich zmiennych obecnych w modelu – w tym przypadku jest to width.
Zbiór danych crab jest wstępnie wczytany do środowiska pracy.
To ćwiczenie jest częścią kursu
Uogólnione modele liniowe w Pythonie
Instrukcje do ćwiczenia
- Za pomocą
print()wyświetl zbiórtest. - Korzystając z próbki
test, oblicz szacowane prawdopodobieństwa metodą.predict()na dopasowanym modelu liniowymmodel_LMi zapisz wynik jakopred_lm. Następnie oblicz szacowane prawdopodobieństwa metodą.predict()na dopasowanym modelu GLM (logistycznym)model_GLMi zapisz wynik jakopred_glm. - Za pomocą
DataFrame()z bibliotekipandaspołącz prognozy obu modeli i zapisz jakopredictions. - Połącz
testipredictions, zapisując wynik jakoall_data. Wyświetlall_dataza pomocąprint().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# View test set
print(____)
# Compute estimated probabilities for linear model: pred_lm
____ = model_LM.____(____)
# Compute estimated probabilities for GLM model: pred_glm
____ = model_GLM.____(____)
# Create dataframe of predictions for linear and GLM model: predictions
____ = pd.DataFrame({'Pred_LM': ____, 'Pred_GLM': ____})
# Concatenate test sample and predictions and view the results
all_data = pd.concat([____, ____], axis = 1)
print(____)