Porovnání predikovaných hodnot
V předchozím cvičení jsi nafitoval/a lineární i GLM (logistický) regresní model na datech crab, kde jsi predikoval/a y pomocí width. Jinými slovy, chtěl/a jsi odhadnout pravděpodobnost, že samice má v blízkosti satelitního kraba, na základě její šířky.
V tomto cvičení se blíže podíváme na odhadnuté pravděpodobnosti (výstupy) obou modelů a zkusíme zjistit, jestli by lineární fit byl pro tento problém vhodný.
Běžnou praxí je testovat model na nových, dosud neviděných, datech. Taková datová sada se nazývá testovací vzorek.
Testovací vzorek test byl vytvořen a načten do pracovního prostředí. Nezapomeň, že potřebuješ testovací hodnoty pro všechny proměnné obsažené v modelu – v tomto případě je to width.
Dataset crab je předem načtený v pracovním prostředí.
Toto cvičení je součástí kurzu
Zobecněné lineární modely v Pythonu
Pokyny k cvičení
- Pomocí
print()zobraz testovací sadutest. - Pomocí vzorku
testvypočítej odhadnuté pravděpodobnosti: zavolej.predict()na nafitovaném lineárním modelumodel_LMa výsledek ulož jakopred_lm. Poté zavolej.predict()na nafitovaném GLM (logistickém) modelumodel_GLMa výsledek ulož jakopred_glm. - Pomocí
DataFrame()z knihovnypandasspoj predikce obou modelů a výsledek ulož jakopredictions. - Spoj
testapredictionsa ulož jakoall_data. Zobrazall_datapomocíprint().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# View test set
print(____)
# Compute estimated probabilities for linear model: pred_lm
____ = model_LM.____(____)
# Compute estimated probabilities for GLM model: pred_glm
____ = model_GLM.____(____)
# Create dataframe of predictions for linear and GLM model: predictions
____ = pd.DataFrame({'Pred_LM': ____, 'Pred_GLM': ____})
# Concatenate test sample and predictions and view the results
all_data = pd.concat([____, ____], axis = 1)
print(____)