Lineární model a binární závislá proměnná
Ve videu jsi viděl/a příklad přizpůsobení lineárního modelu binární závislé proměnné a jak rychle může dojít k problémům. Zjistil/a jsi, že proložením přímkou lze získat odhadnuté hodnoty \(\hat{y}\), které neodpovídají logice úlohy — závislá proměnná totiž nabývá pouze hodnot 0 a 1.
Na předem načteném datasetu crab si tento efekt prozkoumáš sám/sama tím, že budeš modelovat y jako funkci x v rámci GLM.
Vzorec pro GLM má tvar:
glm(formula = 'y ~ X', data = my_data, family = sm.families.____).fit()
kde zadáváš formula, data a family.
Připomeň si, že GLM s:
- rodinou Gaussian je lineární model (speciální případ GLM)
- rodinou Binomial je logistický regresní model.
Toto cvičení je součástí kurzu
Zobecněné lineární modely v Pythonu
Pokyny k cvičení
- Pomocí datasetu
crabdefinuj vzorec modelu tak, abyybylo předpovídáno proměnnouwidth. - Pro přizpůsobení lineárního modelu pomocí GLM použij jako argument family hodnotu
Gaussian(), která předpokládá, že y je spojitá a přibližně normálně rozdělená proměnná. - Pro přizpůsobení logistického modelu pomocí GLM použij jako argument family hodnotu
Binomial(). - Přizpůsob model pomocí
glm()se správnými argumenty a výsledné shrnutí zobraz pomocíprint()asummary().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Define model formula
formula = '____ ~ ____'
# Define probability distribution for the response variable for
# the linear (LM) and logistic (GLM) model
family_LM = sm.families.____
family_GLM = sm.families.____
# Define and fit a linear regression model
model_LM = glm(formula = ____, data = ____, family = ____).fit()
print(____.____)
# Define and fit a logistic regression model
model_GLM = glm(formula = ____, data = ____, family = ____).fit()
print(____.____)