Interpretace koeficientů
Připomeň si, že letiště původu org má osm možných hodnot (ORD, SFO, JFK, LGA, SMF, SJC, TUS a OGG), které byly zakódovány metodou one-hot encoding do sedmi dummy proměnných v org_dummy.
Hodnoty km a org_dummy byly sloučeny do features, které mají osm sloupců v řídké reprezentaci. Indexy sloupců ve features jsou následující:
- 0 —
km - 1 —
ORD - 2 —
SFO - 3 —
JFK - 4 —
LGA - 5 —
SMF - 6 —
SJCa - 7 —
TUS.
Všimni si, že OGG se v tomto seznamu nevyskytuje, protože jde o referenční úroveň kategorie letiště původu.
Instance LinearRegression je dostupná v proměnné regression. V tomto cvičení budeš používat atributy intercept a coefficients k interpretaci modelu.
Atribut coefficients je seznam, kde první prvek udává, jak se mění délka letu v závislosti na vzdálenosti letu.
Toto cvičení je součástí kurzu
Machine Learning with PySpark
Pokyny k cvičení
- Zjisti průměrnou rychlost v km za hodinu. Výsledek bude odlišný od hodnoty, kterou jsi získal/a dříve, protože tvůj model je teď sofistikovanější.
- Jaká je průměrná doba stráveného času na zemi na letišti OGG?
- Jaká je průměrná doba stráveného času na zemi na letišti JFK?
- Jaká je průměrná doba stráveného času na zemi na letišti LGA?
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Average speed in km per hour
avg_speed_hour = ____
print(avg_speed_hour)
# Average minutes on ground at OGG
inter = regression.____
print(inter)
# Average minutes on ground at JFK
avg_ground_jfk = ____ + regression.____[____]
print(avg_ground_jfk)
# Average minutes on ground at LGA
avg_ground_lga = ____ + regression.____[____]
print(avg_ground_lga)