Interpretarea coeficienților
Ține minte că aeroportul de origine, org, are opt valori posibile (ORD, SFO, JFK, LGA, SMF, SJC, TUS și OGG), care au fost codificate one-hot în șapte variabile dummy în org_dummy.
Valorile pentru km și org_dummy au fost asamblate în features, care are opt coloane cu reprezentare sparse. Indicii coloanelor din features sunt următorii:
- 0 —
km - 1 —
ORD - 2 —
SFO - 3 —
JFK - 4 —
LGA - 5 —
SMF - 6 —
SJCși - 7 —
TUS.
Observă că OGG nu apare în această listă, deoarece reprezintă nivelul de referință pentru categoria aeroportului de origine.
O instanță a clasei LinearRegression este disponibilă în regression. În acest exercițiu vei folosi atributele intercept și coefficients pentru a interpreta modelul.
Atributul coefficients este o listă, în care primul element indică modul în care durata zborului se modifică în funcție de distanța parcursă.
Acest exercițiu face parte din cursul
Machine Learning cu PySpark
Instrucțiuni pentru exercițiu
- Calculează viteza medie în km pe oră. Aceasta va fi diferită față de valoarea obținută anterior, deoarece modelul tău este acum mai complex.
- Care este timpul mediu petrecut la sol la OGG?
- Care este timpul mediu petrecut la sol la JFK?
- Care este timpul mediu petrecut la sol la LGA?
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Average speed in km per hour
avg_speed_hour = ____
print(avg_speed_hour)
# Average minutes on ground at OGG
inter = regression.____
print(inter)
# Average minutes on ground at JFK
avg_ground_jfk = ____ + regression.____[____]
print(avg_ground_jfk)
# Average minutes on ground at LGA
avg_ground_lga = ____ + regression.____[____]
print(avg_ground_lga)