Interpretacja współczynników
Pamiętaj, że kolumna lotniska wylotu, org, ma osiem możliwych wartości (ORD, SFO, JFK, LGA, SMF, SJC, TUS i OGG), które zostały zakodowane metodą one-hot do siedmiu zmiennych zero-jedynkowych w org_dummy.
Wartości km i org_dummy zostały złączone w features – wektorze rzadkim z ośmioma kolumnami. Indeksy kolumn w features są następujące:
- 0 —
km - 1 —
ORD - 2 —
SFO - 3 —
JFK - 4 —
LGA - 5 —
SMF - 6 —
SJCi - 7 —
TUS.
Zwróć uwagę, że OGG nie pojawia się na tej liście, ponieważ jest poziomem referencyjnym dla kategorii lotniska wylotu.
Instancja LinearRegression jest dostępna w zmiennej regression. W tym ćwiczeniu wykorzystasz atrybuty intercept i coefficients do interpretacji modelu.
Atrybut coefficients to lista, w której pierwszy element wskazuje, jak długość lotu zmienia się wraz z odległością.
To ćwiczenie jest częścią kursu
Uczenie maszynowe z PySpark
Instrukcje do ćwiczenia
- Oblicz średnią prędkość w km na godzinę. Wynik będzie się różnić od wcześniej uzyskanego, ponieważ model jest teraz bardziej zaawansowany.
- Jaki jest średni czas postoju na lotnisku OGG?
- Jaki jest średni czas postoju na lotnisku JFK?
- Jaki jest średni czas postoju na lotnisku LGA?
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Average speed in km per hour
avg_speed_hour = ____
print(avg_speed_hour)
# Average minutes on ground at OGG
inter = regression.____
print(inter)
# Average minutes on ground at JFK
avg_ground_jfk = ____ + regression.____[____]
print(avg_ground_jfk)
# Average minutes on ground at LGA
avg_ground_lga = ____ + regression.____[____]
print(avg_ground_lga)