Zacznij terazZacznij za darmo

Interpretacja współczynników

Pamiętaj, że kolumna lotniska wylotu, org, ma osiem możliwych wartości (ORD, SFO, JFK, LGA, SMF, SJC, TUS i OGG), które zostały zakodowane metodą one-hot do siedmiu zmiennych zero-jedynkowych w org_dummy.

Wartości km i org_dummy zostały złączone w features – wektorze rzadkim z ośmioma kolumnami. Indeksy kolumn w features są następujące:

  • 0 — km
  • 1 — ORD
  • 2 — SFO
  • 3 — JFK
  • 4 — LGA
  • 5 — SMF
  • 6 — SJC i
  • 7 — TUS.

Zwróć uwagę, że OGG nie pojawia się na tej liście, ponieważ jest poziomem referencyjnym dla kategorii lotniska wylotu.

Instancja LinearRegression jest dostępna w zmiennej regression. W tym ćwiczeniu wykorzystasz atrybuty intercept i coefficients do interpretacji modelu.

Atrybut coefficients to lista, w której pierwszy element wskazuje, jak długość lotu zmienia się wraz z odległością.

To ćwiczenie jest częścią kursu

Uczenie maszynowe z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Oblicz średnią prędkość w km na godzinę. Wynik będzie się różnić od wcześniej uzyskanego, ponieważ model jest teraz bardziej zaawansowany.
  • Jaki jest średni czas postoju na lotnisku OGG?
  • Jaki jest średni czas postoju na lotnisku JFK?
  • Jaki jest średni czas postoju na lotnisku LGA?

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Average speed in km per hour
avg_speed_hour = ____
print(avg_speed_hour)

# Average minutes on ground at OGG
inter = regression.____
print(inter)

# Average minutes on ground at JFK
avg_ground_jfk = ____ + regression.____[____]
print(avg_ground_jfk)

# Average minutes on ground at LGA
avg_ground_lga = ____ + regression.____[____]
print(avg_ground_lga)
Edytuj i uruchom kod