ÎncepețiÎncepe gratuit

Interpretarea coeficienților

Ține minte că aeroportul de origine, org, are opt valori posibile (ORD, SFO, JFK, LGA, SMF, SJC, TUS și OGG), care au fost codificate one-hot în șapte variabile dummy în org_dummy.

Valorile pentru km și org_dummy au fost asamblate în features, care are opt coloane cu reprezentare sparse. Indicii coloanelor din features sunt următorii:

  • 0 — km
  • 1 — ORD
  • 2 — SFO
  • 3 — JFK
  • 4 — LGA
  • 5 — SMF
  • 6 — SJC și
  • 7 — TUS.

Observă că OGG nu apare în această listă, deoarece reprezintă nivelul de referință pentru categoria aeroportului de origine.

O instanță a clasei LinearRegression este disponibilă în regression. În acest exercițiu vei folosi atributele intercept și coefficients pentru a interpreta modelul.

Atributul coefficients este o listă, în care primul element indică modul în care durata zborului se modifică în funcție de distanța parcursă.

Acest exercițiu face parte din cursul

Machine Learning cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Calculează viteza medie în km pe oră. Aceasta va fi diferită față de valoarea obținută anterior, deoarece modelul tău este acum mai complex.
  • Care este timpul mediu petrecut la sol la OGG?
  • Care este timpul mediu petrecut la sol la JFK?
  • Care este timpul mediu petrecut la sol la LGA?

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Average speed in km per hour
avg_speed_hour = ____
print(avg_speed_hour)

# Average minutes on ground at OGG
inter = regression.____
print(inter)

# Average minutes on ground at JFK
avg_ground_jfk = ____ + regression.____[____]
print(avg_ground_jfk)

# Average minutes on ground at LGA
avg_ground_lga = ____ + regression.____[____]
print(avg_ground_lga)
Editează și rulează codul