Diễn giải các hệ số
Hãy nhớ rằng sân bay khởi hành, org, có tám giá trị khả dĩ (ORD, SFO, JFK, LGA, SMF, SJC, TUS và OGG) và đã được one-hot encode thành bảy biến giả trong org_dummy.
Các giá trị cho km và org_dummy đã được gộp vào features, gồm tám cột ở dạng thưa (sparse). Chỉ số cột trong features như sau:
- 0 —
km - 1 —
ORD - 2 —
SFO - 3 —
JFK - 4 —
LGA - 5 —
SMF - 6 —
SJCvà - 7 —
TUS.
Lưu ý OGG không xuất hiện trong danh sách này vì đây là mức tham chiếu cho nhóm sân bay khởi hành.
Một thể hiện của LinearRegression có sẵn trong regression. Trong bài này bạn sẽ dùng các thuộc tính intercept và coefficients để diễn giải mô hình.
Thuộc tính coefficients là một danh sách, trong đó phần tử đầu tiên cho biết thời lượng chuyến bay thay đổi như thế nào theo khoảng cách bay.
Bài tập này là một phần của khóa học
Machine Learning với PySpark
Hướng dẫn bài tập
- Tìm tốc độ trung bình theo km mỗi giờ. Giá trị này sẽ khác với giá trị trước đó vì mô hình của bạn giờ đã tinh vi hơn.
- Thời gian trung bình trên mặt đất tại OGG là bao nhiêu?
- Thời gian trung bình trên mặt đất tại JFK là bao nhiêu?
- Thời gian trung bình trên mặt đất tại LGA là bao nhiêu?
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Average speed in km per hour
avg_speed_hour = ____
print(avg_speed_hour)
# Average minutes on ground at OGG
inter = regression.____
print(inter)
# Average minutes on ground at JFK
avg_ground_jfk = ____ + regression.____[____]
print(avg_ground_jfk)
# Average minutes on ground at LGA
avg_ground_lga = ____ + regression.____[____]
print(avg_ground_lga)