गुणांकों की व्याख्या
याद कीजिए कि ओरिजिन एयरपोर्ट org के आठ संभावित मान हैं (ORD, SFO, JFK, LGA, SMF, SJC, TUS और OGG) जिन्हें org_dummy में वन-हॉट एनकोड करके सात डमी वैरिएबल्स में बदला गया है.
km और org_dummy के मानों को मिलाकर features में असेंबल किया गया है, जिसमें स्पार्स रिप्रज़ेंटेशन के साथ आठ कॉलम हैं. features में कॉलम इंडेक्स इस प्रकार हैं:
- 0 —
km - 1 —
ORD - 2 —
SFO - 3 —
JFK - 4 —
LGA - 5 —
SMF - 6 —
SJCऔर - 7 —
TUS.
ध्यान दें कि OGG इस सूची में नहीं है क्योंकि यह ओरिजिन एयरपोर्ट कैटेगरी के लिए रेफरेंस लेवल है.
LinearRegression का एक इंस्टेंस regression में उपलब्ध है. इस अभ्यास में आप मॉडल की व्याख्या करने के लिए intercept और coefficients एट्रिब्यूट्स का उपयोग करेंगे.
coefficients एट्रिब्यूट एक सूची है, जहाँ पहला एलिमेंट दिखाता है कि फ्लाइट डिस्टेंस के साथ फ्लाइट ड्यूरेशन कैसे बदलती है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Machine Learning
अभ्यास निर्देश
- औसत स्पीड किमी प्रति घंटा में निकालें. यह मान पहले मिले मान से अलग होगा क्योंकि आपका मॉडल अब अधिक परिष्कृत है.
- OGG पर ज़मीन पर बिताया जाने वाला औसत समय क्या है?
- JFK पर ज़मीन पर बिताया जाने वाला औसत समय क्या है?
- LGA पर ज़मीन पर बिताया जाने वाला औसत समय क्या है?
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Average speed in km per hour
avg_speed_hour = ____
print(avg_speed_hour)
# Average minutes on ground at OGG
inter = regression.____
print(inter)
# Average minutes on ground at JFK
avg_ground_jfk = ____ + regression.____[____]
print(avg_ground_jfk)
# Average minutes on ground at LGA
avg_ground_lga = ____ + regression.____[____]
print(avg_ground_lga)