शुरू करेंमुफ़्त में शुरू करें

मॉडल के प्रदर्शन की तुलना

प्लॉटिंग से आपको यह समझने में आसानी होती है कि मॉडल कहाँ अच्छा काम करता है और कहाँ नहीं। कई बार ऐसा भी अच्छा होता है कि हमारे पास एक ऐसा सांख्यिकीय स्कोर हो जो मॉडल को एक संख्या में आँके। इससे आप किसी मॉडल की गुणवत्ता को माप सकते हैं और बहुत से मॉडलों के बीच तुलना कर सकते हैं। एक आम मीट्रिक है root mean square error (अक्सर "RMSE" कहा जाता है), जिसमें रेजिडुअल्स का वर्ग लिया जाता है, फिर उनका औसत, और फिर उसका वर्गमूल। किसी दिए गए डेटासेट पर छोटा RMSE बेहतर प्रेडिक्शन को दर्शाता है। (आम तौर पर, आप अलग-अलग डेटासेट्स के बीच तुलना नहीं कर सकते, सिर्फ़ एक ही डेटासेट पर अलग मॉडलों की तुलना कर सकते हैं। कभी-कभी डेटासेट्स को नॉर्मलाइज़ करके उनके बीच तुलना संभव होती है।)

यहाँ आप gradient boosted trees और random forest मॉडलों की तुलना करेंगे।

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में sparklyr के साथ Spark परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

both_responses, जिसमें दोनों मॉडलों से ट्रैक के अनुमानित और वास्तविक वर्ष शामिल हैं, एक लोकल tibble के रूप में पहले से परिभाषित है।

  • रेजिडुअल्स के sum of squares का एक डेटासेट बनाएँ।
    • एक residual कॉलम जोड़ें, जो अनुमानित प्रतिक्रिया माइनस वास्तविक प्रतिक्रिया के बराबर हो।
    • डेटा को model के आधार पर समूहित करें।
    • एक सार-सांख्यिकी rmse निकालें, जो residuals के वर्गों के औसत का वर्गमूल हो।

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# both_responses has been pre-defined
both_responses

# Create a residual sum of squares dataset
___
कोड संपादित करें और चलाएँ