शुरू करेंमुफ़्त में शुरू करें

source खराब है या destination?

पिछले lesson में, आपने अपनी entity of interest के रूप में destination कंप्यूटर का उपयोग किया था. लेकिन आपके cybersecurity analyst ने अभी बताया कि खराब ट्रैफ़िक संक्रमित मशीनें जनरेट करती हैं, इसलिए वे flows डेटासेट में destination नहीं बल्कि source के रूप में दिखेंगी.

flows डेटा preloaded है, साथ ही पिछले lesson का संक्रमित IDs की सूची bad और feature extractor featurizer() भी. आपके पास numpy np नाम से उपलब्ध है, साथ में AdaBoostClassifier() और cross_val_score() भी.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में मशीन लर्निंग वर्कफ़्लो डिज़ाइन करना

पाठ्यक्रम देखें

अभ्यास निर्देश

  • ऐसा data frame बनाएँ जिसमें हर row किसी source_computer का feature vector हो. flows डेटासेट में source computer ID के आधार पर group कीजिए और हर group पर feature extractor apply कीजिए.
  • iterator को data frame में बदलने के लिए उस पर list() कॉल कीजिए.
  • दिए गए bads की सूची में हर source_computer ID की उपस्थिति जाँचकर labels बनाएँ.
  • इस डेटा पर cross_val_score() का उपयोग करते हुए AdaBoostClassifier() का आकलन कीजिए.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Group by source computer, and apply the feature extractor
out = flows.____('source_computer').____(featurize)

# Convert the iterator to a dataframe by calling list on it
X = pd.DataFrame(____, index=____)

# Check which sources in X.index are bad to create labels
y = [x in bads for x in ____]

# Report the average accuracy of Adaboost over 3-fold CV
print(np.mean(____(____, X, y)))
कोड संपादित करें और चलाएँ