Terms की सूची का उपयोग
अक्सर आप सिर्फ एक term पर सर्च नहीं करना चाहेंगे। आप एक पूरा "fraud dictionary" बना सकते हैं जिसमें वे terms हों जो संभावित रूप से fraudulent clients और/या transactions को फ्लैग कर सकें। Fraud analysts के पास आमतौर पर इस तरह के dictionary में क्या होना चाहिए, इसकी समझ होती है। इस अभ्यास में आप कई terms को फ्लैग करेंगे, और अगले अभ्यास में इन्हीं से एक नया फ्लैग वैरिएबल बनाएँगे। यह 'flag' सीधे एक मशीन लर्निंग मॉडल में फीचर के रूप में, या आपके मशीन लर्निंग मॉडल के परिणामों पर एक अतिरिक्त फ़िल्टर के रूप में उपयोग किया जा सकता है। पहले एक terms की सूची का उपयोग करके अपने डेटा को फ़िल्टर करते हैं। साफ किए गए ईमेल्स वाला dataframe फिर से df नाम से उपलब्ध है।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Fraud Detection
अभ्यास निर्देश
- सर्च के लिए एक सूची बनाएँ जिसमें 'enron stock', 'sell stock', 'stock bonus', और 'sell enron stock' शामिल हों।
- सर्च कंडीशंस में string terms को आपस में जोड़ें।
searchforके अंतर्गत परिभाषित सूची से मेल खाने वाले emails का उपयोग करके डेटा को फ़िल्टर करें।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create a list of terms to search for
searchfor = ['____', '____', '____', '____']
# Filter cleaned emails on searchfor list and select from df
filtered_emails = df.____[____['_____'].____._____('|'.join(____), na=False)]
print(filtered_emails)