शुरू करेंमुफ़्त में शुरू करें

बोली गई भाषा के टेक्स्ट का क्लासिफायर बनाएँ

अब जब आपने कुछ कस्टमर कॉल के ऑडियो डेटा को ट्रांसक्राइब कर लिया है, तो हम एक मॉडल बनाएँगे जो यह क्लासिफाई करे कि कस्टमर कॉल से आया टेक्स्ट pre_purchase है या post_purchase

हमारे पास pre_purchase कॉल के 45 उदाहरण और post_purchase कॉल के 57 उदाहरण हैं।

मॉडल जिस डेटा पर ट्रेन होगा, वह train_df में है और जिस डेटा पर यह प्रिडिक्ट करेगा, वह test_df में है।

कृपया दोनों के .head() को कंसोल पर प्रिंट करके देखें।

हम CountVectorizer() और TfidfTransformer() का उपयोग करके टेक्स्ट सैंपल्स को नंबरों में बदलने के लिए एक sklearn pipeline बनाएँगे और फिर MultinomialNB() क्लासिफायर से सीखेंगे कि प्रत्येक सैंपल किस कैटेगरी का है।

यह मॉडल हमारे छोटे उदाहरण पर अच्छी तरह काम करेगा, लेकिन बड़े टेक्स्ट कलेक्शन के लिए आप कुछ और उन्नत तरीकों पर विचार करना चाहेंगे।

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Spoken Language Processing

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Build the text_classifier as an sklearn pipeline
text_classifier = Pipeline([
    ('vectorizer', ____),
    ('tfidf', ____),
    ('classifier', ____),
])

# Fit the classifier pipeline on the training data
text_classifier.fit(____, ____)
कोड संपादित करें और चलाएँ