or
यह अभ्यास पाठ्यक्रम का हिस्सा है
ऑडियो फाइलें ज़्यादातर अन्य तरह के डेटा से अलग होती हैं. उन पर काम शुरू करने से पहले कुछ प्रीप्रोसेसिंग चाहिए होती है. इस चैप्टर में, आप स्पीच फाइलों पर काम शुरू करने के शुरुआती कदम सीखेंगे: दो अलग-अलग ऑडियो फाइलों को साउंडवेव में बदलना और उन्हें विज़ुअली तुलना करना.
स्पीच रिकग्निशन अभी भी पूरी तरह सटीक नहीं है. लेकिन SpeechRecognition लाइब्रेरी कई speech-to-text APIs के साथ इंटरैक्ट करने का आसान तरीका देती है. इस सेक्शन में, आप सीखेंगे कि SpeechRecognition लाइब्रेरी का उपयोग करके अपनी ऑडियो फाइलों में बोली गई भाषा को आसानी से टेक्स्ट में कैसे बदला जाए.
सारी ऑडियो फाइलें एक जैसे आकार, साइज या फ़ॉर्मेट में नहीं आतीं. अच्छी बात यह है कि James Robert की PyDub लाइब्रेरी ऐसे टूल देती है जिनसे आप प्रोग्रामेटिक तरीके से अलग-अलग ऑडियो फ़ाइल गुण जैसे फ्रेम रेट, चैनलों की संख्या, फाइल फ़ॉर्मेट आदि बदल सकते हैं. इस चैप्टर में, आप सीखेंगे कि इस उपयोगी लाइब्रेरी का इस्तेमाल करके अपनी सभी ऑडियो फाइलों को ट्रांसक्रिप्शन के लिए सही रूप में कैसे लाएँ.
इस चैप्टर में, आप अब तक सीखी हुई सभी चीज़ों को जोड़कर एक स्पीच प्रोसेसिंग प्रूफ-ऑफ़-कॉन्सेप्ट प्रोजेक्ट बनाएँगे एक टेक्नोलॉजी कंपनी, Acme Studios, के लिए. आप शुरुआत करेंगे कस्टमर सपोर्ट फोन कॉल ऑडियो स्निपेट्स को टेक्स्ट में ट्रांसक्राइब करके. फिर आप ट्रांसक्राइब किए गए टेक्स्ट पर NLTK से sentiment analysis, spaCy से named entity recognition, और scikit-learn से text classification करेंगे.
वर्तमान अभ्यास