Multiple Speakers 2
एक ही ऑडियो फ़ाइल में कई स्पीकर्स को अलग-अलग पहचानना speaker diarization कहलाता है. हालाँकि, आपने देखा कि हम जो फ्री फंक्शन इस्तेमाल कर रहे हैं, recognize_google(), उसमें अलग-अलग स्पीकर्स को ट्रांसक्राइब करने की क्षमता नहीं है.
बिना किसी पेड speech-to-text सर्विस का उपयोग किए, इसका एक तरीका यह है कि आप अपनी ऑडियो फ़ाइलों को single speaker रखें.
इसका मतलब है कि अगर आप फ़ोन कॉल डेटा के साथ काम कर रहे हों, तो कॉलर और रिसीवर को अलग-अलग रिकॉर्ड करें. फिर आप हर फ़ाइल को अलग से ट्रांसक्राइब कर सकते हैं.
इस अभ्यास में, हम अपने multiple speakers ऑडियो फ़ाइल के हर स्पीकर को अलग-अलग ट्रांसक्राइब करेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Spoken Language Processing
अभ्यास निर्देश
- अलग-अलग स्पीकर्स पर लूप चलाने के लिए
speakersकोenumerate()फंक्शन में पास करें. AudioFiles कोAudioDataमें बदलने के लिएrecognizerपरrecord()कॉल करें.- हर
speaker_audioऑब्जेक्ट को ट्रांसक्राइब करने के लिएrecognize_google()का उपयोग करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
recognizer = sr.Recognizer()
# Multiple speakers on different files
speakers = [sr.AudioFile("speaker_0.wav"),
sr.AudioFile("speaker_1.wav"),
sr.AudioFile("speaker_2.wav")]
# Transcribe each speaker individually
for i, speaker in enumerate(____):
with speaker as source:
speaker_audio = recognizer.____(source)
print(f"Text from speaker {i}:")
print(recognizer.____(____,
language="en-US"))