क्लासिफिकेशन डेटा की जाँच
इस अध्याय के अंतिम अभ्यासों में, आप उन दो datasets को एक्सप्लोर करेंगे जिनका आप इस कोर्स में उपयोग करेंगे.
पहला एक heartbeat sounds का कलेक्शन है. दिल की धड़कन सामान्यतः एक पूर्वानुमेय साउंड पैटर्न का पालन करती है, लेकिन कुछ विकारों में दिल की धड़कनें असामान्य हो सकती हैं. इस डेटासेट में एक training सेट है जिसमें हर प्रकार की धड़कन के लिए लेबल दिए गए हैं, और एक testing सेट है जिसमें लेबल नहीं हैं. आप अपने मॉडलों को वैलिडेट करने के लिए testing सेट का उपयोग करेंगे.
चूँकि आपके पास labeled डेटा है, यह डेटासेट classification के लिए उपयुक्त है. वास्तव में, इसे मूल रूप से एक public Kaggle competition का हिस्सा बनाकर उपलब्ध कराया गया था.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Time Series Data के लिए Machine Learning
अभ्यास निर्देश
globका उपयोग करकेdata_dirडायरेक्टरी में मौजूद.wavफ़ाइलों की सूची प्राप्त करें.- सूची में पहली audio फ़ाइल को
librosaका उपयोग करके इम्पोर्ट करें. - डेटा के लिए
timearray जनरेट करें. - इस फ़ाइल की waveform को time array के साथ प्लॉट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
import librosa as lr
from glob import glob
# List all the wav files in the folder
audio_files = ____(data_dir + '/*.wav')
# Read in the first audio file, create the time array
audio, sfreq = lr.load(____)
time = np.arange(0, len(audio)) / ____
# Plot audio over time
fig, ax = plt.subplots()
ax.plot(____, ____)
ax.set(xlabel='Time (s)', ylabel='Sound Amplitude')
plt.show()