การ Preprocess ชุดข้อมูลเสียง
คุณกำลังพัฒนาแอปพลิเคชันการเกษตรแม่นยำด้วยการเพิ่มฟีเจอร์ควบคุมเครื่องจักรด้วยคำสั่งเสียง ระบบควรจดจำคำสำคัญในคำสั่ง เช่น "Turn on the sprinkler irrigation system."
ในแบบฝึกหัดนี้ จะใช้ชุดข้อมูล keyword spotting ที่มีคลิปเสียงของคำสำคัญต่าง ๆ เช่น "on" ให้ทำการ preprocess ไฟล์เสียงเหล่านี้เพื่อให้พร้อมใช้งานกับโมเดล Transformer ที่ผ่านการฝึกมาแล้ว
ข้อมูลบางส่วนถูกโหลดไว้ให้แล้ว:
datasetมีชุดข้อมูลฝึกตัวอย่างของไฟล์เสียง โดยมี splittrainอยู่แล้ว จึงไม่จำเป็นต้องระบุtrainเมื่อใช้งานdatasetAutoFeatureExtractorถูก import มาจากtransformersแล้วmodelมีค่าเท่ากับfacebook/wav2vec2-basemax_durationกำหนดไว้เป็น 1 วินาที
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การเทรน AI Model อย่างมีประสิทธิภาพด้วย PyTorch
คำแนะนำการฝึกหัด
- โหลด
feature_extractorที่ผ่านการฝึกมาแล้วด้วยคลาสAutoFeatureExtractor - กำหนด
sampling_rateโดยใช้ค่าอัตราจากfeature_extractor - กำหนด
max_lengthของaudio_arraysโดยใช้max_duration
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Load a pre-trained feature extractor
feature_extractor = ____.____(model)
def preprocess_function(examples):
audio_arrays = [x["array"] for x in examples["audio"]]
inputs = feature_extractor(
audio_arrays,
# Set the sampling rate
sampling_rate=____.____,
# Set the max length
max_length=int(feature_extractor.sampling_rate * max_duration),
truncation=True)
return inputs
encoded_dataset = dataset.map(preprocess_function, remove_columns=["audio", "file"], batched=True)