เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การ Preprocess ชุดข้อมูลเสียง

คุณกำลังพัฒนาแอปพลิเคชันการเกษตรแม่นยำด้วยการเพิ่มฟีเจอร์ควบคุมเครื่องจักรด้วยคำสั่งเสียง ระบบควรจดจำคำสำคัญในคำสั่ง เช่น "Turn on the sprinkler irrigation system."

ในแบบฝึกหัดนี้ จะใช้ชุดข้อมูล keyword spotting ที่มีคลิปเสียงของคำสำคัญต่าง ๆ เช่น "on" ให้ทำการ preprocess ไฟล์เสียงเหล่านี้เพื่อให้พร้อมใช้งานกับโมเดล Transformer ที่ผ่านการฝึกมาแล้ว

ข้อมูลบางส่วนถูกโหลดไว้ให้แล้ว:

  • dataset มีชุดข้อมูลฝึกตัวอย่างของไฟล์เสียง โดยมี split train อยู่แล้ว จึงไม่จำเป็นต้องระบุ train เมื่อใช้งาน dataset
  • AutoFeatureExtractor ถูก import มาจาก transformers แล้ว
  • model มีค่าเท่ากับ facebook/wav2vec2-base
  • max_duration กำหนดไว้เป็น 1 วินาที

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การเทรน AI Model อย่างมีประสิทธิภาพด้วย PyTorch

ดูคอร์ส

คำแนะนำการฝึกหัด

  • โหลด feature_extractor ที่ผ่านการฝึกมาแล้วด้วยคลาส AutoFeatureExtractor
  • กำหนด sampling_rate โดยใช้ค่าอัตราจาก feature_extractor
  • กำหนด max_length ของ audio_arrays โดยใช้ max_duration

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Load a pre-trained feature extractor
feature_extractor = ____.____(model)

def preprocess_function(examples):
    audio_arrays = [x["array"] for x in examples["audio"]]
    inputs = feature_extractor(
        audio_arrays,
        # Set the sampling rate
        sampling_rate=____.____, 
        # Set the max length
        max_length=int(feature_extractor.sampling_rate * max_duration), 
        truncation=True)
    return inputs

encoded_dataset = dataset.map(preprocess_function, remove_columns=["audio", "file"], batched=True)
แก้ไขและรันโค้ด