เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ประมวลผลข้อความล่วงหน้าด้วย AutoTokenizer

คุณกำลังสร้างแอปพลิเคชันเกษตรกรรมแม่นยำ เพื่อให้เกษตรกรสามารถถามคำถามเกี่ยวกับปัญหาที่พบในแปลง โดยจะใช้ชุดข้อมูลคำถามและคำตอบที่พบบ่อยในการเกษตร ซึ่งมี field ดังนี้

  • question: คำถามด้านการเกษตรที่พบบ่อย
  • answers: คำตอบสำหรับคำถามด้านการเกษตร

ในฐานะขั้นตอนแรกของการเทรนแบบกระจาย จะเริ่มต้นด้วยการประมวลผลชุดข้อมูลข้อความนี้ล่วงหน้า

ข้อมูลบางส่วนถูกโหลดไว้แล้ว:

  • dataset มีชุดข้อมูลตัวอย่างของคำถามและคำตอบด้านการเกษตร
  • AutoTokenizer ถูกนำเข้ามาแล้วจาก transformers

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การเทรน AI Model อย่างมีประสิทธิภาพด้วย PyTorch

ดูคอร์ส

คำแนะนำการฝึกหัด

  • โหลด tokenizer ที่ผ่านการเทรนมาแล้ว
  • แปลง example["question"] ให้เป็น token โดยใช้ tokenizer
  • นำฟังก์ชัน encode() ไปใช้กับ dataset

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")

def encode(example):
    # Tokenize the "question" field of the training example
    return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")

# Map the function to the dataset
dataset = ____.____(____, batched=True)

dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)

print(dataset)
แก้ไขและรันโค้ด