ประมวลผลข้อความล่วงหน้าด้วย AutoTokenizer
คุณกำลังสร้างแอปพลิเคชันเกษตรกรรมแม่นยำ เพื่อให้เกษตรกรสามารถถามคำถามเกี่ยวกับปัญหาที่พบในแปลง โดยจะใช้ชุดข้อมูลคำถามและคำตอบที่พบบ่อยในการเกษตร ซึ่งมี field ดังนี้
question: คำถามด้านการเกษตรที่พบบ่อยanswers: คำตอบสำหรับคำถามด้านการเกษตร
ในฐานะขั้นตอนแรกของการเทรนแบบกระจาย จะเริ่มต้นด้วยการประมวลผลชุดข้อมูลข้อความนี้ล่วงหน้า
ข้อมูลบางส่วนถูกโหลดไว้แล้ว:
datasetมีชุดข้อมูลตัวอย่างของคำถามและคำตอบด้านการเกษตรAutoTokenizerถูกนำเข้ามาแล้วจากtransformers
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การเทรน AI Model อย่างมีประสิทธิภาพด้วย PyTorch
คำแนะนำการฝึกหัด
- โหลด
tokenizerที่ผ่านการเทรนมาแล้ว - แปลง
example["question"]ให้เป็น token โดยใช้tokenizer - นำฟังก์ชัน
encode()ไปใช้กับdataset
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")
def encode(example):
# Tokenize the "question" field of the training example
return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")
# Map the function to the dataset
dataset = ____.____(____, batched=True)
dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)
print(dataset)