Förbehandla text med AutoTokenizer
Du bygger en precisionsjordbruksapplikation som låter lantbrukare ställa frågor om problem de stöter på i fält. Du använder en datamängd med vanliga frågor och svar om jordbruksrelaterade utmaningar. Datamängden innehåller följande fält:
question: vanliga jordbruksfrågoranswers: svar på jordbruksfrågorna
Som ett första steg i distribuerad träning börjar du med att förbehandla den här textdatamängden.
En del data har redan lästs in:
datasetinnehåller ett urval av jordbruksfrågor och svarAutoTokenizerhar importerats fråntransformers
Den här övningen är en del av kursen
Effektiv AI-modellträning med PyTorch
Övningsinstruktioner
- Läs in en förtränad
tokenizer. - Tokenisera
example["question"]med hjälp avtokenizer. - Applicera funktionen
encode()pådataset.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")
def encode(example):
# Tokenize the "question" field of the training example
return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")
# Map the function to the dataset
dataset = ____.____(____, batched=True)
dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)
print(dataset)