Kom igångKom igång gratis

Förbehandla text med AutoTokenizer

Du bygger en precisionsjordbruksapplikation som låter lantbrukare ställa frågor om problem de stöter på i fält. Du använder en datamängd med vanliga frågor och svar om jordbruksrelaterade utmaningar. Datamängden innehåller följande fält:

  • question: vanliga jordbruksfrågor
  • answers: svar på jordbruksfrågorna

Som ett första steg i distribuerad träning börjar du med att förbehandla den här textdatamängden.

En del data har redan lästs in:

  • dataset innehåller ett urval av jordbruksfrågor och svar
  • AutoTokenizer har importerats från transformers

Den här övningen är en del av kursen

Effektiv AI-modellträning med PyTorch

Visa kurs

Övningsinstruktioner

  • Läs in en förtränad tokenizer.
  • Tokenisera example["question"] med hjälp av tokenizer.
  • Applicera funktionen encode()dataset.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")

def encode(example):
    # Tokenize the "question" field of the training example
    return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")

# Map the function to the dataset
dataset = ____.____(____, batched=True)

dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)

print(dataset)
Redigera och kör kod