ÎncepețiÎncepe gratuit

Preprocesarea textului cu AutoTokenizer

Construiești o aplicație de agricultură de precizie care le permite fermierilor să adreseze întrebări despre problemele întâlnite pe teren. Vei folosi un set de date cu întrebări și răspunsuri frecvente legate de agricultură; câmpurile din acest set de date sunt:

  • question: întrebări agricole frecvente
  • answers: răspunsuri la întrebările agricole

Ca prim pas în antrenarea distribuită, vei începe prin preprocesarea acestui set de date text.

Unele date au fost preîncărcate:

  • dataset conține un eșantion din setul de date cu întrebări și răspunsuri agricole
  • AutoTokenizer a fost importat din transformers

Acest exercițiu face parte din cursul

Antrenament eficient al modelelor AI cu PyTorch

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă un tokenizer pre-antrenat.
  • Tokenizează example["question"] folosind tokenizer-ul.
  • Aplică funcția encode() pe dataset.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")

def encode(example):
    # Tokenize the "question" field of the training example
    return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")

# Map the function to the dataset
dataset = ____.____(____, batched=True)

dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)

print(dataset)
Editează și rulează codul