Preprocesarea textului cu AutoTokenizer
Construiești o aplicație de agricultură de precizie care le permite fermierilor să adreseze întrebări despre problemele întâlnite pe teren. Vei folosi un set de date cu întrebări și răspunsuri frecvente legate de agricultură; câmpurile din acest set de date sunt:
question: întrebări agricole frecventeanswers: răspunsuri la întrebările agricole
Ca prim pas în antrenarea distribuită, vei începe prin preprocesarea acestui set de date text.
Unele date au fost preîncărcate:
datasetconține un eșantion din setul de date cu întrebări și răspunsuri agricoleAutoTokenizera fost importat dintransformers
Acest exercițiu face parte din cursul
Antrenament eficient al modelelor AI cu PyTorch
Instrucțiuni pentru exercițiu
- Încarcă un
tokenizerpre-antrenat. - Tokenizează
example["question"]folosindtokenizer-ul. - Aplică funcția
encode()pedataset.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")
def encode(example):
# Tokenize the "question" field of the training example
return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")
# Map the function to the dataset
dataset = ____.____(____, batched=True)
dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)
print(dataset)