Przetwarzanie tekstu za pomocą AutoTokenizer
Tworzysz aplikację do precyzyjnego rolnictwa, która umożliwi rolnikom zadawanie pytań dotyczących problemów napotykanych w pracy. Wykorzystasz zbiór danych zawierający typowe pytania i odpowiedzi dotyczące kwestii rolniczych. Pola w tym zbiorze danych to:
question: typowe pytania rolniczeanswers: odpowiedzi na pytania rolnicze
Jako pierwszy krok w treningu rozproszonym zaczniesz od wstępnego przetworzenia tego zbioru danych tekstowych.
Niektóre dane zostały wstępnie załadowane:
datasetzawiera przykładowy zbiór danych z pytaniami i odpowiedziami rolniczymiAutoTokenizerzostał zaimportowany z bibliotekitransformers
To ćwiczenie jest częścią kursu
Efektywne trenowanie modeli AI z PyTorch
Instrukcje do ćwiczenia
- Wczytaj wstępnie wytrenowany
tokenizer. - Stokenizuj
example["question"]przy użyciutokenizer. - Zastosuj funkcję
encode()na zbiorze danychdataset.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")
def encode(example):
# Tokenize the "question" field of the training example
return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")
# Map the function to the dataset
dataset = ____.____(____, batched=True)
dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)
print(dataset)