Zacznij terazZacznij za darmo

Przetwarzanie tekstu za pomocą AutoTokenizer

Tworzysz aplikację do precyzyjnego rolnictwa, która umożliwi rolnikom zadawanie pytań dotyczących problemów napotykanych w pracy. Wykorzystasz zbiór danych zawierający typowe pytania i odpowiedzi dotyczące kwestii rolniczych. Pola w tym zbiorze danych to:

  • question: typowe pytania rolnicze
  • answers: odpowiedzi na pytania rolnicze

Jako pierwszy krok w treningu rozproszonym zaczniesz od wstępnego przetworzenia tego zbioru danych tekstowych.

Niektóre dane zostały wstępnie załadowane:

  • dataset zawiera przykładowy zbiór danych z pytaniami i odpowiedziami rolniczymi
  • AutoTokenizer został zaimportowany z biblioteki transformers

To ćwiczenie jest częścią kursu

Efektywne trenowanie modeli AI z PyTorch

Zobacz kurs

Instrukcje do ćwiczenia

  • Wczytaj wstępnie wytrenowany tokenizer.
  • Stokenizuj example["question"] przy użyciu tokenizer.
  • Zastosuj funkcję encode() na zbiorze danych dataset.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")

def encode(example):
    # Tokenize the "question" field of the training example
    return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")

# Map the function to the dataset
dataset = ____.____(____, batched=True)

dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)

print(dataset)
Edytuj i uruchom kod