Zacznij terazZacznij za darmo

Inicjalizacja nagrody

Jesteś na ostatnim etapie wdrażania modelu generatywnego, który ma oferować spersonalizowane rekomendacje dla internetowej księgarni. Aby dopasować ten model do rekomendacji preferowanych przez ludzi, musisz wytrenować model nagrody na zebranych danych preferencji. Pierwszym krokiem jest zainicjalizowanie modelu i parametrów konfiguracyjnych.

AutoTokenizer i AutoModelForSequenceClassification zostały wstępnie załadowane z transformers. RewardConfig zostało wstępnie załadowane z trl.

To ćwiczenie jest częścią kursu

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Zobacz kurs

Instrukcje do ćwiczenia

  • Załaduj model GPT-1, "openai-gpt", do zadania klasyfikacji sekwencji, korzystając z AutoModelForSequenceClassification z Hugging Face.
  • Zainicjalizuj konfigurację nagrody, używając "output_dir" jako katalogu wyjściowego, i ustaw maksymalną długość tokenu na 60.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load the pre-trained GPT-1 model for text classification
model = ____

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Initialize the reward configuration and set max_length
config = ____(output_dir=____, max_length=____)
Edytuj i uruchom kod