Zacznij terazZacznij za darmo

Inicjalizacja trenera PPO

Pracujesz w firmie obsługi klienta, która korzysta z chatbota do odpowiadania na pytania użytkowników. Chatbot udziela pomocnych odpowiedzi, jednak ostatnio pojawiły się opinie, że brakuje im głębi. Musisz dostroić model stojący za chatbotem – zacznij od utworzenia instancji trenera PPO.

Zbiór danych dataset_cs został już wczytany.

To ćwiczenie jest częścią kursu

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Zobacz kurs

Instrukcje do ćwiczenia

  • Zainicjalizuj konfigurację PPO z nazwą modelu "gpt2" i współczynnikiem uczenia równym 1.2e-5.
  • Wczytaj AutoModelForCausalLMWithValueHead – przyczynowy model językowy z głowicą wartości.
  • Utwórz PPOTrainer(), używając zdefiniowanego modelu, konfiguracji i tokenizera oraz wstępnie wczytanego zbioru danych.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

from trl import PPOConfig, AutoModelForCausalLMWithValueHead, PPOTrainer
from transformers import AutoTokenizer

# Initialize PPO Configuration
gpt2_config = ____(model_name=____, learning_rate=____)

# Load the model
gpt2_model = ____(gpt2_config.model_name)
gpt2_tokenizer = AutoTokenizer.from_pretrained(gpt2_config.model_name)

# Initialize PPO Trainer
ppo_trainer = ____
Edytuj i uruchom kod