Začněte nyníZačněte zdarma

Zmírnění negativní KL divergence

Při fine-tuningu modelu pomocí technik RLHF jsi zjistil/a, že jeho výkon se ve srovnání se základním modelem zhoršil. Příčinou by mohla být negativní KL divergence, proto chceš nastavit správné parametry generování, které tomuto problému zabrání.

tokenizer je již předem naimportován.

Toto cvičení je součástí kurzu

Reinforcement Learning from Human Feedback (RLHF)

Zobrazit kurz

Pokyny k cvičení

  • Nastav top_k a min_length na hodnoty, které pomohou předejít KL divergenci.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

generation_kwargs = {
    # Set min length and top k parameters
    ____, 
  	"top_p": 1.0,
  	"do_sample": True,  
  	"pad_token_id": tokenizer.eos_token_id, 
  	"max_new_tokens": 32}
Upravit a spustit kód