Vytváření trénovacích vzorků
Váš tým vyvíjí chatbota pro zákaznický servis a ty připravuješ pipeline pro předzpracování datasetu, který se použije k fine-tuningu jazykového modelu. Cílem je, aby model dokázal rozpoznat záměr zákazníkova dotazu a přesměrovat požadavek správnému týmu ke zpracování.
Máš k dispozici dataset, kde jsou zákazníkovy dotazy a jejich záměry uloženy v samostatných sloupcích. Úkolem je dataset předzpracovat tak, aby každý příklad spojoval dotaz i záměr do jednoho řetězce ve formě formátovaného promptu.
Dataset je již načtený v proměnné dataset a obsahuje sloupce instruction se zákazníkovým dotazem a intent se záměrem uživatele.
Toto cvičení je součástí kurzu
Fine-Tuning s Llama 3
Pokyny k cvičení
- Vytvoř řetězec promptu s instrukcí a záměrem ve tvaru
"Query: {instruction}\nIntent: {intent}". - Doplň volání funkce s datasetem tak, aby se funkce
create_intent_exampleaplikovala na každý řádek. - Vyextrahuj a vypiš hodnotu ve sloupci
intent_examplez prvního řádku datasetu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
def create_intent_example(row):
# Fill out the columns in the prompt
row['intent_example'] = ____
return row
# Call the ds method to apply our preprocessing function to all rows
processed_dataset = dataset.____(____)
# Print the intent_example in the first row of the processed data
print(processed_dataset[____][____])