Uspořádání přepsaných dat z telefonních hovorů
Jsme skoro připraveni sestavit textový klasifikátor. Zatím jsou ale všechna přepsaná textová data uložena ve dvou seznamech: pre_purchase_text a post_purchase_text.
Aby se s nimi lépe pracovalo – jak při budování klasifikátoru, tak do budoucna – přesuneme je do pandas DataFrame.
Nejprve importujeme pandas jako pd a pak vytvoříme DataFrame pro hovory po nákupu, post_purchase_df, pomocí pd.DataFrame().
Do pd.DataFrame() předáme slovník s klíčem "label" a hodnotou "post_purchase" a klíčem "text" s hodnotou našeho seznamu post_purchase_text.
Stejný postup zopakujeme pro pre_purchase_df, tentokrát se seznamem pre_purchase_text.
Abychom měli všechna data na jednom místě, použijeme pd.concat() a předáme mu oba DataFramy – před i po nákupu.
Toto cvičení je součástí kurzu
Zpracování mluveného jazyka v Pythonu
Pokyny k cvičení
- Vytvoř
post_purchase_dfpomocí seznamupost_purchase_text. - Vytvoř
pre_purchase_dfpomocí seznamupre_purchase_text. - Spoj oba DataFramy pomocí
pd.concat().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
import pandas as pd
# Make dataframes with the text
post_purchase_df = pd.DataFrame({"label": "post_purchase",
"text": ____})
pre_purchase_df = pd.____({"label": "pre_purchase",
"text": ____})
# Combine DataFrames
df = pd.____([post_purchase_df, pre_purchase_df])
# Print the combined DataFrame
print(df.head())