Organisera transkriberad data från telefonsamtal
Nu är vi nästan redo att bygga en textklassificerare. Just nu finns all vår transkriberade text i två listor: pre_purchase_text och post_purchase_text.
För att strukturera datan bättre – både för textklassificering och för framtida användning – samlar vi den i en pandas DataFrame.
Vi börjar med att importera pandas som pd och skapar sedan en DataFrame för data efter köp, post_purchase_df, med hjälp av pd.DataFrame().
Vi skickar en ordbok till pd.DataFrame() med nyckeln "label" och värdet "post_purchase", samt nyckeln "text" med vår lista post_purchase_text som värde.
Samma sak görs för pre_purchase_df, fast med pre_purchase_text i stället.
Slutligen använder vi pd.concat() för att samla all data i en och samma DataFrame.
Den här övningen är en del av kursen
Taligenkänning i Python
Övningsinstruktioner
- Skapa
post_purchase_dfmed hjälp av listanpost_purchase_text. - Skapa
pre_purchase_dfmed hjälp av listanpre_purchase_text. - Kombinera de två DataFrames med
pd.concat().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
import pandas as pd
# Make dataframes with the text
post_purchase_df = pd.DataFrame({"label": "post_purchase",
"text": ____})
pre_purchase_df = pd.____({"label": "pre_purchase",
"text": ____})
# Combine DataFrames
df = pd.____([post_purchase_df, pre_purchase_df])
# Print the combined DataFrame
print(df.head())