Kom igångKom igång gratis

Organisera transkriberad data från telefonsamtal

Nu är vi nästan redo att bygga en textklassificerare. Just nu finns all vår transkriberade text i två listor: pre_purchase_text och post_purchase_text.

För att strukturera datan bättre – både för textklassificering och för framtida användning – samlar vi den i en pandas DataFrame.

Vi börjar med att importera pandas som pd och skapar sedan en DataFrame för data efter köp, post_purchase_df, med hjälp av pd.DataFrame().

Vi skickar en ordbok till pd.DataFrame() med nyckeln "label" och värdet "post_purchase", samt nyckeln "text" med vår lista post_purchase_text som värde.

Samma sak görs för pre_purchase_df, fast med pre_purchase_text i stället.

Slutligen använder vi pd.concat() för att samla all data i en och samma DataFrame.

Den här övningen är en del av kursen

Taligenkänning i Python

Visa kurs

Övningsinstruktioner

  • Skapa post_purchase_df med hjälp av listan post_purchase_text.
  • Skapa pre_purchase_df med hjälp av listan pre_purchase_text.
  • Kombinera de två DataFrames med pd.concat().

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

import pandas as pd

# Make dataframes with the text
post_purchase_df = pd.DataFrame({"label": "post_purchase",
                                 "text": ____})
pre_purchase_df = pd.____({"label": "pre_purchase",
                                "text": ____})

# Combine DataFrames
df = pd.____([post_purchase_df, pre_purchase_df])

# Print the combined DataFrame
print(df.head())
Redigera och kör kod