Porządkowanie transkrybowanych danych z rozmów telefonicznych
Jesteśmy już prawie gotowi do zbudowania klasyfikatora tekstu. Na razie wszystkie transkrybowane dane tekstowe znajdują się w dwóch listach: pre_purchase_text i post_purchase_text.
Aby lepiej je uporządkować – zarówno na potrzeby budowania klasyfikatora, jak i do przyszłego wykorzystania – umieścimy je w ramce danych pandas.
Na początku zaimportujemy pandas jako pd, a następnie utworzymy ramkę danych dla rozmów po zakupie: post_purchase_df, używając pd.DataFrame().
Do pd.DataFrame() przekażemy słownik zawierający klucz "label" z wartością "post_purchase" oraz klucz "text" z wartością listy post_purchase_text.
To samo zrobimy dla pre_purchase_df, tym razem używając listy pre_purchase_text.
Aby zebrać wszystkie dane w jednym miejscu, skorzystamy z pd.concat() i przekażemy do niego obie ramki danych.
To ćwiczenie jest częścią kursu
Przetwarzanie mowy w Pythonie
Instrukcje do ćwiczenia
- Utwórz
post_purchase_dfna podstawie listypost_purchase_text. - Utwórz
pre_purchase_dfna podstawie listypre_purchase_text. - Połącz obie ramki danych za pomocą
pd.concat().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
import pandas as pd
# Make dataframes with the text
post_purchase_df = pd.DataFrame({"label": "post_purchase",
"text": ____})
pre_purchase_df = pd.____({"label": "pre_purchase",
"text": ____})
# Combine DataFrames
df = pd.____([post_purchase_df, pre_purchase_df])
# Print the combined DataFrame
print(df.head())