Organizando dados de chamadas telefônicas transcritas
Estamos quase prontos para construir um classificador de texto. Mas, neste momento, todos os nossos dados de texto transcrito estão em duas listas, pre_purchase_text e post_purchase_text.
Para organizar melhor, tanto para construir um classificador de texto quanto para uso futuro, vamos reuni-los em um DataFrame do pandas.
Para começar, vamos importar pandas como pd e então criar um DataFrame de pós-compra, post_purchase_df, usando pd.DataFrame().
Vamos passar para pd.DataFrame() um dicionário contendo a chave "label" com o valor "post_purchase" e a chave "text" com o valor da nossa lista post_purchase_text.
Faremos o mesmo para pre_purchase_df, só que com pre_purchase_text.
Para ter todos os dados em um só lugar, usaremos pd.concat() e vamos passar para ela os DataFrames de pré e pós-compra.
Este exercicio faz parte do curso
Processamento de Linguagem Falada em Python
Instruções do exercicio
- Crie
post_purchase_dfusando a listapost_purchase_text. - Crie
pre_purchase_dfusando a listapre_purchase_text. - Combine os dois DataFrames usando
pd.concat().
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
import pandas as pd
# Make dataframes with the text
post_purchase_df = pd.DataFrame({"label": "post_purchase",
"text": ____})
pre_purchase_df = pd.____({"label": "pre_purchase",
"text": ____})
# Combine DataFrames
df = pd.____([post_purchase_df, pre_purchase_df])
# Print the combined DataFrame
print(df.head())