จัดระเบียบข้อมูลการโทรที่ถอดเสียงแล้ว
เราใกล้จะพร้อมสร้างตัวจำแนกข้อความแล้ว แต่ตอนนี้ข้อมูลข้อความที่ถอดเสียงทั้งหมดยังอยู่ใน list สองชุด ได้แก่ pre_purchase_text และ post_purchase_text
เพื่อจัดระเบียบข้อมูลให้เหมาะสมกับการสร้างตัวจำแนกข้อความและการใช้งานในอนาคต เราจะนำข้อมูลทั้งหมดมาไว้ใน pandas DataFrame
เริ่มต้นด้วยการ import pandas เป็น pd จากนั้นสร้าง DataFrame สำหรับข้อมูลหลังการซื้อชื่อ post_purchase_df โดยใช้ pd.DataFrame()
เราจะส่ง dictionary เข้าไปใน pd.DataFrame() โดยมีคีย์ "label" ที่มีค่าเป็น "post_purchase" และคีย์ "text" ที่มีค่าเป็น list post_purchase_text
ทำเช่นเดียวกันสำหรับ pre_purchase_df แต่ใช้ pre_purchase_text แทน
เพื่อรวบรวมข้อมูลทั้งหมดไว้ในที่เดียว เราจะใช้ pd.concat() และส่ง DataFrame ทั้งสองชุดเข้าไป
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Spoken Language Processing ด้วย Python
คำแนะนำการฝึกหัด
- สร้าง
post_purchase_dfโดยใช้ listpost_purchase_text - สร้าง
pre_purchase_dfโดยใช้ listpre_purchase_text - รวม DataFrame ทั้งสองชุดเข้าด้วยกันโดยใช้
pd.concat()
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
import pandas as pd
# Make dataframes with the text
post_purchase_df = pd.DataFrame({"label": "post_purchase",
"text": ____})
pre_purchase_df = pd.____({"label": "pre_purchase",
"text": ____})
# Combine DataFrames
df = pd.____([post_purchase_df, pre_purchase_df])
# Print the combined DataFrame
print(df.head())