เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ผู้พูดหลายคน 1

หากต้องการถอดความการสนทนา จะต้องมีผู้พูดมากกว่าหนึ่งคน แต่อย่างที่จะเห็นกัน ฟังก์ชัน recognize_google() จะถอดความเสียงพูดทั้งหมดออกมาเป็นข้อความชุดเดียว

ลองฟัง ไฟล์เสียงนี้ จะพบว่ามีผู้พูดอยู่ถึงสามคน

แต่เมื่อนำไปถอดความ recognize_google() จะคืนค่าเป็นข้อความชุดเดียว ซึ่งยังคงมีประโยชน์ แต่ไม่สามารถบอกได้ว่าใครพูดอะไร

แบบฝึกหัดถัดไปจะแนะนำวิธีทางเลือกสำหรับปัญหานี้

ไฟล์เสียงที่มีผู้พูดหลายคนได้ถูกนำเข้าและแปลงเป็น AudioData ไว้ในตัวแปร multiple_speakers แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Spoken Language Processing ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง instance ของ Recognizer
  • ถอดความตัวแปร multiple_speakers โดยใช้ฟังก์ชัน recognize_google()
  • ตั้งค่าภาษาเป็นภาษาอังกฤษแบบอเมริกัน ("en-US")

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create a recognizer class
recognizer = sr.____()

# Recognize the multiple speaker AudioData
text = recognizer.recognize_google(____, 
                       			   language=____)

# Print the text
print(text)
แก้ไขและรันโค้ด