or
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ไฟล์เสียงแตกต่างจากข้อมูลประเภทอื่นอยู่มาก ก่อนจะนำไปใช้งานได้ จำเป็นต้องผ่านการเตรียมข้อมูลเบื้องต้นก่อน ในบทนี้จะได้เรียนรู้ขั้นตอนแรกของการทำงานกับไฟล์เสียง โดยแปลงไฟล์เสียงสองรูปแบบให้อยู่ในรูปคลื่นเสียง แล้วนำมาเปรียบเทียบกันในเชิงภาพ
การรู้จำเสียงพูดยังห่างไกลจากความสมบูรณ์แบบ แต่ไลบรารี SpeechRecognition ช่วยให้เชื่อมต่อกับ API แปลงเสียงเป็นข้อความได้หลายตัวอย่างสะดวก ในส่วนนี้จะได้เรียนรู้วิธีใช้ไลบรารี SpeechRecognition เพื่อเริ่มแปลงภาษาพูดในไฟล์เสียงให้เป็นข้อความได้อย่างรวดเร็ว
ไฟล์เสียงไม่ได้มาในรูปแบบ ขนาด หรือฟอร์แมตเดียวกันเสมอไป โชคดีที่ไลบรารี PyDub ของ James Robert มีเครื่องมือที่ช่วยปรับแต่งคุณสมบัติต่าง ๆ ของไฟล์เสียงด้วยโค้ด ไม่ว่าจะเป็นเฟรมเรต จำนวนช่องสัญญาณ ฟอร์แมตไฟล์ และอื่น ๆ ในบทนี้จะได้เรียนรู้การใช้ไลบรารีนี้เพื่อจัดเตรียมไฟล์เสียงทั้งหมดให้พร้อมสำหรับการถอดความ
ในบทนี้จะนำทุกสิ่งที่ได้เรียนมารวมกัน เพื่อสร้างโปรเจกต์ต้นแบบด้านการประมวลผลเสียงพูดสำหรับบริษัทเทคโนโลยีแห่งหนึ่งชื่อ Acme Studios โดยเริ่มจากการถอดความตัวอย่างไฟล์เสียงการโทรศัพท์ฝ่ายบริการลูกค้าให้เป็นข้อความ จากนั้นจะทำการวิเคราะห์ความรู้สึกด้วย NLTK การรู้จำชื่อเฉพาะด้วย spaCy และการจำแนกประเภทข้อความด้วย scikit-learn บนข้อความที่ถอดความได้
แบบฝึกหัดปัจจุบัน