or
Den här övningen är en del av kursen
Ljudfiler skiljer sig från de flesta andra datatyper. Innan du kan börja arbeta med dem krävs viss förbehandling. I det här kapitlet lär du dig de första stegen för att arbeta med talfiler, genom att omvandla två olika ljudfiler till ljudvågor och jämföra dem visuellt.
Taligenkänning är ännu långt ifrån perfekt. Men biblioteket SpeechRecognition ger ett enkelt sätt att använda många tal-till-text-API:er. I det här avsnittet lär du dig hur du använder SpeechRecognition för att snabbt börja omvandla talat språk i dina ljudfiler till text.
Inte alla ljudfiler har samma format, storlek eller struktur. Lyckligtvis erbjuder PyDub av James Robert verktyg för att programmatiskt ändra olika egenskaper hos ljudfiler, till exempel samplingshastighet, antal kanaler och filformat. I det här kapitlet lär du dig att använda det här användbara biblioteket för att se till att alla dina ljudfiler är i rätt format för transkribering.
I det här kapitlet samlar du ihop allt du har lärt dig och bygger ett proof of concept-projekt för taligenkänning åt teknikföretaget Acme Studios. Du börjar med att transkribera korta ljudklipp från kundtjänstsamtal till text. Sedan utför du sentimentanalys med NLTK, namngiven enhetsigenkänning med spaCy och textklassificering med scikit-learn på den transkriberade texten.
Aktuell övning