Numărul de cuvinte din discursurile TED
ted este un DataFrame care conține transcrierile a 500 de discursuri TED. Sarcina ta este să calculezi o nouă caracteristică, word_count, care să conțină numărul aproximativ de cuvinte pentru fiecare discurs. De asemenea, va trebui să calculezi și media numărului de cuvinte. Transcrierile sunt disponibile ca atribut transcript în ted.
Pentru a finaliza această sarcină, va trebui să definești o funcție count_words care primește un șir de caractere ca argument și returnează numărul de cuvinte din acel șir. Apoi, vei aplica această funcție pe coloana transcript din ted pentru a crea noua caracteristică word_count și a-i calcula media.
Acest exercițiu face parte din cursul
Ingineria caracteristicilor pentru NLP în Python
Instrucțiuni pentru exercițiu
- Împarte
stringîntr-o listă de cuvinte folosind metodasplit(). - Returnează numărul de elemente din
wordscu ajutorul funcțieilen(). - Aplică funcția ta pe coloana
transcriptdintedpentru a crea noua caracteristicăword_count. - Calculează media numărului de cuvinte din discursuri folosind
mean().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Function that returns number of words in a string
def count_words(string):
# Split the string into words
words = ____.____
# Return the number of words
return ____(____)
# Create a new feature word_count
ted['word_count'] = ted[____].apply(____)
# Print the average word count of the talks
print(ted[____].____)