ÎncepețiÎncepe gratuit

Numărul de cuvinte din discursurile TED

ted este un DataFrame care conține transcrierile a 500 de discursuri TED. Sarcina ta este să calculezi o nouă caracteristică, word_count, care să conțină numărul aproximativ de cuvinte pentru fiecare discurs. De asemenea, va trebui să calculezi și media numărului de cuvinte. Transcrierile sunt disponibile ca atribut transcript în ted.

Pentru a finaliza această sarcină, va trebui să definești o funcție count_words care primește un șir de caractere ca argument și returnează numărul de cuvinte din acel șir. Apoi, vei aplica această funcție pe coloana transcript din ted pentru a crea noua caracteristică word_count și a-i calcula media.

Acest exercițiu face parte din cursul

Ingineria caracteristicilor pentru NLP în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Împarte string într-o listă de cuvinte folosind metoda split().
  • Returnează numărul de elemente din words cu ajutorul funcției len().
  • Aplică funcția ta pe coloana transcript din ted pentru a crea noua caracteristică word_count.
  • Calculează media numărului de cuvinte din discursuri folosind mean().

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Function that returns number of words in a string
def count_words(string):
	# Split the string into words
    words = ____.____
    
    # Return the number of words
    return ____(____)

# Create a new feature word_count
ted['word_count'] = ted[____].apply(____)

# Print the average word count of the talks
print(ted[____].____)
Editează și rulează codul