CommencezCommencez gratuitement

Du texte à un DataFrame

Vous avez maintenant généré ces caractéristiques basées sur des occurrences dans un tableau; il faut les reformater pour pouvoir les combiner avec le reste de l'ensemble de données. Pour ce faire, convertissez le tableau en un DataFrame pandas, en utilisant comme noms de colonnes les noms de caractéristiques trouvés plus tôt, puis concaténez le tout avec le DataFrame original.

Le tableau numpy (cv_array) et le vectoriseur (cv) ajustés à l'exercice précédent sont disponibles dans votre espace de travail.

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le Machine Learning en Python

Voir le cours

Instructions de l’exercice

  • Créez un DataFrame cv_df contenant cv_array comme valeurs et les noms de caractéristiques comme noms de colonnes.
  • Ajoutez le préfixe Counts_ aux noms de colonnes pour faciliter l'identification.
  • Concaténez ce DataFrame (cv_df) au DataFrame original (speech_df) par colonnes.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a DataFrame with these features
cv_df = pd.DataFrame(____, 
                     columns=____).____('Counts_')

# Add the new columns to the original DataFrame
speech_df_new = ____([speech_df, cv_df], axis=1, sort=False)
print(speech_df_new.head())
Modifier et exécuter le code