Du texte à un DataFrame
Vous avez maintenant généré ces caractéristiques basées sur des occurrences dans un tableau; il faut les reformater pour pouvoir les combiner avec le reste de l'ensemble de données. Pour ce faire, convertissez le tableau en un DataFrame pandas, en utilisant comme noms de colonnes les noms de caractéristiques trouvés plus tôt, puis concaténez le tout avec le DataFrame original.
Le tableau numpy (cv_array) et le vectoriseur (cv) ajustés à l'exercice précédent sont disponibles dans votre espace de travail.
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le Machine Learning en Python
Instructions de l’exercice
- Créez un DataFrame
cv_dfcontenantcv_arraycomme valeurs et les noms de caractéristiques comme noms de colonnes. - Ajoutez le préfixe
Counts_aux noms de colonnes pour faciliter l'identification. - Concaténez ce DataFrame (
cv_df) au DataFrame original (speech_df) par colonnes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a DataFrame with these features
cv_df = pd.DataFrame(____,
columns=____).____('Counts_')
# Add the new columns to the original DataFrame
speech_df_new = ____([speech_df, cv_df], axis=1, sort=False)
print(speech_df_new.head())