Text till DataFrame
Nu när du har genererat dessa frekvensbaserade särdrag i en array behöver du formatera om dem så att de kan kombineras med resten av datamängden. Det gör du genom att konvertera arrayen till en pandas DataFrame – med de särdragsnamn du hittade tidigare som kolumnnamn – och sedan sammanfoga den med den ursprungliga DataFrame:n.
Numpy-arrayen (cv_array) och vektoriseraren (cv) som du tränade i förra övningen finns tillgängliga i din arbetsyta.
Den här övningen är en del av kursen
Särdragshantering för maskininlärning i Python
Övningsinstruktioner
- Skapa en DataFrame
cv_dfmedcv_arraysom värden och särdragsnamnen som kolumnnamn. - Lägg till prefixet
Counts_till kolumnnamnen för enklare identifiering. - Sammanfoga denna DataFrame (
cv_df) med den ursprungliga DataFrame:n (speech_df) kolumnvis.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create a DataFrame with these features
cv_df = pd.DataFrame(____,
columns=____).____('Counts_')
# Add the new columns to the original DataFrame
speech_df_new = ____([speech_df, cv_df], axis=1, sort=False)
print(speech_df_new.head())