Текст у DataFrame
Тепер, коли ви згенерували ці ознаки на основі лічильників у масиві, їх потрібно переформатувати, щоб їх можна було поєднати з рештою набору даних. Це можна зробити, перетворивши масив на pandas DataFrame з назвами ознак, які ви знайшли раніше, як назвами стовпців, а потім об'єднавши його з початковим DataFrame.
Масив numpy (cv_array) і векторизатор (cv), які ви налаштували в попередній вправі, доступні у вашому робочому середовищі.
Ця вправа є частиною курсу
Feature Engineering для машинного навчання в Python
Інструкції до вправи
- Створіть DataFrame
cv_df, що міститьcv_arrayяк значення та імена ознак як назви стовпців. - Додайте префікс
Counts_до назв стовпців для зручної ідентифікації. - Об'єднайте цей DataFrame (
cv_df) з початковим DataFrame (speech_df) по стовпцях.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create a DataFrame with these features
cv_df = pd.DataFrame(____,
columns=____).____('Counts_')
# Add the new columns to the original DataFrame
speech_df_new = ____([speech_df, cv_df], axis=1, sort=False)
print(speech_df_new.head())