НачатьНачать бесплатно

Шаг 2: Определение источников текста

В этом небольшом упражнении вы загрузите и изучите небольшой корпус отзывов об аренде недвижимости в Бостоне. Вы уже наверняка знакомы с функцией read.csv(), которая позволяет загружать файлы в формате CSV. Это может показаться рутиной, но цель данной главы — пройти весь рабочий процесс от начала до конца, поэтому начнём с загрузки данных!

Далее применим str(), чтобы изучить структуру фрейма данных. Это удобная функция для компактного отображения начальных значений и типов данных векторов.

Наконец, с помощью dim() выведем размерность фрейма данных. Для фрейма данных в консоли отобразится количество строк и столбцов.

Для исследования данных часто используют и другие функции — head(), tail() или summary() — но здесь мы ограничимся кратким осмотром, чтобы скорее перейти к анализу тональности!

Это упражнение является частью курса

Анализ тональности в R

Посмотреть курс

Инструкции к упражнению

Отзывы об аренде недвижимости в Бостоне хранятся в CSV-файле, путь к которому задан предопределённой переменной bos_reviews_file.

  • Загрузите отзывы из bos_reviews_file с помощью read.csv(). Присвойте объекту имя bos_reviews.
  • Изучите структуру фрейма данных, применив базовую функцию str() к bos_reviews.
  • Узнайте, сколько отзывов содержится в наборе данных, вызвав dim() для bos_reviews.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# bos_reviews_file has been pre-defined
bos_reviews_file

# load raw text
bos_reviews <- ___

# Structure
___

# Dimensions
___
Редактировать и запускать код