시작하기무료로 시작하기

중간 단계를 건너뛰기

이제 pandas를 통해 데이터를 Spark에 넣는 방법을 알게 되었지만, 굳이 pandas를 거쳐야 할까 하는 생각이 드실 거예요. 텍스트 파일을 바로 Spark로 읽어 오면 더 간단하지 않을까요? 물론이죠!

다행히 SparkSession에는 여러 데이터 소스를 Spark DataFrame으로 읽어 들이는 메서드를 가진 .read 속성이 있어요. 이를 사용하면 일반 pandas DataFrame과 마찬가지로 .csv 파일에서 바로 DataFrame을 만들 수 있어요!

변수 file_path에는 airports.csv 파일의 경로가 문자열로 들어 있습니다. 이 파일에는 전 세계 여러 공항에 대한 정보가 들어 있어요.

워크스페이스에는 spark라는 이름의 SparkSession이 준비되어 있어요.

이 연습은 강의의 일부입니다

PySpark 기초

강의 보기

연습 안내

  • .read.csv() 메서드를 사용해 airports라는 Spark DataFrame을 만드세요.
    • 첫 번째 인수는 file_path입니다.
    • 파일의 첫 줄에서 열 이름을 읽도록 header=True 인수를 전달하세요.
  • .show()를 호출해 이 DataFrame을 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"

# Read in the airports data
airports = ____.____.____(____, ____=____)

# Show the data
____.____()
코드 편집 및 실행