중간 단계를 건너뛰기
이제 pandas를 통해 데이터를 Spark에 넣는 방법을 알게 되었지만, 굳이 pandas를 거쳐야 할까 하는 생각이 드실 거예요. 텍스트 파일을 바로 Spark로 읽어 오면 더 간단하지 않을까요? 물론이죠!
다행히 SparkSession에는 여러 데이터 소스를 Spark DataFrame으로 읽어 들이는 메서드를 가진 .read 속성이 있어요. 이를 사용하면 일반 pandas DataFrame과 마찬가지로 .csv 파일에서 바로 DataFrame을 만들 수 있어요!
변수 file_path에는 airports.csv 파일의 경로가 문자열로 들어 있습니다. 이 파일에는 전 세계 여러 공항에 대한 정보가 들어 있어요.
워크스페이스에는 spark라는 이름의 SparkSession이 준비되어 있어요.
이 연습은 강의의 일부입니다
PySpark 기초
연습 안내
.read.csv()메서드를 사용해airports라는 Spark DataFrame을 만드세요.- 첫 번째 인수는
file_path입니다. - 파일의 첫 줄에서 열 이름을 읽도록
header=True인수를 전달하세요.
- 첫 번째 인수는
.show()를 호출해 이 DataFrame을 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"
# Read in the airports data
airports = ____.____.____(____, ____=____)
# Show the data
____.____()