강의 슬라이드 교시당 약 30분

하둡 8교시

설치 없이 브라우저 안에서 만져 보며 배운다. 가짜 터미널에 명령을 직접 치고, 서버를 고장 내 보고, MapReduce 를 단계별로 따라가고, 자원이 어떻게 나뉘는지 눈으로 본다.

보는 법

01

왜 하둡인가

서버 한 대로 안 되는 순간이 언제인지부터 짚는다. 설치도 명령어도 없이, 문제를 몸으로 느끼는 데 30분을 쓴다.

빅데이터스케일 아웃고장은 일상시뮬레이터 2
02

HDFS · 나눠서 저장하기

큰 파일을 128MB 로 자르고 3벌씩 복제한다. 직접 서버를 고장 내 보고, 자동으로 복구되는 걸 확인한다.

블록복제네임노드가짜 터미널
03

MapReduce · 나눠서 계산하기

Map 은 흩고 Reduce 는 모은다. 개표소 비유로 시작해 단어 세기를 처음부터 끝까지 따라간다.

MapShuffleReduce단계별 진행
04

손으로 만지기

검은 화면이 처음이어도 괜찮다. 명령 한 줄의 구조부터 HDFS 명령어와 웹 화면 읽는 법까지.

터미널hdfs dfs9870 · 8088Docker 따라치기
05

직접 돌려 보기

파이썬 두 파일 15줄로 MapReduce 를 짠다. 하둡 없이 먼저 맞히고, 그다음 클러스터에 올린다.

스트리밍mapper.pyreducer.py코드 실습
06

YARN · 자리를 나눠 주는 심판

작업을 던지면 누가 어디에 자리를 내주는지. 여러 사람이 같은 클러스터를 쓸 때 무엇을 기준으로 나누는지.

자원관리자작업반장스케줄러자원 배분 실습
07

Hive 와 생태계

코드 대신 SQL 로 쓴다. 내가 쓴 SQL 이 뒤에서 무엇으로 바뀌는지 보고, 이름만 스무 개인 생태계를 다섯 칸으로 정리한다.

Hive파티션ORCSQL 변환기
08

처음부터 끝까지

새 개념은 없다. 일곱 시간 배운 걸 다 이어서 쇼핑몰 로그 파이프라인 하나를 설계하고 만들고 운영한다.

파이프라인raw · clean · mart설계 실습

실습은 전부 브라우저 안에서 돈다

  • 가짜 HDFS 터미널 — hdfs dfs -put 을 직접 치면 파일이 조각나고 복제된다
  • 블록 · 복제 · 고장 — 서버를 죽이고 네임노드가 복구하는 걸 본다
  • MapReduce 단계 진행 — 문장을 바꿔 가며 Map · Shuffle · Reduce 를 따라간다
  • YARN 자원 배분 — 작업을 제출해서 컨테이너가 어디에 뜨는지 본다
  • Hive SQL 변환 — SQL 이 어떤 MapReduce 가 되는지 나란히 본다

수업에서 설치는 하지 않는다

설치가 필요한 부분(Docker 로 하둡 띄우기, 파이썬 MapReduce 실행)은 4교시와 5교시에 따라 칠 수 있는 명령으로 정리해 뒀다. 집에서 혼자 해 볼 때 그대로 쓰면 된다.

슬라이드 총 253장 · 교시당 27~37장 · 인터랙티브 실습 15종