차원 · Dimension
데이터를 분류·나누는 기준
예: 역, 노선, 지역, Category
빅데이터 탐색 작업
원자료를 수집·검증하고, 전처리와 탐색으로 분석 가능한 재료를 만듭니다.
원자료를 그대로 믿지 말고, 분석 가능한 재료로 점검·정리합니다.
Tableau는 필드를 차원·측정값으로 나누어 화면에 배치합니다. 이름을 외우기보다 “어떻게 쪼개고, 무엇을 셀까?”로 이해합니다.
데이터를 분류·나누는 기준
예: 역, 노선, 지역, Category
합계·평균·개수로 재는 값
예: 대여건수, Sales, Profit
표가 깔끔해야 필터·집계·차트가 예측대로 움직입니다. 병합 셀과 설명 행은 분석 전에 걷어냅니다.
전처리는 데이터를 숨기는 작업이 아니라, 무엇을 했는지 기록하며 분석의 신뢰도를 높이는 과정입니다.
결측·이상값을 처리한 이유를 팀 노트에 남깁니다.
다른 팀원이 같은 순서로 다시 따라 할 수 있어야 합니다.
빈칸을 모두 0으로 바꾸면 “없다”와 “기록되지 않았다”를 섞게 됩니다. 의미를 먼저 확인합니다.
결측 자체가 정보일 때: 응답하지 않음, 미운영
분석 기준을 만족하지 않는 행을 제외하고 기록
평균·중앙값·앞뒤 값 등 규칙을 정하고 근거 남기기
EDA는 정답을 발표하는 시간이 아니라, 데이터의 모양과 예외를 발견하는 시간입니다.
어제 정한 프로젝트 데이터에서 10행을 골라 점검합니다. 표를 직접 보고, 문제와 처리 규칙을 3줄로 기록합니다.
유형 오류·결측·중복·극단값을 표시합니다.
유지·제외·대체 중 처리 방법을 선택합니다.
“무엇을 왜 처리했는가?”를 팀 노트에 남깁니다.
한 화면에 모든 차트를 넣지 않습니다. 알고 싶은 관계를 가장 빠르게 보여주는 차트를 고릅니다.
행 수를 세고, 열 이름을 읽고, 인코딩을 확인한 뒤 Tableau에 연결합니다. 수치가 예상과 다르면 차트를 만들기 전에 원인을 기록합니다.
| 확인 | 무엇을 기록하나 | 통과 기준 |
|---|---|---|
| 구조 | 열 이름·열 수·자료형 | 질문에 필요한 열이 있다 |
| 크기 | 데이터 행 수·파일 크기 | 공식 안내와 숫자가 맞다 |
| 문자 | UTF-8 여부·깨진 글자 | 역명·대여소명이 읽힌다 |
| 품질 | 결측·중복·이상값과 처리 | 처리 규칙을 팀원이 설명한다 |
빈 대시보드에 차트를 채우지 말고, 발표자가 말할 순서를 먼저 스케치합니다. 한 칸에는 하나의 질문과 하나의 근거만 둡니다.
생활 장면과 의사결정자를 한 문장으로 소개합니다.
전체 규모·분포·상위 항목을 한눈에 보여줍니다.
시간·지역·범주를 바꾸어 차이와 관계를 찾습니다.
누가 무엇을 바꾸면 좋은지 근거와 함께 제안합니다.