1. 데이터 분석 기법의 이해
데이터 처리(정제/결합) → 시각화/EDA → 통계/모델링 → 데이터마이닝(예측/규칙/군집)
1-1. 데이터 처리: 분석의 80%는 여기서 끝난다
분석을 하려면 일단 분석용 데이터가 필요, 대부분 DW/DM를 중심으로 데이터가 돌아감
- DW(Data Warehouse): 회사 데이터의 “큰 창고”
- DM(Data Mart): 특정 목적(영업/마케팅/재무 등)에 맞춘 “소형 창고”
✅ DW에 없는 신규 데이터는 어디서 가져오나?
- 운영시스템(Legacy)에서 직접 가져오거나
- ODS(운영데이터저장소)에서 정제된 데이터를 가져와 DW/DM 데이터와 결합합니다.
실무 베스트: ODS에서 전처리 → DW/DM과 결합
✅ 최종 데이터 구조로 가공할 때 하는 일
- 데이터 마이닝을 위한 분류/라벨링
- 정형화된 패턴 처리(정리된 형태로 변환)
1-2. 시각화
시각화는 겉으로는 쉬워 보이지만, 잘 쓰면 복잡한 모델보다 설득력이 좋음
- 대용량 데이터 탐색(EDA 전 단계)에서 필수
- 이상치/패턴/추세를 빠르게 발견
- SNA(소셜 네트워크 분석)에서도 자주 활용
1-3. 공간분석
공간분석은 쉽게 말해 위치(공간) 정보를 시각화해서 의미를 찾는 분석
- 지도 위에 속성값을 올리고
- 크기/모양/선 굵기/색 등으로 차이를 표현
- 매장/물류/상권/재난/모빌리티 데이터에서 특히 강력
1-4. 탐색적 자료분석(EDA)
EDA는 이 조합 저 조합 해보면서 이상치와 의미 있는 사실을 찾아 분석 목적을 구체화해 가는 과정
✅ EDA의 대표 4가지 주제
- 저항성 강조: 이상치에 흔들리지 않는 관점(견고하게 보기)
- 잔차 계산: 기대값 대비 얼마나 벗어나는지 보기
- 변수 재표현: 로그/스케일 변환 등으로 패턴을 더 잘 보이게 만들기
- 그래프 현시성: 수치보다 그래프가 “진짜”를 말해주는 순간이 많음
1-5. 통계분석
통계는 숫자와 표, 그림으로 현상을 구조화해서 보여주는 것.
- 기술통계: 표본 데이터를 쉽게 요약(평균/중앙값/분산 등)
- 추측통계: 표본 통계량으로 모집단의 특성을 추론(가설검정/추정 등)
1-6. 데이터 마이닝
데이터 마이닝은 대용량 데이터에서 관계/패턴/규칙을 찾아 모형화하고 예측하는 방법
✅ 대표 방법론 3축
- DB 기반(사전분석)
- DW→DM 만들면서 속성들을 훑어보며 인사이트 발굴
- 기계학습
- 인공신경망, 의사결정나무, 클러스터링, SVM, 베이지안 분류
- 패턴인식
- 연관규칙, 장바구니 분석(같이 사는 조합 찾기)
2. R 소개
R은 통계/데이터마이닝/그래프에 특화된 오픈소스 언어
✅ R의 특징(실무 관점 요약)
- 오픈소스(무료, 생태계 큼)
- 그래프/시각화 강력
- 윈도우/맥/리눅스 모두 가능
- S 언어 기반의 표준 플랫폼 성격
- 객체지향 + 함수형(함수 만들어 자동화하기 좋음)
RStudio & Rattle
- RStudio: 코딩 부담은 있지만, 익숙해지면 자동화에 매우 유리
- Rattle: GUI가 패키지와 결합되어 있어 정해진 기능만 쓰는 형태(자유도 제한)
3. R 기초
3-1. 패키지: R의 기능은 패키지로 확장된다
- 패키지 = R 함수 + 데이터 + 컴파일 코드 묶음
install.packages("패키지명") # 자동 설치
install.packages("패키지명", "경로") # 수동 설치(로컬 파일 등)
3-2. 스크립트 사용(실무 단축키)
- 한 줄 실행: Ctrl + R
- 여러 줄 실행: 드래그 후 Ctrl + R
- 주석: #
3-3. 배치 실행
- 매일/매주 반복 실행되는 분석을 시스템에서 자동 구동하는 방식
R CMD BATCH batch.R
- Path 설정: 내 컴퓨터 → 속성 → 고급 시스템 설정 → 환경변수 → Path에 R 실행파일 경로 추가
3-4. 변수 다루기
- 변수명만 선언하고 값을 할당하면 자료형태를 스스로 인식하고 선언
- 출력은 print()도 되지만, 변수명만 써도 출력됨
- 대입 연산자는 여러 개지만 <- 추천
a <- 3
a
- 메모리 변수 확인: ls()
- 삭제: rm()
3-5. 기본 통계량
- 평균: mean()
- 중앙값: median()
- 표준편차: sd()
- 분산: var()
- 공분산: cov()
- 상관계수: cor()
3-6. 함수 생성
my_fun <- function(x, y) {
z <- x + y
return(z)
}
- {}: 표현식이 여러 줄일 때 범위 지정
- 구성: 변수할당 + 조건문(if) + 반복문(for/while/repeat) + return
3-7. 연산자 우선순위
- 인덱스: [ ], [[ ]]
- 요소 접근: $
- 지수: ^
- 수열: :
- 곱/나눗셈: *, /
- 더하기/빼기: +, -
- 비교: ==, !=, <=, >=
- 논리: !, &, |
- 대입: <- (추천), = (가능)
- 도움말: ?lm
'Study Log > ADP' 카테고리의 다른 글
| [ADP 필기 요약]_4과목 데이터 분석_③ (0) | 2026.03.03 |
|---|---|
| [ADP 필기 요약]_4과목 데이터 분석_② (0) | 2026.03.02 |
| [ADP 필기 요약]_3과목 데이터 분석 기획_③ (0) | 2026.02.23 |
| [ADP 필기 요약]_3과목 데이터 분석 기획_② (0) | 2026.02.20 |
| [ADP 필기 요약]_3과목 데이터 분석 기획_① (0) | 2026.02.19 |