본문 바로가기
Study Log/ADP

[ADP 필기 요약]_4과목 데이터 분석_①

by Maker_Potato 2026. 2. 26.

 

1. 데이터 분석 기법의 이해

데이터 처리(정제/결합) → 시각화/EDA → 통계/모델링 → 데이터마이닝(예측/규칙/군집)


1-1. 데이터 처리: 분석의 80%는 여기서 끝난다

분석을 하려면 일단 분석용 데이터가 필요, 대부분 DW/DM를 중심으로 데이터가 돌아감

  • DW(Data Warehouse): 회사 데이터의 “큰 창고”
  • DM(Data Mart): 특정 목적(영업/마케팅/재무 등)에 맞춘 “소형 창고”

DW에 없는 신규 데이터는 어디서 가져오나?

  • 운영시스템(Legacy)에서 직접 가져오거나
  • ODS(운영데이터저장소)에서 정제된 데이터를 가져와 DW/DM 데이터와 결합합니다.

실무 베스트: ODS에서 전처리 → DW/DM과 결합

 

최종 데이터 구조로 가공할 때 하는 일

  • 데이터 마이닝을 위한 분류/라벨링
  • 정형화된 패턴 처리(정리된 형태로 변환)

1-2. 시각화

시각화는 겉으로는 쉬워 보이지만, 잘 쓰면 복잡한 모델보다 설득력이 좋음

  • 대용량 데이터 탐색(EDA 전 단계)에서 필수
  • 이상치/패턴/추세를 빠르게 발견
  • SNA(소셜 네트워크 분석)에서도 자주 활용

1-3. 공간분석

공간분석은 쉽게 말해 위치(공간) 정보를 시각화해서 의미를 찾는 분석

  • 지도 위에 속성값을 올리고
  • 크기/모양/선 굵기/색 등으로 차이를 표현
  • 매장/물류/상권/재난/모빌리티 데이터에서 특히 강력

1-4. 탐색적 자료분석(EDA)

EDA는 이 조합 저 조합 해보면서 이상치와 의미 있는 사실을 찾아 분석 목적을 구체화해 가는 과정

 

EDA의 대표 4가지 주제

  • 저항성 강조: 이상치에 흔들리지 않는 관점(견고하게 보기)
  • 잔차 계산: 기대값 대비 얼마나 벗어나는지 보기
  • 변수 재표현: 로그/스케일 변환 등으로 패턴을 더 잘 보이게 만들기
  • 그래프 현시성: 수치보다 그래프가 “진짜”를 말해주는 순간이 많음

1-5. 통계분석

통계는 숫자와 표, 그림으로 현상을 구조화해서 보여주는 것.

  • 기술통계: 표본 데이터를 쉽게 요약(평균/중앙값/분산 등)
  • 추측통계: 표본 통계량으로 모집단의 특성을 추론(가설검정/추정 등)

1-6. 데이터 마이닝

데이터 마이닝은 대용량 데이터에서 관계/패턴/규칙을 찾아 모형화하고 예측하는 방법

 

대표 방법론 3축

  1. DB 기반(사전분석)
    • DW→DM 만들면서 속성들을 훑어보며 인사이트 발굴
  2. 기계학습
    • 인공신경망, 의사결정나무, 클러스터링, SVM, 베이지안 분류
  3. 패턴인식
    • 연관규칙, 장바구니 분석(같이 사는 조합 찾기)

2. R 소개

R은 통계/데이터마이닝/그래프에 특화된 오픈소스 언어

 

R의 특징(실무 관점 요약)

  • 오픈소스(무료, 생태계 큼)
  • 그래프/시각화 강력
  • 윈도우/맥/리눅스 모두 가능
  • S 언어 기반의 표준 플랫폼 성격
  • 객체지향 + 함수형(함수 만들어 자동화하기 좋음)

RStudio & Rattle

  • RStudio: 코딩 부담은 있지만, 익숙해지면 자동화에 매우 유리
  • Rattle: GUI가 패키지와 결합되어 있어 정해진 기능만 쓰는 형태(자유도 제한)

3. R 기초

3-1. 패키지: R의 기능은 패키지로 확장된다

  • 패키지 = R 함수 + 데이터 + 컴파일 코드 묶음
install.packages("패키지명")     # 자동 설치
install.packages("패키지명", "경로")  # 수동 설치(로컬 파일 등)
 
 

3-2. 스크립트 사용(실무 단축키)

  • 한 줄 실행: Ctrl + R
  • 여러 줄 실행: 드래그 후 Ctrl + R
  • 주석: #

3-3. 배치 실행

  • 매일/매주 반복 실행되는 분석을 시스템에서 자동 구동하는 방식
R CMD BATCH batch.R
 
  • Path 설정: 내 컴퓨터 → 속성 → 고급 시스템 설정 → 환경변수 → Path에 R 실행파일 경로 추가

3-4. 변수 다루기

  • 변수명만 선언하고 값을 할당하면 자료형태를 스스로 인식하고 선언 
  • 출력은 print()도 되지만, 변수명만 써도 출력됨
  • 대입 연산자는 여러 개지만  <- 추천
a <- 3
a
  • 메모리 변수 확인: ls()
  • 삭제: rm()

3-5. 기본 통계량

  • 평균: mean()
  • 중앙값: median()
  • 표준편차: sd()
  • 분산: var()
  • 공분산: cov()
  • 상관계수: cor()

3-6. 함수 생성

my_fun <- function(x, y) {
  z <- x + y
  return(z)
}
  • {}: 표현식이 여러 줄일 때 범위 지정
  • 구성: 변수할당 + 조건문(if) + 반복문(for/while/repeat) + return

3-7. 연산자 우선순위

  • 인덱스: [ ], [[ ]]
  • 요소 접근: $
  • 지수: ^
  • 수열: :
  • 곱/나눗셈: *, /
  • 더하기/빼기: +, -
  • 비교: ==, !=, <=, >=
  • 논리: !, &, |
  • 대입: <- (추천), = (가능)
  • 도움말: ?lm