🏠 홈

🧮 빅분기 필기 수식 정리

요약정리 PDF 기반 · 계산·공식형 문제 대비 치트시트

🔴 매회 ⭐ 자주 🟡 가끔 🟢 개념정리
🔴 매회 출제 계산 필수

Z-score 정규화 표준화

Z = (현재 값 - 평균) / 표준편차
💡 평균 0, 표준편차 1로 변환. 이상치 영향 상대적으로 적음.

최소-최대 정규화 Min-Max Scaling

X' = (현재값 - 최소값) / (최대값 - 최소값)
💡 0~1 사이 값으로 변환. 이상치에 민감함(최대·최소가 왜곡되면 전체가 틀어짐).

연관분석 3대 지표 지지도 / 신뢰도 / 향상도

지지도(A→B) = A와 B를 동시에 포함하는 거래 수 / 전체 거래 수 신뢰도(A→B) = A와 B를 동시에 포함하는 거래 수 / A를 포함하는 거래 수 향상도(A→B) = 신뢰도(A→B) / B의 지지도 향상도 = 1 → 우연 / >1 → 양의 상관 / <1 → 음의 상관

혼동행렬 평가지표 Confusion Matrix

정밀도(Precision) = TP / (TP+FP) 재현율(Recall,민감도) = TP / (TP+FN) 특이도(Specificity) = TN / (TN+FP) F1-Score = 2 × (정밀도×재현율) / (정밀도+재현율) 정밀도와 재현율은 Trade-off 관계
💡 ROC 커브: 가로축 1-특이도(FP Rate), 세로축 민감도. 면적(AUC) 1에 가까울수록 우수.

결정계수 R-square, 회귀모형 설명력

R² = 1 - (잔차 제곱합 / 전체 제곱합) 0~1 사이 값, 1에 가까울수록 설명력 높음
⭐ 자주 출제

모평균 신뢰구간 Z-검정 / t-검정

(1) 모분산을 아는 경우 (Z-검정) X̄ - Z(α/2)·σ/√n ≤ μ ≤ X̄ + Z(α/2)·σ/√n 신뢰수준 95% : Z(α/2) = 1.960 / 99% : Z(α/2) = 2.576 (2) 모분산을 모르는 경우 (t-검정, 자유도 n-1) X̄ - t(α/2,n-1)·S/√n ≤ μ ≤ X̄ + t(α/2,n-1)·S/√n S = 표본표준편차
💡 Z-검정은 모표준편차를 알 때만 사용. 모르면 무조건 t-검정.

가설검정 풀이 순서

1. 귀무가설 / 대립가설 설정 2. 양측 · 단측검정 확인 ('같지 않다'→양측 / '크다·작다'→단측) 3. 일표본 · 이표본 확인 (모집단 1개 or 2개 이상) 4. 검정통계량 계산과 기각역 판단 5. t검정인 경우 → 단일 / 대응 / 독립표본 확인

이항분포 확률 Binomial Distribution

P(X=k) = nCk × p^k × (1-p)^(n-k) n=시행횟수, k=성공횟수, p=성공확률

군집분석 거리 공식

유클리디안 = √( Σ(xi - yi)² ) 직선 거리 맨하튼 = Σ| xi - yi | 계단식(절댓값 합) 체비셰프 = max( | xi - yi | ) 절댓값 중 최댓값

오즈 · 로짓 변환 로지스틱 회귀

오즈(Odds) = 성공확률 / (1 - 성공확률) 로짓(logit) = ln(오즈) = 자연로그를 취해 선형처럼 변환

ARIMA(p, d, q)

p = AR(자기회귀) 차수 d = 차분 횟수 q = MA(이동평균) 차수
🟡 가끔 출제

확률분포 총정리

분류분포핵심 키워드
이산(PMF)베르누이1회 성공/실패
이항분포성공/실패 n번 반복
기하분포처음 성공까지 시도 횟수
다항분포여러 범주 결과
포아송분포단위 시간/공간 내 사건 수(λ)
연속(PDF)정규분포종모양·대칭, Z-검정
t-분포표본 적을 때, t-검정
카이제곱분포범주형, 독립성/적합도 검정
F-분포분산 비교, F-검정
지수분포사건 간 시간, 생존분석
💡 외우기: 베포항향하 / 지수,카이,FT정규 콘서트

경사하강법 옵티마이저 비교

옵티마이저핵심 원리
SGD(확률적 경사하강법)기울기 가장 작은 지점으로 이동
모멘텀관성 적용, SGD+속도 → 빠른 수렴
AdaGrad기울기 크기에 따라 학습률 조정(처음 크게→작게)
Adam모멘텀 + AdaGrad, 좌우 흔들림 최소

정규화(Normalization) vs 표준화(Standardization)

구분공식결과 범위
최소-최대 정규화(X-min)/(max-min)0~1
Z-score 표준화(X-평균)/표준편차평균0, 표준편차1
🟢 헷갈리기 쉬운 개념 정리

PCA vs 요인분석

구분주성분분석(PCA)요인분석(Factor)
목적데이터 요약, 차원 축소숨겨진 요인 찾기, 원인 해석
수학 기반단순 수학 변환(직교변환)통계 모형 기반(공분산·상관계수)
정규분포 가정반드시 가정하지 않음기술통계 기반

1종 오류 vs 2종 오류

구분내용비유
1종 오류귀무가설이 참인데 기각(판매자 오류)정상인데 반품 당함
2종 오류귀무가설이 거짓인데 채택(소비자 오류)불량인데 정상인 줄 앎

교차검증 4종 비교

기법방식
홀드아웃훈련용·평가용 단순 분리
K-foldk개 집단 중 k-1개 학습, 1개 평가 (반복)
LOOCV1개 데이터만 평가, 나머지 전부 학습
붓스트랩복원추출, 데이터 부족·불균형 해소

배깅 vs 부스팅

구분배깅부스팅
학습 방식병렬(붓스트랩+보팅)순차(오답에 집중)
이상치강함민감
대표 예랜덤포레스트AdaBoost, GBM, XGBoost

라쏘(L1) vs 릿지(L2)

구분라쏘(L1)릿지(L2)
거리 기준맨하탄(절댓값)유클리드(제곱)
효과변수 일부 완전 제거변수 영향 0에 가깝게 축소
빅분기 필기 요약정리 PDF 기반 · 실기 아닌 필기 대비용