[통계분석]
1-1. 통계학 개론
1-1-1. 자료의 척도 구분
1-1-2. 기초 확률의 이해
1-1-3. 기초 통계의 이해
2-1. 기초 통계분석
2-1-1. 기초 통계량
2-1-2. 첨도와 왜도
2-1-3. Sumarry 함수 결과의 해석
2-1-4. 추론통계
2-1-5. 표본추출 방법
3-1. 확률분포
3-1-1. 이산 확률분포
3-1-2. 연속 확률분포
3-1-3. 확률분포의 기댓값
4-1. 중심극한정리
5-1. 표본평균분포의 표본분포
6-1. 점추정
7-1. 구간추정
8-1. 가설검정
8-1-1. 가설 검정 R 결과 해석
8-1-2. 모수 검정
8-1-3. 비모수 검정
9-1. 회귀분석
9-1-1. 개념
9-1-2. 회귀계수 추정방법
9-1-3. 회귀모형 평가
9-1-4. 회귀분석 종류
9-1-5. 선형회귀분석의 가정
9-1-6. 다중공선성 문제
9-1-7. 최적의 회귀 방정식 탐색 방법
9-1-8. 회귀분석의 분산분석(ANOVA)표
9-1-9. 회귀 모형의 검정
10-1. 다변량 분석
10-1-1. 상관관계의 유형
10-1-2. 주성분 분석(PCA)
11-1. 시계열 예측
11-1-1. 시계열 분석
11-1-2. 시계열 데이터의 변동 요인
11-1-3. 정상성
11-1-4. 평활화
11-1-5. 백색 잡음
11-1-6. 시계열 모형
[통계분석]
1-1. 통계학 개론
1️⃣ 자료의 척도 구분
🔹 질적 척도
- 명문척도 : 어느 집단에 속하는지 나타내는 자료 (예 : 대학교, 성별 등)
- 순서척도(서열척도) : 서열관계가 존재하는 자료 (예 : 학년, 순위 등)
✔️ 쉽게 외우기
질적 척도는 고위층. '질'을 중시하기에 명문과 서열을 따짐.
고위층은 명문대처럼 특정한 집단을 중시하기에 어느 집단에 속하는지를 나타내는 명문척도를 가지고,
서열관계를 중시하기에 서열관계가 존재하는 서열척도를 가짐
🔹 양적 척도
- 등간척도(구간척도) : 구간 사이 간격이 의미가 있으며 덧셈 뺄셈만 가능 (예 : 온도, 지수 등)
- 비율척도 : 절대적 기준 0이 존재하고 사칙연산이 가능함. 가장 많이 수집되는 자료 (예 : 무게, 나이 등)
✔️ 쉽게 외우기
양적 척도는 서민층. 서민층은 '양'이 많음.
서민층은 특정 '구간'과 '비율'별로 등급을 나눔.
특정한 구간을 적당히 나누어서 서로 간의 등급을 나누기에 등간(구간)척도를 가짐
비율은 등급을 나누기 위한 '절대적 기준'이 필요하고 많은 자료를 더 자세한 연산으로 계산해야 정확하기에 비율척도를 가짐
🚨 각 척도의 구분 확실하게 알아두기
2️⃣ 기초 확률의 이해
🔹 확률
- 통계적 현상의 확실함을 나타내는 척도로 수학적 확률과 통계적 확률로 구분
🔹 확률의 덧셈 정리
- 두 사건 A, B 중 하나 이상 일어날 확률
- P(A ∪ B) = P(A) + P(B) - P(A ∩ B)
🔹 조건부 확률
- 특정 사건 B가 발생했을 때 A가 발생할 확률
- P(A|B) = P(A ∩ B) / P(B) (백신을 맞았을 때 감기에 걸릴 확률)
✔️ 쉽게 이해하기
총 사건의 개수가 10이고, B가 8개이며 A와 B가 동시에 발생할 확률이 3이라고 가정해보자.
3 / 8 = 2.6 이기에 단순히 개수만 파악한다고 하면, A가 2개임을 알 수 있다.
🔹 사건
- 여러 반복된 시행을 통해 결과로서 나타나는 표본공간의 부분 집합
🔹 독립사건
- A, B가 서로 영향을 주지 않는 사건
- P(A|B) = P(A)
- P(A ∩ B) = P(A)P(B)
- 예 : 주사위 A가 3이 나왔을 때, 주사위 B가 3이 나올 확률
🔹 배반사건
- A, B가 서로 동시에 일어나지 않는 사건
- P(A ∩ B) = ∅
- 예 : 동전을 던졌을 때 앞면과 뒷면이 동시에 나올 확률
🔹 표본공간
- 통계적 실험에 의하여 일어날 수 있는 모든 가능한 결과
- 예 : 동전 두 개를 던질 때 표본공간 S = {(앞, 앞), (앞, 뒤), (뒤, 앞), (뒤, 뒤)}
✔️ 쉽게 외우기
A와 B 사건 중 하나 이상 일어날 확률을 구하려면 A 사건과 B 사건을 '더하고' 둘의 교집합을 빼야 하기에 확률의 덧셈 정리가 있음
'특정 조건'에 따른 확률을 계산해야 하기에 조건부 확률이 있음
확률을 계산하기 위해 발생한 모든 결과는 표본공간에 담김
이 표본공간 안에는 사건들이 존재하며 이 사건은 독립사건과 배반사건으로 나뉨
3️⃣ 기초 통계의 이해
🔹 확률변수
- 표본공간의 각 원소에 해당하는 값(확률)을 대응하는 함수
- 예 : 주사위 눈의 수는 1~6까지이며 이는 확률변수 X의 가능한 값
🔹 이산확률분포
- 0, 1, 2, 3 처럼 셀 수 있는 확률변수에 확률이 대응
- 예 : 주사위 눈 X에 대한 확률분포
| X | 1 | 2 | 3 | 4 | 5 | 6 |
| P(X) | 1/6 | 1/6 | 1/6 | 1/6 | 1/6 | 1/6 |
🔹 이항분포
- 연속된 n번의 독립적 시행에서 각 시행 확률 p를 가질 때의 이산확률분포
- 이항분포의 평균 : μ = np
- 이항분포의 분산 : σ² = np(1 - p)
🔹 정규분포
- 자연 현상이나 통계 데이터에서 자주 나타나는 대표적인 연속확률분포
- N(μ, σ²)
🔹 표준정규분포
- 정규분포 중에서도 평균이 0, 표준편차가 1인 특별한 분포
- Z = (X - μ) / σ ~ N(0, 1)
🔹 기댓값
- 장기적으로 기대되는 평균값
- 확률분포의 무게중심
🔹 분산
- 각 값이 평균에서 얼마나 떨어져 있는지를 구한 값
- V(X) = E(X²) - [E(X)]²
✔️ 쉽게 외우기
통계를 내기 위해서는 일단 변수가 필요한데, 이를 확률변수라고 함
또한 변수가 특정 구간 안에 퍼져있는 모양인 분포도 필요하며 이 때 분포는 이산확률분포, 이항분포, 정규분포, 표준정규분포로 나뉨 ➜ 이이(의)정정 으로 암기
마지막으로 확률분포의 무게중심을 잡아주는 기댓값과 각 값이 평균에서 얼마나 떨어져 있는지를 구한 값인 분산이 있음
2-1. 기초 통계분석
1️⃣ 기초 통계량
🔹 중심경향성 측면
- 평균 : 모든 값을 더한 후 데이터 개수로 나눈 값
- 중앙값 : 데이터를 크기 순서로 나열했을 때 중간에 위치한 값
- 최빈값 : 데이터에서 가장 자주 나타나는 값
🔹 분산 정도 측면
- 범위 : 최댓값에서 최솟값을 뺀 값이며, 이상치에 민감함
- 분산 : 각 데이터가 평균과 얼마나 떨어져 있는지 나타내는 지표
- 표준편차 : 분산에 제곱근을 취한 값, 원래 단위와 같이 해석이 용이함
- 사분위수(IQR) : 데이터의 상위 75%와 하위 25%의 중간 범위
- 변동계수(CV) : 표준편차에서 평균을 나눈 백분율, 단위 다른 변수간의 상대적 비교에 유용함
🔹 관계 측면
- 공분산 : 두 확률의 상관정도
➜ 공분산 = 0 : 상관이 전혀 없는 상태
➜ 공분산 > 0 : 양의 상관관계
➜ 공분산 < 0 : 음의 상관관계
※ 공분산은 최소/최대값이 없어 강약 판단이 불가능함
- 상관계수 : 공분산의 단위와 범위 영향을 표준하여 상관정도를 -1 ~ 1 값으로 표현함
➜ 상관계수 = 1 : 정비례 관계
➜ 상관계수 = 0 : 상관없음
➜ 상관계수 = -1 : 반비례 관계
❗ 공분산과 독립성의 관계
➜ 두 변수가 독립이면 공분산은 0이지만, 공분산이 0이라고 두 변수가 독립이라고 할 수는 없음
🚨 기초 통계량 관련 문제는 자주 출제되니 확실히 알아두기
2️⃣ 첨도와 왜도
🔹 첨도
- 자료의 분포가 얼마나 뾰족한 지 나타내는 척도
- 값이 클수록 뾰족한 모양
- 첨도 = 3 ➜ 정규 분포 형태
※ 3을 빼서 0을 기준으로 정규분포 형태를 판단하기도 함

🔹 왜도
- 자료 분포의 비대칭 정도 (0일 때 대칭)
- 왜도 < 0 ➜ 최빈값 > 중앙값 > 평균값
- 왜도 > 0 ➜ 최빈값 < 중앙값 < 평균값

➜ 평균값은 꼬리를 따라감
3️⃣ Sumarry 함수 결과의 해석

➜ Median : 중앙값 / Mean : 평균값
🚨 Sumarry 함수 해석 문제가 시험에 자주 나오므로 확실히 알아두기
4️⃣ 추론통계
🔹 일부 표본의 데이터를 바탕으로 모집단을 추정하거나 가설을 검정하는 통계 기법
🔹 모집단 ➜ 표본추출 ➜ 표본집단 ➜ 모집단 예측(추정, 가설검정)
5️⃣ 표본추출 방법
🔹 랜덤 추출법
- 무작위로 표본 추출
🔹 계통 추출법
- 번호를 부여하여 일정한 간격으로 추출
🔹 집락 추출법 (=군집 추출법)
- 여러 군집으로 나눈 뒤 군집을 선택하여 랜덤 추출
- 군집 내 이질적 특징
- 군집 간 동질적 특징
📝 예시로 이해하기
A, B, C 아파트가 있는데 A 아파트의 주민들만 조사해서 표본을 추출하려고 함
이 때의 전제 조건은 다음과 같음
1. A 아파트만 조사를 해도 B, C 아파트와 비슷한 결과가 나와야 함
2. A 아파트 안에는 다양한 사람들이 존재를 해서 많은 데이터를 얻을 수 있어야 함
💡 즉 A 아파트 안(군집 내)에는 다양한 사람들(이질적)이 있어야 하고
A, B, C 아파트(군집 간)는 다 비슷(동질적)해야 함
🔹 층화 추출법
- 군집 내 동질적 특징
- 군집 간 이질적 특징
- 같은 비율로 추출 시, 비례 층화 추출법
📝 예시로 이해하기
학교에 1, 2, 3 학년이 있는데 각각 1학년은 100명, 2학년은 200명, 3학년은 300명이 있음
그 중에서 총 12명만 뽑아서 표본을 추출하려고 함
좋은 표본을 위해서는 1 / 2 / 3 학년에서 각각 표본을 추출해야 함
💡즉, 같은 학교(군집 내)안의 학생들은 비슷한 특징(동질적)이어야 하고
각 학년 간(군집 간)의 학생들은 다른 특징(이질적)을 가지고 있어야 함
💡 이 때, 1:1:1이 아니라 학년 별 비율을 고려하여 1:2:3의 비율로 표본을 뽑는다고 하면, 이것이 바로 비례 층화 추출법을 말하는 것
🚨 집략 추출법과 층화 추출법의 구분을 확실히 알아두기
🔹 복원, 비복원 추출
- 복원 추출 : 추출되었던 데이터를 다시 포함시켜 표본 추출
- 비복원 추출 : 추출되었던 데이터는 제외하고 표본 추출
3-1. 확률분포
확률 분포의 개별 값들이 가지는 확률 값의 분포
1️⃣ 이산 확률분포
- 값을 셀 수 있는 분포
- 확률질량함수로 표현
🔹 베르누이분포
- 결과가 두 가지 중 한가지로 나타나는 베르누이시행으로 나타나는 분포
- 예 : 동전 던지기, 시험의 합격 / 불합격
🔹 이항분포
- N번의 베르누이시행 중 K번 성공할 확률의 분포
- 예 : 동전을 20번 던져 앞면이 나오는 횟수
🔹 다항분포
- N번 시행에서 각 시행이 여러 개의 결과를 가질 수 있는 확률 분포
- 예 : 주사위를 20번 던져 각 면이 나오는 횟수
🔹 음이항분포
- 성공확률이 p인 베르누이시행을 r번 성공할 때까지 반복 시행한 횟수의 분포
- 기하분포의 일반화
- 예 : 동전을 던져 앞면이 5번 나오기까지 던진 횟수
🔹 기하분포
- 성공확률이 p인 베르누이시행에서 처음으로 성공할 때까지 시행횟수의 분포
- 예 : 동전을 던져 처음으로 앞면이 나오기까지 던진 횟수
🔹 초기하분포
- N개 중 비복원추출로 n번 추출했을 때 원하는 결과가 k번 나올 확률의 분포
- 예 : 10개 구슬 중 4개의 구슬이 당첨 구슬일 때, 4번 뽑았을 때 당첨 구슬을 2번 뽑을 확률
🔹 포아송분포
- 단위 시간 내 발생할 수 있는 사건의 발생 횟수에 대한 분포
- 베르누이시행을 무한히 반복하면 포아송분포
- 예 : 하루동안 발생하는 출생자 수 / 한 시간 동안 사무실에 걸려온 전화의 수
✔️ "누포항하"가 들어가 있으면 이산 확률분포
2️⃣ 연속 확률분포
- 값을 셀 수 없는 분포
- 확률밀도함수로 표현
🔹 균일분포
- 모든 값이 동일한 확률
🔹 정규분포
- 일상생활에서 흔히 보는 확률변수의 평균 분포를 근사한 분포
- 예 : 사람들의 키, IQ 점수, 시험 성적의 분포
🔹 카이제곱분포
- 독립적인 정규분포를 따르는 변수들의 제곱합으로 구성된 분포
- 카이제곱 검정에서 주로 활용
- 예 : 두 집단의 동일성 검정, 단일 집단의 모분산 검정
🔹 t분포
- 정규분포와 유사하지만, 꼬리 부분이 더 두껍고 긴 분포
- T검정에서 주로 활용
- 예 : 표본이 30개보다 작은 집단에 대한 평균 검정
🔹 F분포
- 두 개의 서로 다른 카이제곱 분포의 비율
- F검정에서 주로 활용
- 두 집단의 분산 동질성 검정
🔹 지수분포
- 사건 간 시간 간격 분포
🔹 감마분포
- 지수분포의 일반화
🔹 베타분포
- 두 모수 α, β에 대한 0~1 사이 비율 분포
3️⃣ 확률분포의 기댓값
확률변수 X의 f(x) 확률분포에 대한 기댓값 (E(X))
🔹 이산적 확률변수
- E(X) = ∑ x f(x)
- 셀 수 있기 때문에 다 더해준다.
🔹 연속적 확률변수
- E(X) = ∫ x f(x)
- 셀 수 없기 때문에 무한히 더해준다. (적분 사용의 이유)
📝 예시로 이해하기
(1) 동전을 3개 던지는 확률실험을 할 때, 확률변수 X(앞면F의 개수)의 기댓값은?

(2) 1~12의 숫자가 표시된 원형시계에서, 확률변수 X(시계 바늘이 가르키는 시간)의 기댓값은?
- 전체 확률은 1이 되어야 하니까 1/12

🚨 적분을 활용해서 값을 내야하는 문제는 거의 출제되지 않기에, 적분을 모르는 사람은 이 부분을 넘어가고 다른 부분을 중점적으로 다루는 것을 추천
4-1. 중심극한정리
🔹 임의의 모집단으로부터 추출된 표본분포는 표본크기가 충분히 크면(30개 이상) 정규분포
🔹 모집단의 분포에 상관없이 표본평균분포가 정규분포를 이룸
🚨 중심극한정리는 매우 중요하므로 잘 알아두자
5-1. 표본평균분포의 표본분포

※ μ(뮤) : 모집단의 평균 / σ(시그마) : 모집단의 표준편차 / X̄ : 표본평균 / n : 표본의 크기
6-1. 점추정
모집단이 특정한 값으로 추정하며, 추정량(Estimator)으로 모수를 추정
표본집단을 통해 모집단을 예측하는 것으로, 표본집단의 평균이 추정량이 되고 표본집단의 분산 또는 평균 모수가 된다.
🔹 추정량의 조건
- 불편성(Unbiasedness) : 추정량의 기댓값이 실제 모수와 같음 (편향이 0이 되는 경우)
- 효율성(Efficiency) : 여러 추정량 중 분산이 작은 것이 더 효율적인 추정량
※ 분산이 크다 = 오차가 크다
- 일치성(Consistency) : 표본 크기가 증가할수록 추정량이 모수에 더 가까워짐
- 충족성(Sufficiency) : 추정량이 모집단의 정보를 최대한 반영
✔️ "불효일충" 으로 암기
🔹 대표적인 추정량

7-1. 구간추정
모집단이 특정한 구간으로 추정 (95%, 99%를 가장 많이 사용)
점추정으로 나온 값에 오차 범위를 더하여 구간으로 만들어 추정하는 것을 구간추정이라고

8-1. 가설검정
모집단의 특성에 대한 주장을 가설로 세우고 표본조사로 가설의 채택여부를 판정
🔹 귀무가설(H0) : 일반적으로 생각하는 가설 (차이가 없다)
🔹 대립가설(H1) : 귀무가설을 기각하는 가설, 증명하고자 하는 가설 (차이가 있다, 크다/작다)
🔹 유의수준(α) : 귀무가설이 참일 때 기각하는 1종 오류로 범할 확률의 허용 단계 (일반적 0.05)
🔹 유의확률(p-value) : 귀무가설을 지지하는 정도를 나타내는 확률

🚨 가설검정의 특징에 관한 문제는 자주 출제되니 확실하게 알아두자
1️⃣ 가설 검정 R 결과 해석
🔹 귀무가설 / 대립가설 설정
- '차이가 없다' 혹은 '동일하다' ➜ 귀무가설
🔹 양측 혹은 단측검정 확인
- 대립가설의 값이 '같지 않다' ➜ 양측검정
- 대립가설의 값이 '크다 / 작다' ➜ 단측검정
※ '같지 않다'는 큰 쪽과 작은 쪽 둘 다 검정해야 하기에 양측검정이고, '크다 / 작다'는 둘 중 하나만 검정하면 되기에 단측검정이다.
🔹 일표본 혹은 이표본 확인
- 하나의 모집단 ➜ 일표본
- 두개의 모집단 ➜ 이표본
🔹 귀무가설 기각 혹은 채택
- p-value < 유의수준(α) ➜ 귀무가설 기각
- p-value > 유의수준(α) ➜ 귀무가설 채택
🔹 t검정인 경우
- 모집단에 대한 평균검정 ➜ 단일표본
- 동일 모집단에 대한 평균비교 검정 ➜ 대응표본
- 서로 다른 모집단에 대한 평균비교 검정 ➜ 독립표본
2️⃣ 모수 검정
- 모집단이 특정한 분포(보통 정규분포)를 따른다고 가정하고 수행하는 가설검정

➜ conf.level = 0.95 : 신뢰수준이 95%기에, 유의수준은 0.05
➜ t.test : t검정
➜ alternative hypothesis : 대립가설
➜ p.value = 0.5515 : 0.05까지만 허용인데 이를 넘었으니 귀무가설을 채택함
※ 독립표본 t-검정은 두 집단의 분산이 같다는 가정(등분산 가정)이 전제가 되며, 등분산을 가정하지 않는 경우 Welch의 t-검정을 사용
🚨 결과 해석 문제는 무조건 1문제는 출제가 되니 확실히 알아두자
3️⃣ 비모수 검정
🔹 모집단에 대한 아무런 정보가 없어 관측 자료가 특정 분포를 따른다고 가정 불가 시 검정하는 방식
🔹 두 관측 값의 순위나 차이로 검정
🔹 부호검정, 순위합검정, 맨-휘트니 U 검정, 크루스칼-왈리스 검정, 콜모고로프-스미르노프 검정, 카이제곱 검정
※ 카이제곱 검정은 범주형 변수간의 검정에 주로 활용되며 적합도, 독립성, 동질성 검정에 활용
9-1. 회귀분석
1️⃣ 개념
독립변수와 종속변수간의 관계를 나타내는 분석
➜ Y = WX + β
🔹 독립변수 : 원인을 나타내는 변수 (x)
🔹 종속변수 : 결과를 나타내는 변수 (y)
🔹 잔차(오차) : 계산값과 예측값의 차이
※ 회귀분석은 독립변수와 종속변수간의 상관관계를 분석하는 방법이며, 인과관계를 보장하지 않음
2️⃣ 회귀계수 추정방법
🔹 최소제곱법(=최소자승법) : 잔차의 제곱합(SSE)이 최소가 되는 회귀계수와 절편을 구하는 방법
3️⃣ 회귀모형 평가
🔹 R-square : 총 변동 중에서 회귀모형에 의하여 설명되는 변동이 차지하는 비율 (0 ~ 1)
※ square : 제곱을 의미함
※ 비율이 1에 가까울수록 좋음

4️⃣ 회귀분석 종류
🔹 단순회귀 : 1개의 독립변수와 종속변수의 선형관계
🔹 다중회귀 : 2개 이상의 독립변수와 종속변수의 선형관계
🔹 다항회귀 : 2개 이상의 독립변수와 종속변수가 2차 함수 이상의 관계
🔹 규제항이 포함된 회귀
- 릿지회귀(L2 규제) : L2 규제항을 포함 ➜ Σ W²
- 라쏘회귀(L1 규제) : L1 규제항을 포함 ➜ Σ |W|
- 엘라스틱넷 : L1과 L2를 동시에 규제
🔹 교호항이 포함된 회귀 : 독립변수들의 교호작용이 포함된 회귀 모형
※ 교호작용 : 두 개 이상의 독립변수가 상호작용을 하여 종속변수에 영향을 미치는 경우
5️⃣ 선형회귀분석의 가정
🔹 선형성 : 종속변수와 독립변수는 선형관계
🔹 등분산성 : 오차의 분산이 고르게 분포
🔹 정규성 : 오차가 정규분포의 특성을 지님
🔹 독립성 : 오차가 서로 독랍
6️⃣ 다중공선성 문제
독립변수들간 강한 상관관계가 나타나는 문제
🔹 진단 방법
- 변수간 상관계수 절댓값이 0.8 이상이면 의심
- VIF(분산팽창인수) 값이 10 이상이면 다중공선성이 존재한다고 판단
※ VIF = 1 / (1 - R²)
※ R-Square 값이 1에 가까울수록 좋지만, 너무 완벽해도 문제가 있다고 판단함
- 조건수가 30 이상이면 의심
🔹 해결방안
- 독립변수 제거
- 차원 축소
- 변수 선택
- 규제항이 포함된 회귀
🚨 회귀분석에서 가장 중요한 문제이므로 잘 알아두기
7️⃣ 최적의 회귀 방정식 탐색 방법 (= 변수 선택)
🔹 전진선택법 : 변수를 하나씩 추가하면서 최적의 회귀방정식을 찾아내는 방법
🔹 후진제거법 : 변수를 하나씩 제거하면서 최적의 회귀방정식을 찾아내는 방법
🔹 단계별 선택법 : 전진선택법 + 후진제거법으로 변수를 추가할 때 벌점을 고려
- AIC(아카이케 정보 기준) : 편향과 분산이 최적화 되는 지점 탐색, 자료가 많을수록 부정확
- BIC(베이즈 정보 기준) : AIC를 보완했지만 AIC보다 큰 패널티를 가짐
- Mallow's Cp : SSE(잔차 제곱합)을 활용한 판단
※ AIC와 BIC 모두 작을수록 좋음
8️⃣ 회귀분석의 분산분석(ANOVA)표

🔹 ANOVA 검정 : 3개 이상의 그룹의 평균을 비교하는 검정
🔹 회귀모형의 유의성 분석 시 활용
🔹 전체 데이터 수 = 자유도 + 1
🔹 결정계수(R-Square) = SSR/SST
🔹 수정된 결정계수 = 1 - (n - 1)(MSE/SST)
※ 다중 회귀에서는 수정된 R-Square 값을 일반적으로 사용함
🚨 표에 빈 칸을 만들고, 빈 칸에 해당하는 값을 채우는 문제가 나옴
9️⃣ 회귀 모형의 검정
🔹 독립변수와 종속변수 설정 (X, Y 설정)
🔹 회귀계수 값의 추정
🔹 모형이 통계적으로 유의미한지
- 모형에 대한 F 통제량(F 검정), p_value
- 귀무가설 : 모든 회귀계수는 0이다.
➜ 모든 회귀계수가 0이면 모델이 유의미하지 않음 즉, 귀무가설을 기각해야 하는 것이 목적
➜ p-value < 유의수준(α)
🔹 회귀계수들이 유의미한지
- 회귀계수들의 t통계량(t 검정), p_value
- 각각의 회귀계수에 대한 귀무가설 : 회귀계수는 0이다.
➜ 귀무가설을 기각시키는 것이 목적
🔹모형이 설명력을 갖는가
- 결정계수(R-Square) 값
🔟 회귀 모형의 검정결과 해석

➜ lm : 선형회귀분석
➜ F-statistic(F 검정) 에서 p_value 확인 가능
➜ 자유도 : DF(Degree of Freedom) 값 확인하면 2+9 = 12
➜ Estimate : 회귀식
➜ Intercept : 절편
➜ 회귀의 자유도 = 2 / 잔차의 자유도 = 9
10-1. 다변량 분석
1️⃣ 상관관계의 유형
두 변수간의 선형적 관계가 존재하는지 파악하는 분석
🔹 피어슨 상관분석
- 양적 척도
- 연속형 변수
- 선형관계 크기 측정
🔹 스피어만 상관분석
- 서열 척도
- 순서형 변수
- 선형 / 비선형적 관계 나타냄
- 순서만 가릴 수 있으면 상관관계를 분석할 수 있음

※ 상관계수는 값은 -1 ~ 1
2️⃣ 주성분 분석 (PCA)
- 상관성 높은 변수들의 선형 결합으로 차원을 축소하여 새로운 변수를 생성
➜ 여러 산개한 점들을 기준을 잡아 하나의 직선으로 연결하여 차원을 축소함
- 자료의 분산이 가장 큰 축이 첫 번째 주성분(고유값 고려)
- 두번째 주성분은 첫 번째 주성분과 직교하면서 다음으로 분산이 큰 방향
➜ 직교 = 독립적
- 70 ~ 90%의 설명력을 갖는 수를 측정
- 차원을 축소시키는 대표적인 방법 중 하나
🔹 주성분 분석의 결과 해석

➜ Standard deviation : 표준변차
➜ Proportion of Variance : 분산의 비율 (전체 대비 몇 퍼센트를 사용하고 있는지)
➜ Cumulative Proportion : 누적 비율
➜ 원래는 7차원(7개의 성분)이었는데 PC2(2차원)까지 축소하면 0.8078퍼까지 설명 가능하다는 것을 알 수 있음
※ 보통 80% 정도면 많이 설명한다고 봄
🚨 결과 해석 방법 시험에 잘 나오니 꼭 숙지하기
🔹 스크리플룻(Screeplot)
- 주성분의 개수를 선택하는데 도움이 되는 그래프 (x축 주성분 개수, y축 분산변화)
- 수평을 이루기 바로 전 단계 개수로 선택
- 차원을 축소하는 데 도움이 됨

➜ 기울기가 완만해지는 지점부터는 설명력(Variances, 분산)이 좋아지는 정도가 낮아짐
🔹 다차원 척도법 (MDS : Multi-Dimensional Scaling)
- 데이터 간 거리 정보의 근접성을 보존하는 방식으로 차원을 축소하여 시각화 하는 방식
- 특징 : 데이터 축소 목적, Stress 값이 0에 가까울 수록 좋음, 글로벌 최적점 도달 어려움
- 종류 : 계량적 MDS (양적척도 활용) / 비계량적 MDS (순서척도 활용)
11-1. 시계열 예측
1️⃣ 시계열 분석
시간의 흐름에 따라 관찰된 자료의 특성을 파악하여 미래를 예측 (주가데이터, 기온데이터)
2️⃣ 시계열 데이터의 변동 요인
- 추세 요인 : 장기적으로 증가, 감소하는 추세
- 계절 요인 : 계절과 같이 고정된 주기에 따라 변화
- 순환 요인 : 알려지지 않은 주기를 갖고 변화 (경제 전반, 특정 산업)
- 불규칙 요인 : 위 3가지로 설명이 불가능한 요인
✔️ "추운 계절의 순환이 불규칙하다." 로 암기
3️⃣ 정상성
시계열 예측을 위해서는 모든 시점에 일정한 평균과 분산을 가지는 정상성을 만족해야 함
🔹 정상시계열로 변환 방
- 차분 : 현 시점의 자료를 이전 값으로 빼서 평균을 일정하게 만드는 방법
- 변환 : 로그변환, 제곱근변환, Box-Cox 변환 등으로 분산을 안정화
🚨 정상성은 시험에 잘 나오는 부분이니 제대로 숙지하기
4️⃣ 평활화
- 이동평균볍 : 일정 기간의 평균
- 지수평활법 : 최근 시간 데이터에 가중치를 부여
5️⃣ 백색 잡음
- 시계열 모형의 오차항을 의미 (평균 및 분산 일정, 자기상관 없음, 정상성 만족)
- 평균이 0이면 가우시안 백색잡음
6️⃣ 시계열 모형
🔹 자기회귀(AR) 모형
- 자기 자신의 과거 값이 미래를 결정하는 모형
- 부분자기상관함수(PACF)를 활용하여 p+1 시점부터 급격 감소하면 AR(p) 모형 선정
🔹 이동평균(MA) 모형
- 이전 백색잡음들의 선형결합으로 표현되는 모형
- 자기상관함수(ACF)를 활용하여 q+1 시점부터 급격히 감소하면 MA(q) 모형 선정
🔹 자기회귀누적이동평균(ARIMA) 모형
- AR 모형과 MA 모형의 결합
- ARIMA(p, d, q)
➜ p와 q는 AR 모형과 MA 모형이 관련 있는 차수
➜ d 는 정상화시에 차분을 몇 번 했는지를 의미함
➜ d = 0 : ARIMA 모델 / p = 0 : IMA 모델 / q = 0 : ARI 모델
※ 계절성이 있는 경우 SARIMA 사용을 고려
🚨 시계열 모형은 시험에 잘 나오는 부분이니 제대로 숙지하기
🔗 출처
[SQLD 완벽 요약강의]
'자격증 > SQLD' 카테고리의 다른 글
| [SQLD][아이리포]01. 데이터모델링 | 데이터 모델의 이해 (0) | 2026.06.14 |
|---|---|
| [SQLD][아답터] 3과목 - 3. 정형 데이터 마이닝 (0) | 2026.05.24 |
| [SQLD][아답터] 3과목 - 1. R 기초와 데이터 마트 (0) | 2026.05.10 |
| [SQLD][아답터] 2과목 - 3. 관리 구문 (2) | 2026.04.24 |
| [SQLD][아답터] 2과목 - 2. SQL 활용 (6) | 2026.04.15 |