카테고리 없음

20250704_통계학 라이브 강의 정리 (2-1)

elya0919 2025. 7. 4. 21:51

추정

 

학습 목표

신뢰구간이 무엇인가 !? 왜 사용하는가 !?

 

복습

 

베이즈정리 

사전 확률

우도

사후 확률

 

추정

 

추정이 무엇인가 ?

-> 표본을 통해 대신 계산하는 것 !

 

추정의 2가지 관점

 

그 추정은 2가지 관점으로 나뉘는데 

빈도주의 : 반복했을 때 평균이 어떨지 

- 표본이 많을 때

- 정규분포 가정 성립

- 가설검정 필요

- 명확한 검정 결과 필요한 경우

 

베이지안 : 주어진 정보로 얼마나 확신할 수 있는지

- 표본이 적을 때

- 사전 지식(도메인) 활용 가능할 때

- 실시간 업데이트가 필요한 경우

- 확률로 직관적 해석 필요한 경우

 

베이지안 -> 베이즈정리 기반 -> 후에 다룰 예정 !! 

 

모집단의 특성 -> 모수 

 

모집단과 정규분포

 

표본오차

우리가 측정한 값과 실제 값의 차이

 

큰수의 법칙

 

모수는 무엇인가 ?

 

모수 추정하기 

-> 표본을 통해 모수를 추정한다.

-> 최대우도추정 (모수값 찾는 과정)

 

신뢰구간 ?
-> 모수가 이 정도 범위 안에 있을 것이다. (구간추정) 표본오차가 너무 크지 않을 확률

 

점추정

-> 하나의 숫자로 모수 추정 -> ex 모집단 평균은 약 65

 

구간추정 

-> 신뢰 가능한 범위를 제시 -> 모집단의 평균 62~68 사이 

 

표본오차의 정규분포

표본오차의 약 95%

이것이 약 95% 신뢰구간 ?

 

신뢰구간 어떻게 해석 ?

모수가 실제로 포함될 것으로 추정되는 범위

95% 신뢰구간 -> 반복해서 표본을 추출하고 신뢰구간을 만들면 그중 95%가 평균을 포함하게 될 것이다.

 

모집단 평균 뮤는 고정된 값이고 확률적으로 바뀌는 건 표본 평균

우리가 만든 신뢰구간 하나는 뮤를 포함하거나 포함하지 않거나 둘 중 하나

 

즉, 95% 신뢰구간이란 내가 만든 신뢰구간이 모집단 평균 뮤를 포함할 가능성

 

Z-분포 기반 신뢰구간
Z-분포 = 평균이 0이고 표준편차가 1인 정규분포
모집단의 표준편차 시그마를 알고 있을 때, 표본평균이 얼마나 떨어져 있는지 (상대적인 위치) Z값으로 계산 가능

 

z값을 쓰는 이유 

공정한 비교

 

하지만 대부분 모집단의 표준편차 시그마를 모르기 때문에 표본에서 계산한 표준편차s로 대신한다 !

*s의 불확실성 반영해야함

 

그래서 사용하는 T분포

정규분포를 카이제곱 분포로 나눈 값 = T 분포 = 이 개념은 너무 딥함

 

어쨌든 이것도 표본이 적을 때 사용

 

자유도 라는 개념 존재

 

 

여기까지 배운 내용의 Key Point

신뢰구간은 표본에서 구한 값이 모집단의 진짜 값과 얼마나 가까울지 예측하는 도구 !
95% 신뢰구간은 동일한 방식으로 표본을 반복 추출하면 95% 구간이 진짜 값을 포함하게 될 것이라는 뜻 !

 

예제 풀어보기 

A는 1000명 15%

B는 1000명 18%

 

신뢰구간

(A-B) +- 1.96 x 표준오차(0.0166)

 

0.03 +- 0.0325

 

3% +- 3.25%

 

-0.25% ~  < 신뢰구간 < + 6.25%

 

여기서 1.96 = 신뢰 95% "고정 값"