눈 위에 발자국
article thumbnail
7. 가설검정 (3) 제1종 오류와 제2종 오류
통계 2023. 11. 30. 20:48

1️⃣ 제1종 오류와 제2종 오류 테스트를 진행할 때 두 가지 타입의 오류를 만들 수 있다. 제1종 오류(Type Ⅰ Error) • 평균값 비교를 예로 설명하자면, 실제로는 아무런 차이가 없음에도 차이가 있다고 잘못 판단해버리는 것 • 그러나 우리는 진실(모집단)을 직접 알 수 없음. → 해석의 결과가 제1종 오류를 범했는지 아닌지는 모름 • 대신 p값과 유의수준 \(\alpha\)를 이용하여 제1종 오류가 일어날 확률을 통제할 수 있음 제2종 오류(Type Ⅱ Error) • 차이가 있는데도 차이가 있다고 말할 수 없어 귀무가설을 기각하지 않는 판단을 내려버리는 것 검정력(power of test) • \(1-\beta\) • 제2종 오류가 잃어나지 않는 확률 • 정말로 차이가 있을 때 차이가 있다고..

article thumbnail
7. 가설검정 (2) 기각역과 p-value
통계 2023. 11. 30. 20:17

1️⃣ 기각역(rejection region) • 귀무가설이 기각되고 대립가설을 채택하는 영역 • 채택한다 ➡ 대안이 가져온 변화나 혁신을 뒷받침할 데이터가 충분하지 않다는 것을 의미 • 기각한다 ➡ 귀무가설이 참을 나타내지 않는다는 통계적 증거가 충분하다는 것을 의미 유의수준 \(\alpha\) (Level of significance) • 참인 귀무가설을 기각할 확률. 즉 이 오류를 만들 확률 • 주로 사용하는 유의수준 : 0.1, 0.05, 0.001 종류 양측검정(Two-sided/tailed test) • 양수와 음수 양쪽을 모두 고려하는 가설검정 방법 • 귀무가설이 =이나 !=을 포함할 때 사용 ex. 0.5%의 유의수준이라면 양 끝단에서 각 0.025만큼의 경계를 잡음 단측검정(One-sid..

article thumbnail
7. 가설검정 (1) 귀무가설과 대립가설
통계 2023. 11. 23. 21:00

1️⃣ 데이터드리븐 의사결정을 위한 절차 1. 가설 생성 (Formulate a hypothesis) 2. 바른 테스트 방법 찾기 (Find the right test) 3. 테스트 실행 (Execute the test) 4. 의사결정 내리기 (Make a decision) 2️⃣ 가설검정(hypothesis testing) 가설 테스트 될 수 있는 아이디어 추가 조사를 할 수 있는 제한된 증거물을 기반으로 추정되거나 제안되는 설명 가설검정 분석자가 세운 가설을 검증하기 위한 방법 p값(p-value)를 사용하여 가설 지지 여부를 판단함 가설 검증하기 확증적 자료분석(가설검증형 데이터 분석) : 미리 세운 가설을 검증하는 접근법 탐색적 자료분석 : 가설을 미리 세우지 않고 전체 데이터를 탐색적으로 해석하..

article thumbnail
6. 추정량과 추정값 (3) 신뢰구간 공식 모음 (모집단 1, 2개일 때/종속, 독립일 때)
통계 2023. 11. 16. 16:35

1️⃣ 모집단이 두 개일 경우 종속 집단(Dependent) 처리 전과 후의 상황을 다룰 때 원인과 결과를 다룰 때 ex. 시약 투여를 하기 전과 한 후 두 집단, 부부나 가족을 조사할 때 테스트 방법 : 종속표본의 신뢰구간, 회귀와 같은 통계적 기법 독립 집단 (Independent) 서로 영향을 미치지 않는 집단을 다룰 때 세 가지 상황으로 나눌 수 있음 • 모분산을 알 때 • 모분산을 모르지만 같다고 추측될 때 • 모분산을 모르지만 다르다고 추측될 때 2️⃣ 신뢰구간 공식 모음 # 모집단 모평균 표본 통계량 분산 공식 1 앎 - z \(\sigma^2\) \(\bar{x}\pm z_{\alpha \over{2}}{\sigma\over{\sqrt{n}}}\) 1 모름 - t \(s^2\) \(\bar..

article thumbnail
6. 추정량과 추정값 (2) 신뢰수준과 신뢰구간
통계 2023. 11. 8. 22:43

1️⃣ 신뢰수준(confidence level) 신뢰수준 = \(1-\alpha\) (\(0\le\alpha\le1)\) ex. 95%의 신뢰수준을 가지고 있다면? \(\alpha=5\%\) 2️⃣ 신뢰구간(confidence interval) 모수가 있을 것이라 기대되는 구간 ex. 95%의 신뢰수준이다. -> 추정값이 95% 구간 안에 존재할 것이다. 신뢰구간 [point estimate - relibility factor * standard error, point estimate + reliabiltiy factor * standard error] 이때 ME(Margin of Error) = \(reliability\ factor\ *\ {standard\ deviation}\over{\sqrt{s..

article thumbnail
6. 추정량과 추정값 (1) 추정량(estimator)와 추정값(estimate)
통계 2023. 11. 8. 20:53

1️⃣ 추정량(estimator) 모집단의 성질을 추정하는 데 사용하는 통계량 용어 추정량(Estimator) 모수(Parameter) 평균(Mean) \(\bar{x}\) \(\mu\) 분산(Variance) \(s^{2}\) \(\sigma^{2}\) 상관계수(Correlation) \(r\) \(\rho\) 특성 - 편향(bias)이 없는 추정량을 선택해야함 - 효율성(Efficiency)있는 추정량은 가장 작은 분산을 갖는 것 일치추정량 표본크기 \(n\)을 무한대로 했을 때, 모집단의 성질과 일치하는 추정량 비편향추정량 추정량의 평균값(기댓값)이 모집단의 성질과 일치할 때의 추정량 매번 얻을 때마다 확률적으로 다른 값이 되지만, 평균적으로 보면 모집단의 성질을 과대하지도 과소하지도 않게 나타내는..

article thumbnail
5. 분포 (2) 표본오차, 중심극한정리, 표준오차
통계 2023. 11. 8. 16:20

1️⃣ 표본오차(sampling error) 표본오차 = 표본평균(\(\bar{x}\)) - 모평균(\(\mu\)) 실제 뽑은 데이터와 정말로 알고 싶은 모집단의 차이 표본은 모집단의 성질과 정확히 일치하지 않고, 항상 확률오차가 존재 큰 수의 법칙(law of large numbers) 표본크기 \(n\)이 커질수록 표본평균(\(\bar{x}\))가 모평균(\(\mu\))에 한 없이 가까워짐 즉, 표본오차= \(\bar{x} - \mu\)가 0에 한없이 가까워진다는 것 2️⃣ 중심극한정리(central limit theorem) 모집단이 어떤 분포이든 간에, 표본크기 \(n\)이 커질수록 표본평균\(\bar{x}\)의 분포는 정규분포에 근사할 수 있다 (분산이 무한으로 발산하는 꼬리부분이 두꺼운 분포 ..

article thumbnail
5. 분포 (1) 분포의 정의와 정규분포, 표준정규분포
통계 2023. 11. 8. 15:35

추론 통계 (Inferential statistics) 포본으로 모집단의 성질을 추정하는 것 확률 이론과 분포에 의존함 1️⃣ 분포(Distributions) 변량의 값이 얼마나 자주 등장할 수 있는지 보여주는 것 통계학에서 분포란 확률분포를 의미한다. ex. 정규 분포, t-분포, 포아송분포 등 분포 시각화 유의 사항 분산은 값들이 어떻게 서로 연관되어 위치해 있는지를 표현할 뿐, 그래프가 아니다! 파라미터(parameter, 모수) 분포의 형태를 정하는 숫자 ex. 평균(\(\mu)\), 표준편차(\(\sigma)\) 2️⃣ 정규분포(Normal distribution) 가우스 분포(Gaussian distribution)이라고도 함 연속형 확률변수를 대상으로 정의 다양한 확률변수를 근사하는데 사용 ..