27. 어느 회사에서 생산하는 샴푸 1개의 용량은 정규분포 $N(m, \sigma^2)$을 따른다고 한다. 이 회사에서 생산하는 샴푸 중에서 $16$개를 임의추출하여 얻은 표본평균을 이용하여 구한 $m$에 대한 신뢰도 $95\%$의 신뢰구간이 $746.1 \le m \le 755.9$이다.
이 회사에서 생산하는 샴푸 중에서 $n$개를 임의추출하여 얻은 표본평균을 이용하여 구하는 $m$에 대한 신뢰도 $99\%$의 신뢰구간이 $a \le m \le b$일 때, $b-a$의 값이 $6$ 이하가 되기 위한 자연수 $n$의 최솟값은? (단, 용량의 단위는 $\mathrm{mL}$이고, $Z$가 표준정규분포를 따르는 확률변수일 때, $P(|Z| \le 1.96) = 0.95$, $P(|Z| \le 2.58) = 0.99$로 계산한다.) [3점]
이 문항은 정규분포를 따르는 모집단에서 표본을 추출할 때, 신뢰구간의 길이를 결정하는 요인들(신뢰상수, 모표준편차, 표본의 크기)의 관계를 정확히 이해하고 있는지 평가합니다. 첫 번째 조건에서 미지의 모표준편차를 역산해내고, 이를 두 번째 조건에 적용하여 오차 한계를 만족시키는 표본의 크기의 최솟값을 대수적으로 추론하는 능력을 요구합니다.
먼저 $n_1 = 16$개를 추출했을 때의 $95\%$ 신뢰구간이 $746.1 \le m \le 755.9$로 주어졌습니다.
이 신뢰구간의 양 끝값의 차이는 곧 '신뢰구간의 길이'를 의미합니다.
신뢰구간의 길이를 구하는 공식 $l = 2 \times k \times \frac{\sigma}{\sqrt{n}}$ 을 적용합니다.
조건에서 $P(|Z| \le 1.96) = 0.95$ 이므로 신뢰상수 $k = 1.96$ 입니다.
이제 동일한 모집단에서 크기가 $n$인 표본을 임의추출하여 신뢰도 $99\%$로 추정합니다.
이때의 신뢰구간이 $a \le m \le b$ 이므로, $b-a$ 는 $99\%$ 신뢰구간의 길이를 의미합니다.
조건 $P(|Z| \le 2.58) = 0.99$ 에 의해 새로운 신뢰상수 $k = 2.58$ 입니다.
Step 1에서 구한 모표준편차 $\sigma = 10$ 을 대입하여 식을 정리합니다.
문제의 조건에서 $b - a$ 의 값이 $6$ 이하가 되어야 한다고 명시되어 있습니다.
표본의 크기 $n$은 자연수이므로, $73.96$보다 크거나 같은 최소의 자연수를 구합니다.
$n$의 최솟값은 $74$입니다.
따라서 정답은 ③번 입니다.
표본평균을 이용하여 모집단의 평균인 모평균이 속할 구간을 확률적으로 예측하는 과정.
모평균 $m$에 대한 신뢰도 범위 $[a, b]$에서 상한값과 하한값의 차이($b-a$). $2k\frac{\sigma}{\sqrt{n}}$으로 계산된다.
신뢰도 $100(1-\alpha)\%$ 에 대응하는 표준정규분포표 상의 양수 $k$값. $P(-k \le Z \le k) = 1-\alpha$ 를 만족한다.
학생들이 가장 자주 하는 실수는 신뢰구간 공식에 들어가는 $\sigma$ 자리에 '표본평균의 표준편차'인 $\frac{\sigma}{\sqrt{n}}$ 을 다시 넣는 것입니다. 공식 내의 $\frac{\sigma}{\sqrt{n}}$ 자체가 표본평균 $\bar{X}$의 표준편차임을 명확히 인지해야 합니다.
모집단의 분포가 정규분포 $N(m, \sigma^2)$ 이면, 크기가 $n$인 표본평균 $\bar{X}$ 의 분포는 정규분포 $N(m, \frac{\sigma^2}{n})$ 을 따릅니다.
이를 표준화한 확률변수 $Z$ 는 다음과 같습니다.
$$ Z = \frac{\bar{X} - m}{\sigma_{\bar{X}}} = \frac{\bar{X} - m}{\frac{\sigma}{\sqrt{n}}} $$
따라서 공식 $l = 2 \times k \times \frac{\sigma}{\sqrt{n}}$ 에 들어가는 값은 모집단의 원래 표준편차 $\sigma$ 이며, $n$의 크기가 변하더라도 모집단 고유의 값인 모표준편차 $\sigma$ 는 절대 변하지 않습니다. 본 문제에서 첫 번째 조건으로 구한 $\sigma=10$을 두 번째 상황에 그대로 적용할 수 있는 논리적 근거가 바로 이것입니다.
신뢰구간 $[a, b]$ 의 정의와 길이 공식이 어떻게 도출되는지 표준정규분포의 확률밀도함수(Probability Density Function)를 이용하여 시각적, 수식적으로 증명해 보겠습니다. 고등학교 심화수학 연계
확률변수 $Z$가 표준정규분포 $N(0, 1)$을 따를 때, $Z$의 확률밀도함수 $f(z)$는 자연상수 $e$를 포함한 지수함수 형태로 다음과 같이 정의됩니다.
$$ f(z) = \frac{1}{\sqrt{2\pi}} e^{-\frac{z^2}{2}} $$
신뢰도 $100(1-\alpha)\%$ 에 대한 표준정규분포의 양수 $k$ 는 이 확률밀도함수의 정적분으로 정의됩니다. 즉, 구간 $[-k, k]$에서의 곡선 아래 넓이가 $1-\alpha$가 되어야 하므로,
$$ P(-k \le Z \le k) = \int_{-k}^{k} \frac{1}{\sqrt{2\pi}} e^{-\frac{z^2}{2}} dz = 1 - \alpha $$ 가 성립합니다.
이제, 표본평균 $\bar{X}$ 를 표준화한 확률변수 $Z = \frac{\bar{X} - m}{\frac{\sigma}{\sqrt{n}}}$ 를 위 확률식에 대입합니다.
$$ P\left(-k \le \frac{\bar{X} - m}{\frac{\sigma}{\sqrt{n}}} \le k\right) = 1 - \alpha $$
부등식의 각 변에 표본평균의 표준편차인 $\frac{\sigma}{\sqrt{n}}$ 를 곱합니다.
$$ P\left(-k \frac{\sigma}{\sqrt{n}} \le \bar{X} - m \le k \frac{\sigma}{\sqrt{n}}\right) = 1 - \alpha $$
각 변에서 $\bar{X}$ 를 빼고, 양변에 $-1$ 을 곱하여 부등호 방향을 바꾼 뒤 정리하면 미지의 모평균 $m$ 에 대한 신뢰구간이 도출됩니다.
$$ P\left(\bar{X} - k \frac{\sigma}{\sqrt{n}} \le m \le \bar{X} + k \frac{\sigma}{\sqrt{n}}\right) = 1 - \alpha $$
이때 신뢰구간의 하한 $a = \bar{X} - k \frac{\sigma}{\sqrt{n}}$ 이고, 상한 $b = \bar{X} + k \frac{\sigma}{\sqrt{n}}$ 입니다.
따라서 신뢰구간의 길이 $l$ 은 상한값과 하한값의 차이이므로,
$$ l = b - a = \left(\bar{X} + k \frac{\sigma}{\sqrt{n}}\right) - \left(\bar{X} - k \frac{\sigma}{\sqrt{n}}\right) $$
$$ \therefore l = 2k\frac{\sigma}{\sqrt{n}} $$