수능 출제 분석

가형 6번 / 나형 11번

표본평균의 분포와 성질

Q 문제 원문

정규분포 $N(20, 5^2)$을 따르는 모집단에서 크기가 $16$인 표본을 임의추출하여 구한 표본평균을 $\overline{X}$라 할 때,

$E(\overline{X}) + \sigma(\overline{X})$ 의 값은?
[3점]
① $\frac{83}{4}$
② $\frac{85}{4}$
③ $\frac{87}{4}$
④ $\frac{89}{4}$
⑤ $\frac{91}{4}$

1 출제의도 : 핵심 평가 역량

이 문항은 모집단의 확률분포와 표본평균의 확률분포 사이의 수학적 관계를 명확히 이해하고 있는지를 평가합니다.

  • 모평균과 표본평균의 평균이 일치함을 이해하는 능력
  • 모표준편차와 표본의 크기($n$)를 이용하여 표본평균의 표준편차를 계산하는 능력
  • 정규분포를 따르는 모집단에서 추출한 표본평균의 분포 형태를 유추하는 능력

2 상세 풀이 : Step-by-Step

Step 1 : 모집단의 특성 파악

주어진 문제에서 확률변수 $X$ (모집단)는 정규분포 $N(20, 5^2)$을 따릅니다. 이를 통해 모평균 $m$과 모표준편차 $\sigma$를 특정할 수 있습니다.

$$ m = E(X) = 20 $$ $$ \sigma = \sigma(X) = 5 $$
[참고도 1 : 모집단 $X$의 정규분포 곡선] x축 m = 20 N(20, 5²)
Step 2 : 표본 추출 및 표본평균의 기댓값 계산

모집단에서 크기가 $n = 16$인 표본을 임의추출합니다. 이때 도출되는 표본평균을 $\overline{X}$라고 합니다.

통계학의 기본 성질에 의해, 표본평균의 기댓값(평균)은 모평균과 항상 동일합니다.

$$ E(\overline{X}) = m = 20 $$
[참고도 2 : 모집단에서 표본 추출 과정] 모집단 X m = 20 임의추출 (n=16) 표본 집단 평균 : X̄
Step 3 : 표본평균의 표준편차 계산

표본평균의 분산 $V(\overline{X})$는 모분산 $\sigma^2$을 표본의 크기 $n$으로 나눈 값과 같습니다. 따라서 표본평균의 표준편차 $\sigma(\overline{X})$는 모표준편차를 $\sqrt{n}$으로 나눈 값입니다.

$$ \sigma(\overline{X}) = \frac{\sigma(X)}{\sqrt{n}} $$

문제에서 $\sigma(X) = 5$ 이고, 표본의 크기 $n = 16$ 이므로 대입하여 계산합니다.

$$ \sigma(\overline{X}) = \frac{5}{\sqrt{16}} = \frac{5}{4} $$
[참고도 3 : 모집단과 표본평균 분포의 폭(표준편차) 비교] 20 모집단 (σ=5) 표본평균 (σ=5/4)
Step 4 : 최종 식 계산

구하고자 하는 값은 $E(\overline{X}) + \sigma(\overline{X})$ 입니다. 앞에서 구한 두 값을 더해줍니다.

$$ E(\overline{X}) + \sigma(\overline{X}) = 20 + \frac{5}{4} = \frac{80}{4} + \frac{5}{4} = \frac{85}{4} $$

따라서 정답은 ②번 $\frac{85}{4}$ 입니다.

3 이론 매칭

모집단과 표본 모평균과 모표준편차 표본평균의 기댓값 표본평균의 표준편차 정규분포의 성질

4 실수 포인트 및 논리적 오류 교정

오류 : 분산과 표준편차의 혼동

학생들이 표본평균의 표준편차를 구할 때, 모표준편차를 $n$으로 나누거나, 반대로 분산을 $\sqrt{n}$으로 나누는 실수를 빈번하게 범합니다.

$$ \text{오류 예시 1 : } \sigma(\overline{X}) = \frac{\sigma}{n} = \frac{5}{16} \quad \text{(X)} $$ $$ \text{오류 예시 2 : } V(\overline{X}) = \frac{\sigma^2}{\sqrt{n}} = \frac{25}{4} \quad \text{(X)} $$

수학적 교정 : 표본의 크기 $n$으로 직접 나누는 것은 '분산'($V$)입니다. 즉, $V(\overline{X}) = \frac{\sigma^2}{n}$ 입니다. 표준편차($\sigma$)는 분산의 양의 제곱근이므로, $\sigma(\overline{X}) = \sqrt{V(\overline{X})} = \sqrt{\frac{\sigma^2}{n}} = \frac{\sigma}{\sqrt{n}}$ 가 되어야 합니다. 공식을 기계적으로 암기하기보다, 분산의 성질에서 유도됨을 기억해야 합니다.

5 핵심 이론 증명 : 표본평균의 평균과 분산 유도

크기가 $n$인 표본을 독립적으로 임의추출했을 때, 각각의 확률변수를 $X_1, X_2, \cdots, X_n$ 이라고 합시다. 이들은 모두 모집단 $X$와 동일한 분포를 따르므로 $E(X_i) = m$, $V(X_i) = \sigma^2$ 입니다.

1. 표본평균의 기댓값 증명

표본평균 $\overline{X}$의 정의는 다음과 같습니다.

$$ \overline{X} = \frac{X_1 + X_2 + \cdots + X_n}{n} $$

기댓값의 선형성(Linearity of Expectation) 성질에 의해 상수는 밖으로 나올 수 있고, 덧셈은 분리됩니다.

$$ \begin{aligned} E(\overline{X}) &= E\left(\frac{1}{n}(X_1 + X_2 + \cdots + X_n)\right) \\ &= \frac{1}{n} \left[ E(X_1) + E(X_2) + \cdots + E(X_n) \right] \\ &= \frac{1}{n} [ m + m + \cdots + m ] \\ &= \frac{1}{n} (nm) = m \end{aligned} $$
2. 표본평균의 분산 증명

분산의 성질 $V(aX) = a^2V(X)$ 와, 독립인 확률변수들의 합의 분산은 각 분산의 합과 같다는 성질을 이용합니다.

[참고 증명] 독립인 두 확률변수 합의 분산

두 확률변수 $X, Y$가 서로 독립일 때, $V(X+Y) = V(X) + V(Y)$가 성립함을 분산의 정의를 통해 증명할 수 있습니다. 계산의 편의를 위해 $E(X)=m_X, E(Y)=m_Y$라 하겠습니다.

$$ \begin{aligned} V(X+Y) &= E(\{(X+Y) - E(X+Y)\}^2) \\ &= E(\{(X - m_X) + (Y - m_Y)\}^2) \\ &= E((X - m_X)^2 + (Y - m_Y)^2 + 2(X - m_X)(Y - m_Y)) \\ &= E((X - m_X)^2) + E((Y - m_Y)^2) + 2E((X - m_X)(Y - m_Y)) \\ &= V(X) + V(Y) + 2E((X - m_X)(Y - m_Y)) \end{aligned} $$

여기서 마지막 항의 기댓값 내부를 전개해 보겠습니다.

$$ \begin{aligned} E((X - m_X)(Y - m_Y)) &= E(XY - m_X Y - m_Y X + m_X m_Y) \\ &= E(XY) - m_X E(Y) - m_Y E(X) + m_X m_Y \\ &= E(XY) - m_X m_Y - m_X m_Y + m_X m_Y \\ &= E(XY) - E(X)E(Y) \end{aligned} $$

고등학교 확률과 통계 교육과정에서 두 확률변수 $X, Y$가 서로 독립일 때, $E(XY) = E(X)E(Y)$가 성립함이 알려져 있습니다. (참고: 심화 및 대학 과정에서는 이를 '공분산(Covariance)이 0이다'라고 표현합니다.)

따라서 $E(XY) - E(X)E(Y) = 0$이 되므로 교차항이 사라지며, 최종적으로 $V(X+Y) = V(X) + V(Y)$가 성립합니다. 이 성질은 $n$개의 독립인 확률변수 $X_1, \dots, X_n$으로도 동일한 논리로 확장 적용됩니다.

$$ \begin{aligned} V(\overline{X}) &= V\left(\frac{1}{n}(X_1 + X_2 + \cdots + X_n)\right) \\ &= \left(\frac{1}{n}\right)^2 \left[ V(X_1 + X_2 + \cdots + X_n) \right] \\ &= \frac{1}{n^2} \left[ V(X_1) + V(X_2) + \cdots + V(X_n) \right] \\ &= \frac{1}{n^2} [\sigma^2 + \sigma^2 + \cdots + \sigma^2] \\ &= \frac{1}{n^2} (n\sigma^2) = \frac{\sigma^2}{n} \end{aligned} $$

정규분포 2D 시뮬레이터

표본 크기($n$)에 따른 기하학적 형태 변화

  • 파란색 점선은 모집단 $N(20, 5^2)$ 의 고정된 분포입니다.
  • 주황색 실선은 표본평균 $\overline{X}$ 의 분포 $N(20, \frac{25}{n})$ 입니다.
  • 아래 슬라이더를 통해 표본의 크기 $n$을 변화시켜보세요.
  • $n$이 커질수록 분산이 작아져 곡선이 뾰족해지는(데이터가 평균에 밀집하는) 기하학적 성질을 시각적으로 확인할 수 있습니다.

실제 의미 (Example)

데이터가 평균에 밀집한다는 것은 조사 결과의 신뢰도가 높아짐을 의미합니다. 예를 들어 전국 고등학생의 평균 키(모평균)를 조사할 때, 10명($n=10$)만 뽑아 평균을 내면 우연히 농구부 학생들이 뽑혀 실제보다 아주 큰 값이 나올 수 있습니다(분산이 큼, 넓은 종 모양). 하지만 10,000명($n=10000$)을 뽑아 평균을 내면 우연한 오차들이 상쇄되어 실제 전국 평균 키에 매우 가까운 값이 나오게 됩니다(분산이 작음, 뾰족한 종 모양).

16
모표준편차 $\sigma$ 5.00
표본평균 표준편차 $\sigma(\overline{X})$ 1.25
Normal Distribution