이게 뭔가요?
숫자 목록을 붙여넣으면 대표값·흩어진 정도·사분위·이상치를 한 번에 계산합니다. 엑셀 열을 그대로 복사해 붙여도 됩니다.
평균만 보면 안 되는 이유
12, 15, 18, 22, 22, 25, 28, 31, 35, 90
이 열 개의 평균은 29.8입니다. 그런데 90 하나를 빼면 평균이 23.1로 떨어집니다. 평균은 극단값 하나에 크게 흔들립니다.
중앙값은 정렬해서 가운데를 고르므로 90이 있든 없든 22~23 근처에 머뭅니다. 연봉·집값처럼 한쪽으로 치우친 데이터에서 “보통 사람”을 말하려면 평균이 아니라 중앙값을 봐야 하는 이유입니다.
이 도구는 둘을 나란히 보여주고, 극단값은 이상치로 따로 잡아줍니다.
표본과 모집단
표준편차와 분산에는 두 가지 값이 나옵니다. 나누는 수가 다릅니다.
| 나누는 수 | 언제 | |
|---|---|---|
| 모집단 | n | 가진 데이터가 전체일 때 |
| 표본 | n − 1 | 가진 데이터로 더 큰 전체를 짐작할 때 |
표본에서 계산한 분산은 실제 모집단 분산보다 작게 나오는 경향이 있습니다. n−1로 나누면 이 편향이 보정됩니다(베셀 보정).
실무에서는 거의 항상 표본입니다. 설문 응답 200명으로 전체 고객을 짐작하고, 이번 달 매출로 추세를 읽으니까요. 어느 쪽인지 모르겠으면 표본을 보세요.
사분위와 이상치
데이터를 크기순으로 늘어놓고 넷으로 나눈 경계가 사분위입니다.
- Q1 — 아래에서 25% 지점
- Q2 — 50% 지점 (= 중앙값)
- Q3 — 75% 지점
- IQR — Q3 − Q1. 가운데 절반이 퍼진 폭
이상치는 상자그림의 관행대로 Q1 − 1.5×IQR 아래, Q3 + 1.5×IQR 위를 벗어난 값으로 잡습니다. 입력 오류나 특이 사례를 찾을 때 유용합니다.
사분위 계산은 엑셀 QUARTILE.INC와 같은 방식이라 엑셀에서 옮겨와도 값이 같습니다.
변동계수
표준편차를 평균으로 나눈 값입니다. 단위가 다른 두 데이터의 흩어짐을 견줄 때 씁니다. 키(cm)와 몸무게(kg)의 표준편차는 직접 비교할 수 없지만 변동계수는 비교할 수 있습니다.
주의할 점
- 계산은 브라우저 안에서만 이뤄집니다.
- 숫자 하나만 넣으면 표본 분산은 정의되지 않아(n−1 = 0) 표시되지 않습니다.
- 최빈값은 두 번 이상 나온 값만 표시하고, 여러 개면 모두 보여줍니다.
- 가중평균·기하평균·왜도·첨도는 다루지 않습니다.