标准差怎么算?平均分与波动程度
一、方差与标准差:只差一个开方
方差 = 离差平方的平均数
标准差 = √方差
为什么要开方?因为方差的单位是原数据单位的平方——分析成绩时方差单位是「分²」,没法直接理解;标准差开完方后单位回到「分」,与原数据可比。所以描述波动大小时报标准差,做方差分析时才用方差。
以 4、6、8、10、12 为例:
| 指标 | 值 |
|---|---|
| 平均数 | 8 |
| 中位数 | 8 |
| 离差平方和 | 40 |
| 方差(总体,÷5) | 8 |
| 标准差(总体) | 2.83 |
| 方差(样本,÷4) | 10 |
| 标准差(样本) | 3.16 |
同一组数据,两个标准差——这不是算错,而是口径不同。
二、n 还是 n−1:怎么选
| 口径 | 分母 | 什么时候用 | 上面例子的结果 |
|---|---|---|---|
| 总体标准差 | n | 数据就是全部研究对象(全班 40 人、全年 12 个月) | 2.83 |
| 样本标准差 | n − 1 | 数据只是从更大总体里抽出来的一部分(从全校抽 30 人) | 3.16 |
为什么样本要除以 n−1:样本平均数是拿样本自己算出来的,数据会天然「贴近」这个平均数,离差平方和偏小,除以 n 会系统性低估真实波动。除以自由度 n−1 能把这个偏差校正回来(无偏估计)。
两者只差一个系数 √(n/(n−1)):
- n = 10 时,样本口径比总体大约 5.4%;
- n = 100 时,只大约 0.5%。
所以数据量大时选哪个差别很小,数据量小时必须选对。Excel 的 STDEV 与科学计算默认都走样本口径(÷n−1)。只有一个数据时 n−1 = 0,样本标准差无定义——工具会提示至少需要 2 个数据。
三、算一组真实点的数据
六门课成绩 85、90、78、92、88、76:
| 指标 | 值 |
|---|---|
| 平均数 | 84.83 |
| 中位数 | 86.5 |
| 样本标准差 | 6.52 |
| 总体标准差 | 5.96 |
| 极差(最高 − 最低) | 16 |
| 四分位距(Q3 − Q1) | 12(Q1 = 78,Q3 = 90) |
| 变异系数(CV) | 7.69% |
平均数高于中位数吗? 这里是平均数 84.83 < 中位数 86.5,说明低分那一端把平均数拉下来了(76 分是个明显的低点)。平均数与中位数的差距就是分布偏斜的信号。
[2,2,2,2] 这类全相同的数据,方差与标准差都是 0——没有波动。
四、比波动大小:标准差不一定够用
两个班的平均分都是 85,标准差也都是 6,能说波动一样吗?不一定——如果一个是百分制、另一个是 150 分制,就不能直接比。这时用变异系数(CV):
CV = 标准差 ÷ 平均数 × 100%
上例 6.52 ÷ 84.83 = 7.69%,是无量纲的相对波动,跨量纲比较才公平。
另外三个描述离散程度的指标各有用途:
- 极差:只看两个极端值,对异常值极敏感,适合快速了解范围;
- 四分位距(IQR):去掉两端各 25% 的数据,比极差稳健得多,箱线图用的就是它;
- 标准差:用上全部数据,但受极端值影响大。
数据里有一个明显的异常值时,优先看中位数与四分位距,而不是平均数与标准差。
五、百分误差:测量值对理论值
实验与工程里常用百分误差衡量偏差:
百分误差 = |观测值 − 理论值| ÷ |理论值| × 100%
| 观测值 | 理论值 | 百分误差(分母取理论值) | 分母取观测值 |
|---|---|---|---|
| 9.8 | 10 | 2.00% | 2.04% |
| 105 | 100 | 5.00% | 4.76% |
三个要点:
- 公式外层取绝对值,所以结果不会是负数;
- 相对误差与百分误差只差 100 倍:相对误差是小数(0.02),百分误差是百分数(2%)。写报告时要统一,混用最容易出错;
- 分母为什么用理论值:理论值是固定的参照基准,同一理论值下的不同测量结果才可比。观测值每次测量都会波动,分母跟着变就失去了共同基准——部分实验报告沿用观测值作分母,所以工具把两种口径都算出来。
六、直接算
→ 标准差计算器:总体/样本两种口径,含四分位与变异系数
→ 平均数计算器:算术平均、中位数与离散程度
→ 百分误差计算器:两种分母口径同时给出
→ 加权平均计算器:成绩按权重算综合分
本站文章为个人使用经验的原创整理,除已注明来源的引用外均为本人撰写。文中涉及的软件名称、商标、截图等归各自权利人所有,引用仅用于说明与交流。如认为本站内容侵犯了你的合法权益,请通过「关于本站」页面的联系方式告知,核实后将及时更正或删除。