您还没有绑定微信,更多功能请点击绑定

描述性统计是什么?一文读懂均值、中位数、标准差的计算与用法

描述性统计是什么?一文读懂均值、中位数、标准差的计算与用法

当你拿到一批质量检测数据,比如50个零件的直径测量值,第一反应往往是“算个平均值”。但平均值真的能代表这批产品的整体状况吗?如果数据里藏着几个极端值,平均值可能瞬间失真。这正是描述性统计要解决的核心问题——用一组简洁的指标,把数据的集中趋势、离散程度和分布形态讲清楚。

本文基于 ISO 3534-1:2006《统计学 词汇及符号》及 Montgomery《Introduction to Statistical Quality Control》(Wiley出版社)中的通用统计量定义,为你拆解描述性统计的每个关键指标,并附上一个完整的演示算例。文中所有数值均为“示例数据(仅供演示)”,不构成任何真实测量结论。


描述性统计是什么?

描述性统计(Descriptive Statistics)是对一组观测值进行概括和提炼的统计方法集合。它不推断总体、不做假设检验,只回答一个问题:“这批数据长什么样?”

在质量管理场景中,描述性统计是SPC(统计过程控制)的起点。无论是计算过程能力指数(Cpk),还是绘制控制图,第一步都是先算出样本的均值与标准差。ISO 3534-1:2006将描述性统计量分为三类:
  • 位置统计量:均值、中位数、众数——回答“数据集中在哪个值附近”
  • 离散程度统计量:极差、方差、标准差——回答“数据分散到什么程度”
  • 分布形态统计量:偏度、峰度——回答“数据是否对称、是否尖峰”



怎么做:核心统计量的定义与公式

以下所有公式均依据 ISO 3534-1:2006 及 Montgomery 教材中的标准定义。设样本量为 n,观测值为 x_1, x_2, …, x_n。

1. 均值(Mean)

样本均值 x̄ 是所有观测值的算术平均:


x̄ = (1)/(n)Σ(i=1..n) x_i


注意:均值对极端值敏感。若数据中存在一个异常大或异常小的值,均值会被明显拉偏。

2. 中位数(Median)

将数据按升序排列后,位于中间位置的数值即为中位数。若 n 为奇数,中位数是第 (n+1)/(2) 个值;若 n 为偶数,中位数是中间两个值的平均。

中位数不受极端值影响,是“稳健”的位置代表。当均值与中位数差异较大时,往往提示数据存在偏态或离群点。

3. 众数(Mode)

出现频率最高的数值。一组数据可能有多个众数,也可能没有众数(当所有值均不同时)。在质量管理中,众数常用于识别最常见的缺陷类型或测量值区间。

4. 极差(Range)

最大值与最小值之差:


R = x_(max) - x_(min)


极差计算简单,但只利用了两个端点,对离群值极其敏感,通常仅用于小样本(如 n le 10 )的快速判断。

5. 样本方差(Variance)与样本标准差(Standard Deviation)

这是描述性统计中最重要的离散度指标。注意:分母是 n-1,而非 n ,这是为了对样本估计总体方差时提供无偏修正。

样本方差:


s^2 = (1)/(n-1)Σ(i=1..n)(x_i - x̄)^2


样本标准差:


s = √(s^2)


标准差与原始数据同量纲,直接反映数据围绕均值的平均波动幅度。在质量工程中, s 是计算过程能力、控制图控制限的基础。

6. 偏度(Skewness)

衡量数据分布不对称性的指标。ISO 3534-1:2006 定义的样本偏度(基于三阶矩)为:


g_1 = (n)/((n-1)(n-2)) Σ(i=1..n) ( (x_i - x̄)/(s) )^3

  • g_1 = 0:对称分布(如正态分布)
  • g_1 > 0:右偏(长尾在右侧,均值大于中位数)
  • g_1 < 0:左偏(长尾在左侧,均值小于中位数)


7. 峰度(Kurtosis)

衡量分布尾部厚度或峰部尖锐度的指标。样本峰度(超额峰度)为:


g_2 = (n(n+1))/((n-1)(n-2)(n-3)) Σ(i=1..n) ( (x_i - x̄)/(s) )^4 - (3(n-1)^2)/((n-2)(n-3))

  • g_2 = 0:与正态分布的峰度一致(称为“中峰”)
  • g_2 > 0:尖峰厚尾(比正态分布更集中在均值附近,但尾部更厚)
  • g_2 < 0:平峰薄尾(分布更平坦)



一个演示算例(示例数据,仅供演示)

假设某车间测量了10个螺栓的直径(单位:mm),数据如下:

示例数据(仅供演示)
10.02, 10.01, 10.03, 9.99, 10.00, 10.02, 10.01, 10.04, 9.98, 10.02

步骤1:计算均值


x̄ = (10.02+10.01+10.03+9.99+10.00+10.02+10.01+10.04+9.98+10.02)/(10) = (100.12)/(10) = 10.012


步骤2:计算中位数

排序:9.98, 9.99, 10.00, 10.01, 10.01, 10.02, 10.02, 10.02, 10.03, 10.04

n=10 (偶数),中位数为第5和第6个值的平均:


中位数 = (10.01 + 10.02)/(2) = 10.015


步骤3:计算众数

10.02出现3次,频率最高,故众数 = 10.02 mm。

步骤4:计算极差


R = 10.04 - 9.98 = 0.06 mm


步骤5:计算样本方差与标准差

先计算每个值与均值的偏差平方和:













x_ix_i - x̄(x_i - x̄)^2
10.020.0080.000064
10.01-0.0020.000004
10.030.0180.000324
9.99-0.0220.000484
10.00-0.0120.000144
10.020.0080.000064
10.01-0.0020.000004
10.040.0280.000784
9.98-0.0320.001024
10.020.0080.000064


平方和 = 0.000064 + 0.000004 + 0.000324 + 0.000484 + 0.000144 + 0.000064 + 0.000004 + 0.000784 + 0.001024 + 0.000064 = 0.00296

样本方差(分母 n-1 = 9 ):


s^2 = (0.00296)/(9) ≈ 0.000329


样本标准差:


s = √(0.000329) ≈ 0.0181 mm


步骤6:偏度与峰度(手算繁琐,此处给出基于上述公式的计算结果)

偏度 g_1 ≈ -0.41 (轻微左偏,说明左侧尾部略长)
峰度 g_2 ≈ -0.87 (平峰,分布比正态更平坦)

解读(仅针对本示例数据):均值10.012与中位数10.015非常接近,表明数据基本对称;标准差0.0181 mm说明波动很小;极差0.06 mm在10个样本中属于正常范围。整体来看,该过程直径分布稳定,无明显离群点。


常见误区(务必避开)

1. 只用均值,不看标准差
两组数据可以有完全相同的均值,但一组是10.00±0.01,另一组是10.00±0.50,质量含义天差地别。描述性统计必须“位置+离散”成对报告。

2. 混淆样本标准差与总体标准差
分母是 n-1 还是 n,结果在小样本时差异明显。ISO 3534-1:2006 明确规定,用于估计总体参数的样本标准差采用 n-1 分母。

3. 忽视偏度与峰度
许多质量工具只看均值与标准差,但若数据严重偏态,基于正态假设的 Cpk 计算将失真。偏度与峰度是判断数据是否近似正态的第一道关卡。

4. 把示例数据当真实结论
任何演示算例中的数值仅用于展示计算过程,绝不能作为生产决策依据。真实结论必须来自你的实际测量数据。


在线工具推荐

手工计算上述统计量容易出错,尤其当样本量达到数百甚至数千时。推荐使用专业的在线描述性统计工具,自动输出均值、中位数、众数、极差、方差、标准差、偏度、峰度等全部指标,并附带直方图与正态性检验。

工具链接(注册登录后即可使用):
? https://www.6sq.net/tools/desc_stats/


下图是 6SQ 在线工具一键生成的结果效果:





只需粘贴你的数据列,即可一键获得完整描述性统计报告,省时省力,减少笔误风险。无论是日常质量巡检还是六西格玛项目初期数据探索,这个工具都能帮你快速摸清数据底细。

0 个评论

游客无法查看评论和回复, 请先登录注册

发起人

龙天
龙天

我努力,我进步,我付出,我收获,我坚持,我成功!

推荐文章

文章状态

  • 发布时间: 2026-09-09 22:34
  • 浏览: 15
  • 评论: 0
  • 赞: 0