7-Day Sprint · SPC

SPC 过程监控学习计划

7 天 × 1 小时,从变异原理、控制图、过程能力,到质保残差监控与 Power BI 落地。面向 Serviceability 场景的统计过程控制方法论。

🧪 进入交互实验台
0 / 7 天完成
1
变异的两副面孔
核心概念

SPC 的一切都建立在一个判断上:这个波动是过程固有的,还是出了问题?判错方向,动作就全错。

  • Shewhart 的源起:把统计检验搬进生产线,1924 年贝尔实验室的第一张控制图
  • 普通原因(系统固有变差)vs 特殊原因(异常信号)——SPC 的第一性分类
  • 过度调整(tampering)的危害:对普通原因的波动做反应,反而放大变差(Deming 漏斗实验)
  • 过程监控 vs 结果监控:监控输出指标 ≠ 监控过程状态,前者报警时损失已经发生
  • 选一个你熟悉的月度指标(如返修率),手画 24 个月的 Run Chart
  • 凭直觉标出「你认为异常」的点,记下来——Day 5 用 Nelson 规则重新验证直觉的对错率
2
控制图原理与计量图
核心工具 实操

控制限是过程自己对自己的声明,规格限是客户的要求——两者混淆是 SPC 落地最常见的错误。

  • 3σ 控制限 vs 规格限:前者来自过程数据,后者来自工程要求,永远不要混用
  • 三大计量图:I-MR(单值-移动极差)、X̄-R、X̄-S,按子组有无选择
  • 合理子组(Rational Subgrouping):子组内只应包含普通原因变差——采样策略决定图的检出力
  • 控制限计算:I-MR 用 2.66 × MR̄,X̄-R 用 A₂ × R̄,理解常数表的来源
  • 用 Python(numpy/pandas)生成模拟数据,手写 I-MR 图的控制限计算,不调库
  • 故意注入一个 2σ 漂移,观察点位如何反应
3
计数控制图 — 服务与质保场景主力
核心工具 Serviceability

现场数据大多是计数型:返修/不返修、投诉件数。这是 SPC 在你的领域最常用的形态。

  • 四张计数图:p(不合格率)/ np(不合格数)/ c(缺陷数)/ u(单位缺陷率)
  • 子组容量变化的锯齿控制限:月度出货量波动时 p 图控制限逐月变化是正常现象
  • 过散布(overdispersion):组间变差超过二项分布假设 → Laney p′ 图修正
  • 质保映射:月度返修率(分母=出货量)用 p 图;每台设备报障次数用 u 图
  • 用 12 个月返修数据(返修数 + 出货量)画 p 图,标出控制限
  • 检查过散布:若实际组间方差远大于理论方差,换 Laney p′ 重画
4
过程能力 — Cp / Cpk / Ppk
核心概念 实操

能力分析回答「过程能不能满足要求」。前提是过程受控——对失控过程算 Cpk 是自欺。

  • Cp/Cpk(组内变差,潜在能力)vs Pp/Ppk(整体变差,实际表现)
  • 能力前提:过程受控 + 数据正态。两条件不满足时 Cpk 只是数字游戏
  • 非正态数据:Box-Cox 变换 vs 直接用 Weibull 拟合——寿命/可靠性数据几乎都是右偏的
  • Cpk 与 PPM 换算直觉:Cpk=1.0 ≈ 2700 PPM,Cpk=1.33 ≈ 64 PPM(单侧)
  • 模拟一组右偏寿命数据,分别用正态假设和 Weibull 分位数计算 Ppk,看差异有多大
  • 结论沉淀:可靠性场景的能力分析必须先看分布形状
5
判异规则与检出力
进阶 实操

3σ 出界只是冰山一角。趋势、循环、偏移的模式识别才是控制图的精髓——但每加一条规则都在支付误报代价。

  • Western Electric 规则与 Nelson 8 规则:趋势、连续同侧、2/3 落 zone A、4/5 落 zone B
  • 误报经济学:每条规则的误报率 α 叠加——规则越多越「灵」,但报警疲劳会让监控失效
  • 平均链长 ARL:受控时 ARL≈370(3σ 单规则),检出 1σ 漂移需要几百点 → 这就是 CUSUM/EWMA 存在的理由
  • CUSUM 与 EWMA:小偏移累积检出,适合缓慢劣化(磨损、老化)场景
  • 拿 Day 1 的 Run Chart 套 Nelson 规则重判,对比你直觉标记的命中率
  • 模拟 1σ 缓慢漂移,对比 Shewhart vs EWMA(λ=0.2)的报警点差多少期
6
从生产到现场:质保数据的 SPC
领域迁移 Serviceability

SPC 思路搬到售后质保数据:监控「相对于模型的异常」而非「绝对阈值」——比当月返修率超标提前数月发现问题。

  • Nevada Chart 数据结构:出货期 × 在保时间 的三角矩阵,质保分析的标配录入格式
  • 按出货 cohort 建模期望返修数,残差 z² ∼ χ² 监控:哪个销售期的实际返修偏离了模型
  • Subset ID 隔离:异常 cohort 单独拟合 Weibull,β/η 参数差异就是根因入口(供应商变更/批次问题)
  • 从描述性到诊断性:cohort 间参数差异 → 追溯供应链变更、软件版本、生产批次
  • 复现经典案例:按出货期分析返修,识别统计学异常月份,追溯后发现供应商材料变更
  • 把「当月返修率是否超标」看板升级为「相对期望的残差」看板——黄/红预警触发批次追溯
7
落地:Power BI 监控闭环
工程落地 实操

最后一天把方法论变成看板和 Action 机制。图表驱动 Action,否则 SPC 只是装饰品。

  • Power BI 实现控制图的 DAX 模式:控制限作为 measure 随筛选上下文(产品线/区域)动态重算
  • Python/Databricks 侧批量计算残差 z²,结果写回表供 Power BI 消费——重计算与展示分层
  • 预警机制设计:黄(单期出界)/ 红(连续 2 期)分级,红触发 Subset ID 隔离分析流程
  • 报警疲劳防护:控制指标数量,每张图绑定明确的 Action owner
  • 用返修数据在 Power BI 建 p 图 + 动态控制限(measure 实现)
  • 写一页监控章程:哪些指标上控制图、谁看、出界后第一动作是什么