Manufacturing · Methodology

算法驱动的排产系统
形态 · 痛点 · 解法

2026-09 · Manufacturing Scheduling

现代化的排产系统不是「一个更聪明的排产软件」,而是一个持续运转的决策闭环——感知、求解、执行、偏差回流。求解器只是其中一环,而且往往不是成败关键。

APS Constraint Programming Time Fences Rolling Horizon MES 闭环

一、形态演进:从导航仪到自动驾驶仪

排产系统正在经历第三次形态变化。判断一个系统处在哪个阶段,看它如何对待「计划与现实的偏差」:

阶段类比本质死因
电子表格 / 手工排产 纸质地图 人脑启发式,产能是「无限」虚构 规模上限、经验不可复制
传统 APS 导航仪 一次性算出静态最优解,落地即过时 计划焦躁摧毁信任
现代闭环系统 自动驾驶仪 事件驱动滚动重排,计划与现场持续对齐 —

行业复盘的结论高度一致:APS 项目失败的原因几乎没有一个和算法有关——主数据失真、过度建模、计划不稳定摧毁信任。给求解器喂错误数据,得到的是更快生成的、一个不存在的工厂的漂亮计划。

二、现代形态:四层闭环架构

┌─ 交互层 ── planner 在环:甘特图 + "为什么X在Y前"的可解释性 + 人工覆盖
├─ 求解层 ── 混合引擎(ML 评分 → CP 保可行 → 元启发式优化 → 规则兜底)
├─ 数据层 ── MES 实时状态 + ERP 订单/BOM + 主数据(换型矩阵、工艺路线)
└─ 学习层 ── 计划 vs 实际偏差回流,持续校准工时/换型/预测模型

        感知 ──────→ 求解 ──────→ 执行
          ↑                          │
          └──────── 偏差回流 ─────────┘

求解层是混合架构,不是单选算法——这是实践收敛出的形态:

组件职责为什么必须有
约束引擎(CP) 硬可行性:日历、刀具、人员资质、物料齐套 违反一条硬约束,计划几小时内被车间废弃
优化器(MIP / 元启发式) 在可行域内逼近最优:换型时间、瓶颈吞吐 序依赖换型场景,最优 vs 最差序列差可达 10×
ML 预测 工时分布预测、交期风险评分、surrogate 剪枝 真实工时是分布,不是常数
规则启发式(EDD / SPT) 实时派工兜底,秒级响应 求解器超时或异常时系统不能停

新变量:Agentic 层(2026)

LLM 做不了排产本身(组合优化不是它的菜),但已在三个位置真实落地:约束摄取(把客户邮件、口头约定翻译成结构化约束)、计划解释(planner 问「为什么这单排后面」,agent 用因果链回答)、异常处置(宕机时生成 2-3 个重排方案 + 各自代价,人做选择)。本质:求解归算法,语义和交互归 agent。

三、核心痛点:四层痛点地图

排产的痛点 80% 不在「排」这个动作本身,而在排的输入(数据)、排的输出(稳定性)、和排完之后人的接受度。

数据层 · 最高频
主数据失真 + 数据孤岛 + 隐含知识在人脑里
换型矩阵抄 OEM 手册、工时冻结在上线那年;ERP/MES/WMS 各一套数;老 planner 脑子里的例外规则没有结构化——人走经验走。
模型层
过度建模 / 建模不足 + 序依赖换型 + 多目标打架
想把每条例外编码进系统 → 不可维护;漏掉一条硬约束 → 计划被丢弃;A→B 与 B→A 换型差可达 10×;交期、库存、利用率互相冲突,权重一改全盘重排。
执行层 · 信任杀手
计划焦躁(nervousness)+ 插单风暴 + 黑箱不可解释
一个小扰动触发全周重排,车间第一班次就放弃跟计划;急单手工硬塞,后续全部冲突;planner 无法回答「为什么 X 在 Y 前」→ 用 Excel 对抗系统。
环境层 · 中国制造「三高」
高波动订单 + 高混线生产 + 高供应链不确定性
西方 APS 的预设(稳定订单、大批量、可靠供应链)在此直接失效:月变更率可超 80%、单品批量 < 50、物料承诺不可信。
         根因层              表现层              恶果
      ┌──────────┐      ┌──────────┐      ┌──────────┐
数据 →│ 主数据失真 │      │ 计划不可行 │      │ 车间弃用计划│
模型 →│ 过度/不足  │  →   │ 黑箱输出   │  →   │ 信任崩塌   │
执行 →│ 无滚动重排 │      │ 计划焦躁   │      │ Excel对抗  │
环境 →│ 三高波动   │      │ 静态解过时 │      │ 返祖手工排 │
      └──────────┘      └──────────┘      └──────────┘
四层痛点互相放大,构成死亡螺旋:数据失真 → 计划偏差大 → 频繁重排 → 稳定性差 → 车间不跟 → 现场数据更不回流 → 数据更失真。国内 2024 年数字化满意度报告:APS 实施失败率 67%——「花 300 万上的德国 APS,排产比手工还慢,计划部用 Excel 对抗系统」。

四、解法:六大对策

解法跟痛点一一对应,但顺序不能乱——先治数据,再治稳定性,最后才谈优化算法。67% 失败率的教训就是顺序反了。

痛点解法一句话原理
数据失真→① 数据回流闭环计划 vs 实际偏差自动回流,持续校准
隐含知识→② 80/20 建模 + 人工覆盖编码 80%,例外留给人,覆盖记录进系统
计划焦躁→③ 时间栅栏冻结/半冻结/开放三区,三种变更政策
插单风暴→④ What-if + 有界重排先仿真看代价,重排只动扰动半径内
黑箱→⑤ 可解释性 + 计划所有权每个「X在Y前」给因果链;一人负责
算法选型→⑥ 混合求解引擎ML 评分 → CP 可行 → 优化逼近 → 规则兜底

① 数据回流闭环(最优先)

MES 实际工时 ──┐
实际换型时间 ──┼──→ 偏差分析 ──→ 校准主数据 ──→ 下次排产
计划值       ──┘         ↑                          │
                        └──────── 循环 ────────────┘

② 时间栅栏(结构化解法)

冻结区未来 5-10 工作日
半冻结区第 3-6 周
开放区6 周以外

③ 有界重排(治插单风暴)

④ 混合求解引擎

Layer 1ML 预测工时分布 / 交期风险评分 → 候选剪枝
↓
Layer 2约束传播(CP)保证硬可行:日历 · 刀具 · 资质 · 齐套
↓
Layer 3元启发式(GA / 模拟退火 / LNS)在可行域内逼近最优
↓ 超时 / 异常时
Fallback优先规则(EDD / SPT / 关键比)秒级兜底,永不宕机

⑤ 组织解法(半个解法在系统外)

五、健康度指标

指标健康线含义
计划达成率>90%(稳定批量)/ >75%(高混线)按计划班次完成的比例
计划稳定性相邻两次排程序列变化率 ↓上升 = 主数据或上游有问题
计划焦躁度每班变更数:个位数健康双位数 = 报警信号
换型时间占比比 FIFO 降 20-40%序依赖优化的直接收益
瓶颈利用率按瓶颈工位单独看非瓶颈利用率是虚荣指标

六、落地顺序

设计公理:建模驱动吞吐量的 80%,剩下 20% 留给人工覆盖。追求把每条例外编码进系统,得到的不是智能排产,是一个没人能维护、没人能解释、被一线抛弃的怪物。「现代」不体现在算法多复杂,体现在它知道自己的边界——把边界外交还给人,并让人的每次覆盖都变成系统的学习素材。

参考来源