Prompt Engineering · Measured

让 LLM 像飞机维修手册一样说话

Karpathy 的 AI 输出四阶法:用 ASD-STE100 受控英语约束大模型输出。本文附一组真实 A/B 对照实验数据,回答一个问题——这样做真的有效吗?

ASD-STE100 · A/B 实测 · 2026-10

起源:航空业的受控英语

ASD-STE100(Simplified Technical English)是 1986 年欧洲航空业为飞机维修手册制定的受控英语规范。它的设计目标只有一个:让全球母语不同的机械师读同一本手册时,零歧义。

核心规则:

关键洞察 这套规范在航空维修领域执行了近四十年,产生了海量高质量文本。大模型训练语料里浸透了这种「一句一动作」的文风——所以一个术语就能唤起它。

用法:一句话调出

Karpathy 发现大模型早已吃透这套规范。提示词里只需加一句:

# 标准版——输出会很"硬"
用 ASD-STE100 解释 <技术概念>

# 松弛版——保留规范但允许自然表达(推荐)
用 ASD-STE100 风格回答,做到 80% 即可

# 中文提问同样生效
讲解 <技术概念>,用 ASD-STE100 简化技术英语规则回答(80% 达标即可)

"做到 80%" 这个松弛度是必要的:完整 STE100 会把术语表也压掉,伤害内容质量;80% 只保留短句、主动语态、一句一动作这些真正改善可读性的部分。

实测:A/B 对照实验

不空谈,直接跑。同一道问题("Explain how a transformer's attention mechanism works"),temperature=0.3,只改提示词:

−60%
平均句长降幅
28 → 11.3 词/句
−22%
总词数降幅
476 → 373 词
9.4
中文提示+STE100
词/句(全场最短)
提示词总词数句子数平均句长
普通问法 476 17 28.0 词/句
+ ASD-STE100(80%) 373 33 11.3 词/句
中文提问 + STE100(80%) 590 63 9.4 词/句

文风变化的直观对比——普通回答里典型的 28 词嵌套从句:

// 普通回答(28 词长句,信息密度高但需要回读)
For every input token embedding x_i, the model learns three vectors
which are then projected through learned matrices to produce queries,
keys and values that determine how attention is computed downstream.

// STE100 回答(一句一动作)
For each input token, the model makes three vectors.
Query (Q): Information that the token looks for.
Key (K): Information that identifies the token.
Value (V): Information that the token can supply.

实验结论:Karpathy 说的"字数砍半"没有完整复现(本轮只降 22%),但可读性的核心指标——句长——降了 60%。这套方法的真实机制是短句化,不是砍字数。

进阶:四级输出阶梯

Karpathy 的完整框架是按「预渲染程度」逐级升级输出形态——每升一级,模型替你做的排版和可视化工作就多一分:

L1 · 文字

  • 提示词加 ASD-STE100 约束
  • 短句、主动语态、一句一动作
  • 适合:技术解释、排查步骤

L2 · 图

  • 提示词加 "create a diagram"
  • 流程图、架构图、对比图
  • 适合:复杂概念、系统关系

L3 · 网页

  • 提示词加 "output in HTML"
  • 可交互网页,可保存可分享
  • 适合:演示、原型、沉淀文档

L4 · 视频

  • "生成 3Blue1Brown 风格讲解片"
  • 当前最不稳的一级,需要专门 pipeline
  • 适合:教学、对外传播

边界:别过度神化

场景是否适用原因
省 token / 降 API 费 ✗ 无效 总词数基本不降,省的是阅读时间不是费用
创意写作 / 方案讨论 ✗ 反效果 受控英语会把 nuance 压平,开放讨论需要丰富表达
中文回答 △ 部分迁移 短句/主动语态有效;900 词词典是英语概念,不适用
技术解释 / 操作指引 ✓ 显著 句长降 60%,一句一动作,可读性明显提升
结构化输出收敛 ✓ 显著 输出格式稳定无歧义,利于下游解析
⚠️ 第 4 级的现实 3Blue1Brown 风格视频无法靠一句提示词产出,需要完整的渲染 pipeline(动画引擎 + 配音 + 合成)。单靠 LLM 对话框,稳定停留在 L2–L3。

落地:维修工单场景的意外契合

对现场故障智能(Field Failure Intelligence)pipeline 而言,这套方法有一个天然落点:LLM 从工单中提取结构化字段之后,生成故障排查建议的环节。

🛫 一句话总结

提示词里加一句 用 ASD-STE100 风格回答(80% 达标即可)——
省的不是 token,是读它的人的时间。