起源:航空业的受控英语
ASD-STE100(Simplified Technical English)是 1986 年欧洲航空业为飞机维修手册制定的受控英语规范。它的设计目标只有一个:让全球母语不同的机械师读同一本手册时,零歧义。
核心规则:
- 一个词只允许一个意思——"enter" 只表示进入,不表示填写表格
- 句子不超过 20 词,一句只说一个动作
- 只用主动语态,禁用被动句和嵌套从句
- 批准词典约 900 词,技术名词有受控写法
关键洞察 这套规范在航空维修领域执行了近四十年,产生了海量高质量文本。大模型训练语料里浸透了这种「一句一动作」的文风——所以一个术语就能唤起它。
用法:一句话调出
Karpathy 发现大模型早已吃透这套规范。提示词里只需加一句:
# 标准版——输出会很"硬" 用 ASD-STE100 解释 <技术概念> # 松弛版——保留规范但允许自然表达(推荐) 用 ASD-STE100 风格回答,做到 80% 即可 # 中文提问同样生效 讲解 <技术概念>,用 ASD-STE100 简化技术英语规则回答(80% 达标即可)
"做到 80%" 这个松弛度是必要的:完整 STE100 会把术语表也压掉,伤害内容质量;80% 只保留短句、主动语态、一句一动作这些真正改善可读性的部分。
实测:A/B 对照实验
不空谈,直接跑。同一道问题("Explain how a transformer's attention mechanism works"),temperature=0.3,只改提示词:
| 提示词 | 总词数 | 句子数 | 平均句长 |
|---|---|---|---|
| 普通问法 | 476 | 17 | 28.0 词/句 |
| + ASD-STE100(80%) | 373 | 33 | 11.3 词/句 |
| 中文提问 + STE100(80%) | 590 | 63 | 9.4 词/句 |
文风变化的直观对比——普通回答里典型的 28 词嵌套从句:
// 普通回答(28 词长句,信息密度高但需要回读) For every input token embedding x_i, the model learns three vectors which are then projected through learned matrices to produce queries, keys and values that determine how attention is computed downstream. // STE100 回答(一句一动作) For each input token, the model makes three vectors. Query (Q): Information that the token looks for. Key (K): Information that identifies the token. Value (V): Information that the token can supply.
实验结论:Karpathy 说的"字数砍半"没有完整复现(本轮只降 22%),但可读性的核心指标——句长——降了 60%。这套方法的真实机制是短句化,不是砍字数。
进阶:四级输出阶梯
Karpathy 的完整框架是按「预渲染程度」逐级升级输出形态——每升一级,模型替你做的排版和可视化工作就多一分:
L1 · 文字
- 提示词加 ASD-STE100 约束
- 短句、主动语态、一句一动作
- 适合:技术解释、排查步骤
L2 · 图
- 提示词加 "create a diagram"
- 流程图、架构图、对比图
- 适合:复杂概念、系统关系
L3 · 网页
- 提示词加 "output in HTML"
- 可交互网页,可保存可分享
- 适合:演示、原型、沉淀文档
L4 · 视频
- "生成 3Blue1Brown 风格讲解片"
- 当前最不稳的一级,需要专门 pipeline
- 适合:教学、对外传播
边界:别过度神化
| 场景 | 是否适用 | 原因 |
|---|---|---|
| 省 token / 降 API 费 | ✗ 无效 | 总词数基本不降,省的是阅读时间不是费用 |
| 创意写作 / 方案讨论 | ✗ 反效果 | 受控英语会把 nuance 压平,开放讨论需要丰富表达 |
| 中文回答 | △ 部分迁移 | 短句/主动语态有效;900 词词典是英语概念,不适用 |
| 技术解释 / 操作指引 | ✓ 显著 | 句长降 60%,一句一动作,可读性明显提升 |
| 结构化输出收敛 | ✓ 显著 | 输出格式稳定无歧义,利于下游解析 |
⚠️ 第 4 级的现实 3Blue1Brown 风格视频无法靠一句提示词产出,需要完整的渲染 pipeline(动画引擎 + 配音 + 合成)。单靠 LLM 对话框,稳定停留在 L2–L3。
落地:维修工单场景的意外契合
对现场故障智能(Field Failure Intelligence)pipeline 而言,这套方法有一个天然落点:LLM 从工单中提取结构化字段之后,生成故障排查建议的环节。
- 输出收敛——LLM 只做语义层,树结构和概率 100% 来自 SQL 聚合;排查建议用 STE100 约束后格式稳定、无歧义,便于程序化校验
- 受众天然亲和——维修背景的工程师读维修手册腔的排查建议,零学习成本
- 一句一动作——排查步骤可直接映射为工单系统的 checklist 字段,而非自由文本
🛫 一句话总结
提示词里加一句 用 ASD-STE100 风格回答(80% 达标即可)——
省的不是 token,是读它的人的时间。