Karpathy用40年前航空规范治AI废话
AI 常被批评“爱说废话”。Karpathy 为此分享了一组让大模型输出更易理解的技巧,核心方法出人意料:借用一套 40 年前的航空写作规范。
上世纪 70 年代,欧洲航空业为让不同语言背景的技术人员准确理解英文维修手册,开始主动限制英语,后发展为 ASD-STE100。最新 Issue 9 包含 53 条写作规则、约 900 个批准基础词,以及约 1200 个建议避免并附替代表达的词。规则很朴素:程序性指令尽量控制在 20 词以内;一句只安排一个操作;尽量用主动语态;同一概念从头到尾只用同一个名字。大模型常为语言“丰富”而频繁换同义词,反而造成阅读障碍;ASD-STE100 则相反,不追求词汇变化,能叫一个名字就一直叫。

Karpathy 发现,把这套规范交给 LLM 后,输出会更清晰易读。但他并不要求模型严格执行整本航空规范,有时只要求做到“80% 的 ASD-STE100”,因为完整版为专业技术文档设计,日常全盘执行会显得僵硬。
他的第二个建议是:能画图就别全写成字,直接让模型生成 diagram 或 image。图示能帮助读者组织信息,即使只服务一个人、用完即弃也划算。更好的形式是网页,让模型“用 HTML 输出”。随着代码模型更擅长前端,答案可以不再是静态内容,而是带布局、动画甚至交互的页面。比如解释神经网络学习率,网页可直接放滑块,用户改变学习率,看小球实时改变下降轨迹。此时模型不只是“解释”,而是临时做了一个帮助理解的小工具。评论区还补充:数学和技术内容可要求 Agent 用 TeX 输出 PDF 技术报告,公式、代码、图表和示意图排版更合适。

Karpathy 目前最看好的形式,是为任何主题生成完全定制的讲解视频。他给出具体案例:让模型“制作一段 3b1b 风格的视频解释”,再接入 ElevenLabs API 生成旁白;没有 API,也可让模型寻找本地免费替代方案。3b1b 即 3Blue1Brown,特点是用程序化动画把抽象概念一步步“演”出来并配合讲解。
这些技巧都着眼于把模型已完成的工作,重新变成人更容易理解的东西。Karpathy 判断,随着 LLM 越来越强,越来越多具体工作会被模型自主完成,人的工作继续向上移动,更多变成监督、检查和理解。AI 也可继续帮助人完成这部分工作。当智能和代码越来越便宜,已可为一个非常具体的问题,临时生成过去根本不值得专门制作的东西。他称之为:large, custom, discardable software artifacts,即大型、定制、用完就可丢掉的软件产物。

Karpathy 发出建议后,Tibo 马上实测:只给一个简单任务“解释一下 Shazam 是怎么工作的”,模型便生成了一段专门讲解其原理的视频。有人试用后觉得效果意外明显,尤其面对较复杂的 HTML Artifact,加入 ASD-STE100 式约束后信息结构更清楚。但也有人把普通回答与 ASD-STE100 版本比较,结论是“好像也没什么区别”。这并不奇怪:简单问题原本只需几句话,再套规范也难有大变化。该规范更适合长技术解释、多步骤操作或不同 Agent 之间传递的信息,内容越复杂越容易看到效果。
还有网友发现,整套规则直接搬来仍可能太严格,更好方法是挑出适合自己场景的部分。于是有人让模型随机抽取过去一周十段交互,用 ASD-STE100 逐条检查:哪些回答不够清楚?哪里产生不必要歧义?应用某条规则是否更易理解?最后把真正有效的规则写进用户级 AGENTS.md。
事实上,三个月前已有人把 ASD-STE100 做成开源 Skill,用于 tool description、error message、Agent 间指令、system prompt 等场景,并分出两种模式:Strict 适合程序步骤、工具描述、Agent 间指令等误读成本更高的内容;STE-flavored 更适合 README、解释性文本等普通场景,保留句长、主动表达、结构清晰等原则,但不完全锁死词汇。这很像把 Karpathy 那句“80% 的 ASD-STE100”进一步产品化。有开发者还做了可立即使用的 Claude Skill,并把代码放上 GitHub。
更多推荐阅读

Mistral发布1T参数大胖猫模型,激活仅49B
今天早些时候,美国开源了 glm5.2 级别的模型。随后,欧洲的 Mistral 发布了 Mistral Large 4,又名 Le Chonk 大胖猫。 该模型总参数 1.05T,每次只激活 49B,另带一个 1.6B 的视觉编码器。它采用细粒度混合专家(MoE)结构,模型拆成很多“专家”,每处理一个词只叫醒其中一小部分,因此 1T 模型每算一个词的开销接近 49B 模型。原生多模态,能读文字...
2026-10-07
xAI联创宣判:数学两千年英雄时代落幕
两千多年来,人类最聪明的大脑一直在攀登数学这片山脉。从欧几里得到怀尔斯,每征服一座山峰都要赌上一生。但xAI联合创始人Christian Szegedy认为,这个属于数学的英雄时代正在结束。 Szegedy在长文《数学何去何从?》中,将数学家比作丛林里徒手攀岩的探险家,AI则是一架飞机,已把旗插上没人爬过的山顶。孤独攀登者的时代正在结束,测绘整片大陆的时代正在开启。 Szegedy少年时在匈牙...
2026-10-06
OpenAI疯狂28天首日:模型提速50%却遭评论区翻车
Codex负责人Tibo宣布启动“疯狂28天”计划:未来28天每天要么交付一项Codex/Work改进,要么进行一次完整额度重置。第一天,Tibo宣布GPT-6 Astra和GPT-6.1 Sol默认推理速度提升约50%,达到50TPS,覆盖官方订阅及Sign in with ChatGPT接入的第三方生态。 但评论区几乎无人关注提速,满屏冷嘲热讽。此前9月29日GPT-6.1 Sol上线后因负...
2026-10-06
AI研究员为何计划逃离湾区买地避难
一些Anthropic最期的员工,最近开始考虑在美国偏远地区买地。他们想过,如果AI真的失控,那里或许可以成为避难的地方。 “一切再也无法平静如初。”一些研究员的电脑上贴着同一句话。 事实上,逃离的念头并非突然出现。十多年来,一群聚集在旧金山湾区的AI安全研究人员,一直在讨论AI失控之后可能发生什么。那时候,Anthropic甚至还没有成立。 有人在伯克利设立共享办公空间,在私人Slack频...
2026-10-06
英伟达押注的Reflection开源新模型对标智谱
英伟达投资的 Reflection 发布首个开源模型 Beam,对标智谱 GLM-5.2。官方称两者在高级推理测试上分数相当,Beam 推理算力仅需后者的三分之一到四分之一。彭博和金融时报称其为美国在开源模型领域对中国的反击。但 Beam 与国内其他头部开源模型如 Qwen3.8、GLM5.3、Kimi K3、DSV4F 仍有差距。 Reflection 由谷歌 DeepMind 两位研究员 M...
2026-10-06
把35个判断交给内核:这个开源项目拿下黑客松总冠军
在进化酒馆黑客松深圳收官之战中,项目 mu(μ)获得全场冠军。它将 Jev 深度融合进 Harness,试图解决 Agent 把工具、日志、技能、上下文全部交给大模型导致效率低、Token 浪费的问题。 mu 建立在开源 Coding Agent pi 之上,主要改造模型外的 Harness,设计了 35 个判定点,覆盖用户输入、工具调用、上下文管理、任务完成判断和多 Agent 通信等环节。例...
2026-10-06