AI 降低了生产成本,但没有自动降低验证成本
本文整理自 Scott Cunningham 的 Substack 文章 Claude Code 56: Falling marginal costs of production, output, and aggregate errors。原文讨论 AI 编程与研究代理正在改变知识生产的成本结构,以及这可能给科学记录带来的系统性风险。
一句话概括
AI 让论文、代码、数据分析等认知产出的边际生产成本快速下降,但验证成本没有同步下降;如果我们只扩大产出、不重建验证机制,最终增加的可能不是“更可靠的知识”,而是更多难以及时发现的总错误。
生产变便宜了,验证没有
这篇文章的核心不是“AI 会不会犯错”这种老问题,而是一个更结构性的变化:AI 正在改变知识工作的生产函数。
过去,一个研究者要完成一项数据分析,通常需要自己清洗数据、写代码、调模型、处理异常、解释结果。这个过程很慢,但它有一个副作用:研究者会在执行中形成质量直觉。
哪些数据字段可疑,哪些回归结果不稳定,哪些代码路径容易出错,哪些图表看起来太顺滑——这些判断往往不是从规范文档里学来的,而是在反复动手中积累出来的。
AI 代理出现后,很多执行环节可以被机器时间替代。你描述目标,模型生成代码、跑分析、整理输出,甚至写出一份结构完整的报告。认知产出的边际成本因此被大幅压低。
但问题在于:生产环节可以被替代,验证直觉却不一定能被等价替代。
为什么“亲手做过”很重要
作者借用了 Polanyi’s Paradox,也就是“我们知道的东西多于我们能说清楚的东西”。很多专业判断属于默会知识:它不一定能被完全写成规则,但会影响我们对结果的警觉性。
这也是作者用高级餐厅做类比的原因。
一家顶级餐厅的创始人未必每天亲自下厨,但餐厅背后有完整团队、流程和质量控制。创始人能管理这种系统,通常也来自长期的实作经验和品控训练。
问题是,普通研究者用 AI 时,往往不是在一个成熟厨房里调用团队,而是直接跳过“揉面、试味、翻车、修正”的阶段,把产出交给模型完成。
这会造成一种断裂:
- 产出越来越容易;
- 亲手执行越来越少;
- 对错误的身体感、直觉和警觉性越来越弱;
- 结果看起来更完整,但未必更可靠。
总错误可能上升,不是因为单次错误率一定更高
文章里最值得分享的观点,是“aggregate errors”这个概念。
很多关于 AI 的讨论会盯着单次输出的准确率:模型这次有没有写错代码?有没有引用不存在的论文?有没有误解数据?
但作者关注的是总量问题。
如果 AI 把一项工作的成本从很高降到接近于零,那么人们不只是更快完成原本会做的工作,还会开始做大量原本不会启动的工作。
也就是说,产出规模会扩张。
即便单个 AI 任务的错误率并不夸张,只要总产出暴涨,而验证机制没有同步扩张,错误的总数仍然可能上升。
作者用汽车安全做类比:汽车变得更安全,并不自动意味着事故总量同比下降,因为人们可能开得更多、更远、更冒险。AI 产出也是类似结构:单次生产更便宜,会改变人的行为边界。
对 AI 工作流的真正提醒
这篇文章对 AI 编程、研究代理、自动化分析工具都有一个直接提醒:我们不能只问“AI 能不能帮我做更多”,还要问“我如何知道它做对了”。
更具体地说,未来的重点不只是继续降低生产成本,而是重建验证机制:
- 哪些任务可以让 AI 全自动完成?
- 哪些任务必须保留人工抽检?
- 哪些结论需要独立复算?
- 哪些输出必须附带来源、假设和可追溯证据?
- 哪些高影响决策不能只依赖一轮模型输出?
如果没有这些问题,AI 很容易把“低成本生产”变成“低成本制造不确定性”。
我自己的理解
我认为这篇文章最有价值的地方,是它没有停留在“AI 幻觉”这种表层批评,而是把问题放到了生产系统里看。
AI 的危险不一定来自某一次回答离谱,而可能来自一种更隐蔽的机制:它让我们生产太容易、太快、太多,以至于验证能力被产出规模反向淹没。
这对个人开发者、研究者和团队都有现实意义。
真正成熟的 AI 工作流,不应该只追求“一个人指挥十个 agent 同时干活”,还应该配套:任务边界、测试、审查、回滚、抽样复核、独立验证和成本/质量门槛。
否则,AI 带来的不是知识生产效率革命,而是错误生产效率革命。
结尾
AI 降低了生产的边际成本,这是确定的趋势。
但验证成本不会自动消失。
下一阶段真正稀缺的能力,可能不是“会不会用 AI 生成更多东西”,而是“能不能在产出爆炸之后,仍然知道哪些东西可信”。
这也是这篇文章最值得带走的一句话:不要只扩张生产系统,也要同步扩张验证系统。