全部内容,一页写完。

这一页写给会从头读到尾的人 —— 领域里的专家,或者被要求「找出这东西哪里不对」的 AI。这里没有为了制造好奇而保留的东西。缺的地方是因为还没被证明,而且我会直接说它缺。

01

这是什么

NCT 是一套工程控制系统。它待在 AI 辅助开发的下面,随时保证一个问题有答案:这个项目现在到底什么是真的。不是 AI 报告了什么,不是计划书写了什么,而是什么是真的 —— 并且证据能活过产生它的那次会话。

02

它是为哪一种失败而存在的

这是它针对的那条可复现的链条:

  • 开发者要的是 A。
  • AI 理解成 B。
  • AI 按 B 实现,围绕 B 写测试,测试全绿。
  • AI 报告「完成」。
  • 而要的是 A。

代码是对的,测试是绿的,报告是完整的。三样东西互相自洽,三样一起偏离了原意。这不是模型不够聪明,这是概率系统的固有行为。换一代更强的模型,它只会更有说服力地偏离。

03

为什么再加一个 AI 解决不了

控制论的必要多样性定律:一个系统要控制另一个系统,控制者的多样性必须覆盖被控者。两个概率系统互相检查,只是提高了发现错误的概率,结构没有变 —— 依然没有一个确定的参照物可以比对。

模型越强,底下那层越不能弱。

模型越强,它提的方案越复杂、碰的面越广、说得越像真的。可观测、约束、授权、恢复必须同步跟上,否则控制关系就断了。这是整个产品的承重论证。它错了,产品就错了。

04

一切都压在这几条区分上

下面每一行,都是大多数系统把两件不同的事塞进同一个字段的地方。每一次合并,都是事后没人能证明是哪一个的地方。

  • AI 自我声明 ≠ 验收
  • 许可 ≠ 授权 ≠ 人类关口
  • 实际 ≠ 已批准
  • 预测 ≠ 事实
  • 偏离 ≠ 违规
  • 没有测量 ≠ 测出来是零
  • 部分完成 ≠ 成功
  • 唯一真相 —— 不存在第二个版本
05

现状:已证明、已主张、未测量

分成三栏,因为把它们混在一起,正是这个产品要防的那种失败。

已证明
  • 系统正在治理它自己的开发。创始人是第一个被治理的人,而且它接得住他。
  • 一家客户同意为业务系统支付一万美元,并在成品还不存在时先付了六千美元现金,另加硬件与每月 AI 工具费。没有书面合同;口头约定是用现金兑现的。
  • 一家有十余年经营史的企业,提供了近五年的真实运营数据用于开发和测试。
  • 已公开一条脱敏案例:一次 22/22 的完成声明被复核为 20/22 并拒绝升级,当时没有任何人在看。
已主张,尚未被外部验证
  • 创始人以外的工程团队,能不能得到同样的收益。
  • 当有资历的人要求豁免时,验收纪律扛不扛得住组织压力。
  • 这位客户的行业引荐能否带来更多客户。目前还没有一笔引荐产生营收,商业条件也尚未确定。
未测量
  • 新用户从安装到产生价值需要多久。
  • 团队环境下对缺陷逃逸率的影响。
  • 执行这套纪律的成本,与它避免的事故成本之比。

没有测量过的量,在这个网站上、在产品里,都不会被写成零。

06

这个洞察从哪来

十几年 IT 审计最高负责人 —— 那个永远事后到场的位置。任务是还原到底发生了什么。大多数时候还原不了:不是因为没有日志,是因为记录被有利益的人改过,或者当时根本没人记。后来 AI 把同一件事变成了毫秒级,量还大了一百倍。这个产品,就是那个位置变成的系统。

07

刻意不主张的事

  • 不主张已经找到产品市场契合。
  • 不主张已经完成规模化的生产验证。
  • 不主张拥有、训练或超越任何一个 AI 模型。
  • 上面说的出资不是营收,也不计入销售。
  • 在能够事实核验之前,不做点名的竞品比较。
08

什么能证明这是错的

下面是这套论证失败的条件。目前没有一条被推翻,一个诚实的评审应该四条都往死里压。

  • 如果模型可靠性提升得足够快,以至于自我声明变得可信 —— 那确定性控制就是多余的。
  • 如果交付速度在团队的账上压倒一切,以至于不出大事就没人为验收付钱。
  • 如果在位大厂做出「够用」的验收关口当作一个功能,而深度对买家并不重要。
  • 如果这套纪律只在执行者本来就信它的时候才成立 —— 那它是一种个性,不是一个系统。
09

还缺什么,以及什么能了结它

最大的那个洞我写在这里而不是藏起来:目前还没有创始人以外的工程团队,在真实工作里跑这套东西。那笔出资是真钱、来自真实业务,但那家企业买的是未来给自己用的系统 —— 它不能证明一个工程组织愿意为控制层付钱。

一个不属于创始人的工程团队,在真实工作里跑它,并且说得出它拦下了什么。

三到五个具体案例 —— AI 报了完成、测试全绿、系统拒绝验收,事后证明交付出去会出事 —— 比再加任何数量的架构说明都更能了结这件事。