ooU  one-of-us
架构

审计生成式AI。

一层确定性、可审计的控制层,覆盖生成式AI的行为。

架构的一部分我发布在了Zenodo上,因为怕被人抢先。但理论模型的演进、公式、常数和校准参数都妥善保管着。只有在签署保密协议(NDA)之后才会共享。

也许听起来生硬,但我身在体系之中,体系就是这个样子。无论我喜欢与否。一个审计他人的系统,无权自己也是黑箱。否则它就失去了道理。我在寻找一种平衡:既守住我的知识产权,也守住我认为公正的东西。很难。

DOI 10.5281/zenodo.20343912 · Zenodo · CC BY 4.0


01 — 问题

它们答得笃定,哪怕答错。

生成式模型是概率性的。在受监管的环境中,这留下四条结构性裂缝:

幻觉非确定性静默漂移零可追溯

因设计中的偏差而放弃概率性AI的威力,在我看来将是重大失误。最初为受监管环境设计的方案,可应用于任何一个引入AI能带来相对纯人工工作竞争优势的生产循环。

它同样可以外推到智能体AI和B2C。


02 — 论点

它不生成。它不修正模型。它审计模型。

One-Of-Us是一个条件化的确定性AI,位于上一层级:它监督、审计并封闭各生成式AI,并对每个输出发出真实性与完整性的裁决

生成式AI
— 输出 →
ONE-OF-US · 确定性审计
— 裁决 →
知情决策

03 — 对象的旅程

一个循环,从输入到裁决。

输入客户对象需要被治理的AI输出
分类类型 · 临界度它是什么、有多重要(T, K)
SDE策略选择器选择激活哪些组件
04 · 执行池 — 四名强制审计员
LLM1主执行器
LLM4₁对抗性审计员
BoolM1对象在场性
BoolM2格式与结构

没有谁得到同样的信息:其中几个被禁止看到对象,只根据结果作出判断。对对象状态设盲缓解了概率模型的偏差:没有哪两个审计员会在同一侧翼出错。

随着模型的发展,这一架构已经过时。最终方案我保留为商业秘密。


04 — 裁决

四种状态。只出一个,带发出者与轨迹。

稳定

通过所有检验。输出可靠。

→ 放行
不稳定

语义、治理或对抗性失败。

由某个LLM否决

断言了原始对象中不存在的数据。

由BoolM1发出
无效

违反要求的格式或结构。

由BoolM2发出

四态逻辑有其血统。1977年,逻辑学家努埃尔·贝尔纳普提出了一种四值逻辑——他称之为«计算机应当如何思考»——让机器能在信息不完整或相互矛盾时推理而不崩溃:真、假、两者皆非两者皆是。稳定、不稳定、空、无效,正是这一谱系的后裔:为一个数据会缺失、冗余或矛盾的世界准备的四种裁决。半个世纪后,贝尔纳普之问再度浮现。

如果输出不可靠,它将被上报给人类监督者它绝不会未经审判就离开。


05 — 共享的谎言

从成对到整体。

我先试了最显然的办法:测量模型两两之间的协方差,惩罚一起出错的模型。在多模型集成中这行不通:配对数量激增,第三方污染每一次测量,计算对整体行为的解释力越来越弱。

两两协方差 M1 M2 M3 M4 ✗ 配对激增,整体丢失 已执行策略 M1 M2 M3 M4 对整体只施加一次错误惩罚 ✓ 在生产或影子模式中 ✓ 阵型失败即失去资格

更酷——也更精确——的做法是惩罚整个已执行策略的错误,把它当作完整配置,在生产或影子模式中。如果某个阵型失败,那个具体策略就失去参选资格。


06 — 帕累托最优

平衡与阈值

输出的完整性与唯一的成本相互拉扯。我用数学方法在帕累托前沿上解决这个两难。这是唯一合乎逻辑的做法。

One-Of-Us成本 → (产品实施与开发) 输出完整性 → 帕累托前沿 他们划定的线 · 阈值 线上:输出放行 线下:不即兴发挥 — 停下并通知人类专家

没有可以作弊的魔法数字。配置实施的人类决定什么重要:权重是他们的(责任也是),任何一个都可以为零。系统权衡各方力量,返回唯一裁决,并与他们划定的线比较。低于那条线,它不即兴发挥:它停下,并上报给人类。它是确定性的,即使——尤其是——当它告诉你它不知道的时候。


07 — 学习并趋向精确

它不改进孤立的AI。它改进整体。

它从成败中学习——被检测到的失败模式人工验证——在影子阶段进行,绝不触碰客户数据。凭这一信号,它重组哪些组件、以何种角色构成池。

系统趋向精确。

人工干预循环 → 精确 One-Of-Us放行的输出 无限接近。永不相触。

08 — 规范

治理,而非承诺。

机缘巧合。 我在不了解欧洲监管框架的情况下设计了这套架构。我们在可追溯性(我的是确定性的,很容易)和结构化人工监督上不谋而合。

对国际法规的一轮梳理让我加入了零数据留存(Zero Data Retention)以及特定错误子类型的输出(由AI还是由人来做这件事,我还没有决定)。

可追溯、可复现每循环一个原子标识符;事后复现
原因由人类裁断从测量到行动的路径上绝无另一个AI
零数据留存客户对象在循环关闭时清除
以DOI发布开放存缴,CC BY 4.0 · 现有技术

值得信任的AI的基础设施。

架构已部分发布并经仿真验证 · 迈向概念验证。

我想出一份力……也想知道它是否有效。

注意!这个按钮显然会把你带到PayPal。它是一个简单链接(paypal.me)。我不放任何带PayPal代码的小组件。我不想要你的数据,真的。 如果你捐赠,你的数据会发生什么——以及不会发生什么 →