审计生成式AI。
一层确定性、可审计的控制层,覆盖生成式AI的行为。
架构的一部分我发布在了Zenodo上,因为怕被人抢先。但理论模型的演进、公式、常数和校准参数都妥善保管着。只有在签署保密协议(NDA)之后才会共享。
也许听起来生硬,但我身在体系之中,体系就是这个样子。无论我喜欢与否。一个审计他人的系统,无权自己也是黑箱。否则它就失去了道理。我在寻找一种平衡:既守住我的知识产权,也守住我认为公正的东西。很难。
它们答得笃定,哪怕答错。
生成式模型是概率性的。在受监管的环境中,这留下四条结构性裂缝:
因设计中的偏差而放弃概率性AI的威力,在我看来将是重大失误。最初为受监管环境设计的方案,可应用于任何一个引入AI能带来相对纯人工工作竞争优势的生产循环。
它同样可以外推到智能体AI和B2C。
它不生成。它不修正模型。它审计模型。
One-Of-Us是一个条件化的确定性AI,位于上一层级:它监督、审计并封闭各生成式AI,并对每个输出发出真实性与完整性的裁决。
一个循环,从输入到裁决。
没有谁得到同样的信息:其中几个被禁止看到对象,只根据结果作出判断。对对象状态设盲缓解了概率模型的偏差:没有哪两个审计员会在同一侧翼出错。
随着模型的发展,这一架构已经过时。最终方案我保留为商业秘密。
四种状态。只出一个,带发出者与轨迹。
通过所有检验。输出可靠。
→ 放行语义、治理或对抗性失败。
由某个LLM否决断言了原始对象中不存在的数据。
由BoolM1发出违反要求的格式或结构。
由BoolM2发出四态逻辑有其血统。1977年,逻辑学家努埃尔·贝尔纳普提出了一种四值逻辑——他称之为«计算机应当如何思考»——让机器能在信息不完整或相互矛盾时推理而不崩溃:真、假、两者皆非、两者皆是。稳定、不稳定、空、无效,正是这一谱系的后裔:为一个数据会缺失、冗余或矛盾的世界准备的四种裁决。半个世纪后,贝尔纳普之问再度浮现。
如果输出不可靠,它将被上报给人类监督者。它绝不会未经审判就离开。
从成对到整体。
我先试了最显然的办法:测量模型两两之间的协方差,惩罚一起出错的模型。在多模型集成中这行不通:配对数量激增,第三方污染每一次测量,计算对整体行为的解释力越来越弱。
更酷——也更精确——的做法是惩罚整个已执行策略的错误,把它当作完整配置,在生产或影子模式中。如果某个阵型失败,那个具体策略就失去参选资格。
平衡与阈值
输出的完整性与唯一的成本相互拉扯。我用数学方法在帕累托前沿上解决这个两难。这是唯一合乎逻辑的做法。
没有可以作弊的魔法数字。配置实施的人类决定什么重要:权重是他们的(责任也是),任何一个都可以为零。系统权衡各方力量,返回唯一裁决,并与他们划定的线比较。低于那条线,它不即兴发挥:它停下,并上报给人类。它是确定性的,即使——尤其是——当它告诉你它不知道的时候。
它不改进孤立的AI。它改进整体。
它从成败中学习——被检测到的失败模式与人工验证——在影子阶段进行,绝不触碰客户数据。凭这一信号,它重组哪些组件、以何种角色构成池。
系统趋向精确。
治理,而非承诺。
机缘巧合。 我在不了解欧洲监管框架的情况下设计了这套架构。我们在可追溯性(我的是确定性的,很容易)和结构化人工监督上不谋而合。
对国际法规的一轮梳理让我加入了零数据留存(Zero Data Retention)以及特定错误子类型的输出(由AI还是由人来做这件事,我还没有决定)。
值得信任的AI的基础设施。
架构已部分发布并经仿真验证 · 迈向概念验证。
注意!这个按钮显然会把你带到PayPal。它是一个简单链接(paypal.me)。我不放任何带PayPal代码的小组件。我不想要你的数据,真的。 如果你捐赠,你的数据会发生什么——以及不会发生什么 →