ooU  one-of-us
挑战

对人工谬误的方法性怀疑


1 — 欺骗

“对齐”只是讨好偏差的委婉说法。而反奉承偏差同样会使输出变形。

我没有让AI变得更聪明。我不会。结构性缺陷也不是靠恳求就能修复的。我接受了这个缺陷,并绕过了它:我从外部治理它。


2 — 引擎

对人工谬误的批判,或者说:如何把责任推给机器。

One-Of-Us有一个确定性引擎——动态策略选择器,它借力打力(那些诱人的偏差),服务于回答的质量。

平衡与阈值

输出的完整性与唯一的成本相互拉扯。我用数学方法在帕累托前沿上解决这个两难。这是唯一合乎逻辑的做法。

没有可以作弊的魔法数字。配置实施的人类决定什么重要:权重是他们的(责任也是),任何一个都可以为零。系统权衡各方力量,返回唯一裁决,并与他们划定的线比较。低于那条线,它不即兴发挥:它停下,并上报给人类。它是确定性的,即使——尤其是——当它告诉你它不知道的时候。

而几乎没有人看到的是:两个或更多模型意见一致,并不构成确认性裁决。想想吧,它们共享数据集和商业目标。所以我惩罚相关性错误,并在它们答对时给它们更多流量。但它们始终对所处理对象的状态是盲的。

策略激活向量中的某些组件甚至无法访问输入——只能访问中间输出和一张版本化的治理表,我们通过它把“现实”注入全局推理。

赤裸裸的事实:多数派并不总是对的。

查看完整架构 →


3 — 规范

机缘巧合。

我在不了解欧洲监管框架的情况下设计了这套架构。我们在可追溯性(我的是确定性的,很容易)和结构化人工监督上不谋而合。

对国际法规的一轮梳理让我加入了零数据留存(Zero Data Retention)以及特定错误子类型的输出(由AI还是由人来做这件事,我还没有决定)。


召唤

对此,你想做点什么?

这是最诚实的部分。我为此思考了多年,架构已经在手——但我是独立研究者。系统已作为现有技术(prior art)发布在Zenodo上,CC BY 4.0:去读它、引用它、反驳它。文献信息在本页页脚。

如果事实证明这件事大于一个人,我不会用“我们”自称,也不会假装不是这样。我在寻找一位有实力的技术或战略伙伴。

如果你和我一样怀疑 — 说点什么