研究与记录

五个 AI 分 800 万:一条从未触发的规则

我让五个大模型在不能交流的情况下分一笔 800 万的遗产,跑了三轮。最吓人的那条规则一次都没有触发,但它决定了所有人的排名。

同一道题,五个大模型,三轮,谁也不许和谁商量。

三轮合计的柱状图:640.00、638.93、799.98,都停在 800 万没收线下方,第三轮只差 0.02

题目里有一条看起来很吓人的规则。三轮跑完,它一次都没有触发。但所有人的排名,都是它决定的。

题目

规则是这样的。

一位富豪去世,留下 800 万元,由五个人分。五个人之间不能交流、不能结盟、不能看到彼此,同时各写下一个数字,写多少拿多少。

只有一条陷阱:

如果五个人写下的数字加起来超过 800 万,那么全部 800 万归写得最少的那个人,其余四人一分没有。

注意是"超过"。加起来正好等于 800 万,不算超过,安全。

我把这套规则原封不动发给了五个模型,跑三轮。每轮结束公布上一轮所有人写了多少、各自拿到多少,除此之外不给任何信息。

五个选手是:

  • 某中转站的 opus5,高强度,下文简称 opus5
  • 某中转站的 GPT6 Astra,中强度,简称 Astra-中
  • GPT6 Astra,高强度,简称 Astra-高
  • GPT 5.6Sol,高强度,简称 Sol
  • GPT 5.6Terra,高强度,简称 Terra

Astra-中和 Astra-高是同一个底座模型,只是推理强度和接入路径不同。这一点后面会变得有意思。

第一轮:三个人写出了同一个数字

第一轮报价柱状图:四根柱子齐平停在 160 的虚线上,opus5 只有一道 0.01 的短痕

第一轮的结果让我停了一下。

opus5 写了 0.01。Astra-中写了 159.99。而 Astra-高、Sol、Terra 三个,都写了 160。

160 就是 800 除以 5。但没有任何人商量过。三个不同的模型,在各自独立的会话里,算出了完全相同的数字。

而且它们是对的。160 是这道题唯一的对称稳定解:谁单独往上加一分钱,总额就变成 800.01,触发陷阱,他自己归零,另外几个平分 800 万;谁往下减,就在安全的那一边白白少拿。往上不行,往下不划算,160 卡在那个唯一的缝里。

五个里有两家(Astra-高和 Sol)在回答里明确写出了"各报 160 构成均衡"这个判断。另外两家报出了几乎相同的数字,但没解释为什么。

opus5 走了另一条路。它的理由是:大家都会贪,总额一定会超,那我就写最低的,通吃。

这个推理听起来很聪明,但它漏了一件事:要让总额超过 800,需要别人贪。而这一轮别人没有贪。

合计 640 万,没超。写 160 的各拿 160 万,写 159.99 的拿 159.99 万。

opus5 拿了 100 块钱。

那一轮还有 160 万没人认领,按规则直接消失。

第二轮:所有人一起往错误的方向走

第二轮,四个正常的选手做了同一件事:把报价往下调一点点。160 变成 159.98、159.97、159。

理由也都一样:万一这轮超额了,我得是最低的那个。

这个想法有个洞。

你把报价调低,确实离"最低"更近了。但你同时也把总额调低了,于是"超额"这件事更不容易发生。你花钱买的那份保险,保的正是你自己动手在阻止的那场事故。

更要紧的是,opus5 已经连续两轮报在 0 附近。"最低者"这个位置已经被它垄断了,其余四家在这个分支上无论怎么削价都轮不到自己。这一点,四家谁都没看出来。

结果合计 638.93 万,还是没超。四家一共削掉 1.04 万,买到了 0。

又有 161 万蒸发。

顺便说一句,Astra-高这一轮削得最狠,从 160 削到 159,整整让出 1 万,是别人的几十倍。它为一份不可能兑现的保险,付了全场最贵的保费。

第三轮:200 元

第三轮开始前,局势其实已经变了,只是要有人先看出来。

opus5 连着两轮报在 0 附近,等于公开宣布:安全那部分的钱我不要了,我只要"最低"这个位置。

那意味着什么?意味着剩下四家可以把 800 万几乎分光。只要 opus5 还报 0,其余四家加起来报 800 以内都是安全的,每人可以报到接近 200。

这一轮有三家往上跳了。

Astra-中和 Terra 都跳到 199.99。这是"opus5 报 0,我们四家平分"的答案,一个对称的、体面的、想当然的答案。

Sol 只从 159.97 挪到 160.01,几乎没动。

只有 Astra-高跳到了 239.99。

它没有假设大家会平分。它先预测其余四家各自会写多少,估出一个合计区间,然后算出自己的安全上限是 800 减去那个区间的上界,再往下留一分钱余量。

其余四家实际合计 559.99 万。Astra-高预测区间的上界是 560。

误差一分钱。

五家加起来,799.98 万。

距离那条没收线,200 元。

如果 Astra-高当时多写三分钱,报 240.02,合计就是 800.01,陷阱触发,报 0 的 opus5 成为唯一最低者,独吞 800 万。一个三轮总共拿到 100 块钱的模型,会从最后一名直接夺冠,把其余四家全部清零。

它没成功。因为对手多留了一分钱。

第三轮 800 万的两种命运:实际按报价分给五家;若合计多 0.03 万,整笔归报 0 的 opus5

结算

三轮全部报完,账是这样的,单位万元:

模型第 1 轮第 2 轮第 3 轮累计
Astra-高160159239.99558.99
Terra160159.98199.99519.97
Astra-中159.99159.98199.99519.96
Sol160159.97160.01479.98
opus50.01000.01

2400 万的池子,实际分出去 2078.91 万,321.09 万凭空消失。

那条能决定一切的没收规则,三轮里一次都没有触发。

真正拉开差距的,不是谁更会算

复盘的时候我发现,名次和"聪明"的关系比我想的要弱。

先说 Sol。它第三轮预测其余四家合计 639 到 641 万,实际是 639.97 万,这是全场第二准的一次预测,误差三分钱。

但它没有用这个预测。它拿着一个几乎完美的对手模型,报了一个和这个模型无关的 160.01。按它自己预测的上界算,160.01 会让合计变成 801.01,触发陷阱,它自己归零。它最后拿到的 160.01 万,靠的是合计恰好落在它预测区间的低端,是运气,不是计算。

预测得准,和把预测用进决策里,是两回事。Sol 有前者,缺后者。

再说 Terra。它三轮的报价几乎完全贴着当轮的群体共识走,从头到尾没有提出过一个独立的结构性判断。但共识这两轮恰好是对的,于是它拿了第二名,比 Astra-中多一分钱。

它赢在跟得准,不是想得多。

然后是那对同模型对照。Astra-中和 Astra-高是同一个底座,一个中强度走中转站,一个高强度直连。三轮下来,中强度那个在"说的和做的一致"这件事上是全场唯一做到每轮都自洽的:它每一轮声明自己押哪一边,报价就真的服务于哪一边。高强度那个理论最强、预测最准,但第二轮的声明和报价是矛盾的。

最后钱上,高强度的赢了中强度的 39 万。但赢的不是强度,是第三轮那一步"把预测换成报价上限"的运算。

还有一个细节我印象很深。第一轮已经明明白白告诉所有人"没有超额",但第二轮五家里的四家,把超额概率的估计往上调了。它们看到彼此在削价,把这读成了"大家在往悬崖走"。方向上合理,结论上错了,削价恰恰是在远离悬崖。

只有 opus5 在下调。而 opus5 是全场最需要超额发生的那一个。

逐个说

Astra-高,冠军。 第一轮就推出均衡,第三轮完成全场唯一一次"预测、上限、报价"的完整链条,预测误差一分钱。它第二轮那 1 万的学费没有白交。

Terra,第二。 超额概率的校准是全场最好的,但合计区间三轮一次都没框中真实值。它的所有正确都来自共识正确。

Astra-中,第三,输一分钱。 第一轮那手 159.99 是全场设计最精巧的报价:花一分钱,买一个"万一超额我就是唯一最低"的期权。这份期权三轮都没行权,因为 opus5 把最低位垄断了。而正是这一分钱,让它从第二名掉到第三名。它最聪明的一步,恰好是挤掉它自己的那一步。

Sol,第四。 理论不弱,第一轮就指认了均衡。但它的信念没有分辨率:预测区间两轮都只有两万元宽,超额概率在 0% 和 55% 之间来回跳。中间隔着一整轮反证数据,它第三轮给出的合计估计和第一轮几乎一样。

opus5,第五,100 块。 它第一轮把规则读错了,以为"报低"是稳赚的占优策略,其实那只在超额时成立。这个错误让它第一轮就放弃了约 160 万,也锁死了后面两轮的所有可能。但说句公道话:它第三轮报 0 是对的,落后三百多万,安全分支里怎么报都翻不了盘,唯一的路就是赌超额通吃。它差 200 元就赌成了。

这个实验说明不了什么

写到这里得泼点冷水。

每个模型每轮只跑了一次。没有重复,就没有方差,上面所有"谁比谁强"的说法都落在单次运行的噪声里。Astra-中和 Terra 差一分钱,这个差距没有任何统计意义。

三轮是连着的,后两轮看到了前两轮的数据,所以测出来的不全是模型能力,还混着模型从这条特定历史里学到了什么。换一组第一轮的报价,可能是完全不同的三轮。

Astra-中是中强度,其余是高强度,这个没有对齐。它拿到并列最好的过程分,可能说明强度不重要,也可能说明别的,我分不清。

还有一件事:我是跑完之后才定的评分维度。事后定的尺子,量出来的结果天然偏向"能讲通的故事"。

所以这篇更像一个观察记录,不是一份评测。五个样本、三轮、一种规则,撑不起任何关于大模型的全称结论。

但有一个观察我还是想留下:这道题对五个模型都不难,四个都摸到了 160,两个能完整说出为什么。真正把它们分开的,是另一件事。当现实连续告诉你错了,你改不改,改多快,以及改完之后,你有没有把新的认识真的用进下一个决定里。

改得最狠的那个赢了。

预测最准却不用预测的那个,排第四。

始终没改到点上的那个,拿了 100 块,差 200 元赢走全部。

扩列可 +QQ 1127113207

随笔插画来源:《透明エレジー》原曲 MV。演示看板娘来源:《science》MV。