Published September 22, 2026 | Version v1

当判定层的自报字段说谎时:三类判断层的成本、延迟与失效边界实测

Authors/Creators

Description

本文是英文稿的完整中文译本。英文原文:Perry Link, "When a Judgment Layer's Self-Reported Fields Lie", 2026, DOI 10.5281/zenodo.22901853。

把长线任务中的判断工作交给一个廉价的、专用的判定模型,这一分工通常以「省钱」为卖点。本文在一个受控的三方对照上实测了这一说法,并给出四条主张(其中一条被自己的数据否定)。

**第一,成本不是约束。** 我们实测了三类判断层的单次成本:本地非自回归判定模型(Laya,边际成本 ≈ 0,不含硬件摊销)、远程类型化判定服务(TypeSafe Jev,**$0.0000146–$0.0002406**,随输入 token 单调上升,直连路线实测 8 档)与前沿自回归模型(DeepSeek-V4.1-Flash,$0.0000326–**$0.00009645**;思考档最高 $0.0001010,为关闭思考时的 2.54 倍(**⚠️ 第八轮重测:最高为 2.32 倍,且出现在 low 档而非 max 档——该倍率随单次抽样变动**))。三者**在各自的最小状态下**都在 10⁻⁵ 美元量级(**最贵的 LLM 配置跑完一次 120 个检查点的运行约 1.2 美分**)——**但该量级不随状态规模保持**:Jev 在其最大实测状态(39,927 字符 / 5,728 token)单次即 **$0.0002406**,折 120 个检查点约 **2.9 美分**;LLM 按其末态 1,751 token 外推约 **2.4–3.9 美分**。故「便宜一个数量级」在任何口径下都不成立,但「绝对量小」**只在短状态下**成立。真正分离三者的轴是**延迟**(p50 跨约 **25–32 倍**:37.4 ms / 671 ms / **0.9–1.2 s**——Jev 为**独立墙钟**,n=20 单次运行 p50 为 1,192 ms(合并 n=35 的中位为 1,073 ms);**该轴只有一次有产物的运行,故不报告运行间极差**)与**可用状态窗口**(本地 english 在 512 token 钳位下约 3,082 字符;远程实测 ≥15,002 字符——约 4.9 倍,**且该倍数受限于本 harness 的接入层:直连路线把状态推到 39,927 字符时输入 token 仍随字符单调增长,证明「16,000 字符上限」是插件的而非 provider 的**),以及**失败的可观测性**(本地静默丢弃输入,远程告警)。因此我们把中心主张从「更便宜」改写到「不占用顺序往返」。

**第二,也是本文的主要贡献:这些判定器的自报字段不可信,且失效集中在同一个位置。** 七个独立现象被复现,其中**六条来自真实调用**,另一条来自一个仅由输入哈希驱动的合成后端(该后端产出**完全可信的结果表**:14 项电池中**有二元真值的 10 项**上 Brier = 0.359,劣于常数 0.5 的 0.25)。真实调用侧的六条包括:截断标志在两个方向上都是错的(english 滞后 111 字符,multilingual 与 typed-decisions 分别提前 4,773 与 3,774 字符误报),而三个 checkpoint 的标志都在同一点 3,193 字符触发、其真实钳位却相差 2 倍;`fits: true` 与已被截断的输入可以同时成立;概率字段在两个不同系统上各把条目结论反号(在一个系统上波及一半条目);`conflicted` 与 `undecided` 两个判定词在实际输入下不可达。这些现象收敛为一条统一形态:**判定器在「答案被明确陈述」的任务上近乎完美(0.9909,n=220),在「必须注意到某物缺席或某处不匹配」的任务上塌缩(`no_support` 0.3091,n=220),而两种情形下自报的置信度都不低。** 该形态在**三个独立场景**中重复出现(**静默截断、`no_support`、跨语言**——三者的并列依据见 §7.5/§7.7;多跳链式核验是**第四个**场景,但其 Laya 失效形态不同,故不计入该三例);其中最锐利的一条是:当候选值根本没有出现在输入中时,该判定器平均给出 **P(true)=0.5643**,即把「没有陈述」读成了支持(n=220)。

> **一处必须同时给出的更正**:我们曾把该判定器描述为「负信息量」。对 n=1100 的校准语料做 Murphy 分解得 **REL 0.0556 / RES 0.0397 / UNC 0.2400**,且 **AUC = 0.7136(95% CI [0.682, 0.745])**——**分辨力真实存在,失效在校准而非信息**。正确的表述是**校准差**:其 Brier(0.2571)确实劣于常数预测器(0.2400),ECE 为 0.2259。

**第三,一个负结果。** 在路由与级联文献中,用非生成式判别器做第一层已有先例(如 RouteLLM 所评述的 BERT 式路由),但据我们所知,尚无工作把它当作**受控第一层**并与前沿生成器做**配对互补性**检验。我们在**三个**任务区制上做了配对比较(LLM 臂经 API 采样,故每臂均报**多次独立抽样**而非单点):
- **权威定位**:**强制选择臂** LLM 48/48 全对,判定器 0.4583,**未捕获任何 LLM 漏掉的条目**;**⚠️ 同一 48 条电池的散文臂相反**:LLM **46/48**,**仅判定器对 1 条**,**Δ_catch = +0.0435**(95% CI [−0.386, +0.471],基于 **2** 条 LLM 错项)。**在三个区制的区制级读数中,这是唯一一个为正的 Δ_catch 点估计**,论文如实报告,并同时给出它的宽度与分母(§8.2);
- **77 类意图分类**(n=40,**4 次抽样**):LLM **0.750–0.900**(四次为 0.750 / 0.900 / 0.875 / 0.875;**中位数 0.875,均值 0.850**),判定器 **0.225**(4 次逐位相同);**仅判定器对 0–2 条而仅 LLM 对 23–27 条**,**Δ_catch 在 4/4 次抽样中为负**(−0.033 / −0.250 / −0.029 / −0.257)——记录轮是其中**对互补性最有利**的一次;
- **多跳链式核验**(真值修复后重判,n=68,**3 次抽样**):LLM **0.662–0.677**、判定器 **0.294**;**Δ_catch = −0.182 至 −0.247,符号 3/3 次为负**——但**区间强度有限**(未配对 Wald 下 2 次排除 0,改用 score/Newcombe 后**仅 1 次稳健排除、1 次在边界**),且**失败相关 φ 按难度分层后三次均不显著**(CMH 置换 p = 0.059 / 0.055 / 0.201;**⚠️ 该组 p 值不可核验——无产物、无脚本、无种子记录,见 §8.6.1(d)**)。

→ **因此结论比「未发现互补」更强**:判定器不仅不覆盖生成器的错误,其失败还与生成器的失败**同向**——`P(判定器对 | LLM 错)` = 0.13–0.17,**低于**其边际准确率 0.294,而 `P(判定器对 | LLM 对)` = 0.36–0.38 **高于**边际;失败相关 φ 在 **3/3** 次抽样中为正(+0.19…+0.26)。
> **⚠️ 强度限定**:该相关的 2×2 Fisher 精确 p 为 **0.086 / 0.049 / 0.163**(r1/r2/r3)——**未校正时 3 次中仅 1 次在 α=0.05 下显著;按本文自己预声明的 Holm 规则则 0/3 次存活**。且「条件正确率 − 边际」这一单侧检验的 95% CI **在 3/3 次中包含 0**。故这是**与「共享失效」一致**的证据,不是已确立的显著效应。**异种并不自动意味着互补,也不自动意味着独立。**

> **效力与复现性必须与结论同时给出**:第三个区制(修复真值后)的 Δ_catch 其 **MDE(80% power)= 0.28–0.30**,**仍大于预声明的 +0.10 门**——故点估计虽 **3/3 次一致为负**,**区间强度却有限**:未配对 Wald 下 3 次中 2 次排除零,**但改用零格可靠的 Newcombe 后仅 1 次稳健排除、1 次在边界**(§8.3)。**精度仍有限。**第二个区制的 Δ_catch 幅度不稳(−0.029 至 −0.257),**但符号在 4/4 次抽样中为负**。
> **⚠️ 采样范围必须限定**:**仅两个互补性区制**(链式电池 `P22b` 与 77 类区制 `P15b`)以 `temperature=0` 重复取样并报告逐项标签一致率(链式区制 **86.8–89.7%**;判定器臂 **100%**)。**其余 LLM 臂(P14 权威定位、P19 校准、P21 思考成本、P23 logprobs、P24 horizon)仍是单次抽样**,其点估计同样不应读作精确值(§10.1)。

**方法学上**,本文报告了四次同一类错误——**规格级语义缺陷伪装成关于模型的发现**——每一次都由对照而非审阅发现,并由此给出 **23 条**协议强制条款。

**我们明确声明本文的边界**:所有结论来自**单步判断**的实测;**长线(多步累积)的自主运行未执行**,horizon 斜率按预先裁定降级为描述性。全部 Laya 判定测量使用 **english checkpoint**,窗口为 **512 token**(english 单独载入时为 1024,而 multilingual/typed-decisions 在同机上实测为 1024)——故窗口是**「启动配置 × 所查询 checkpoint」**的函数,「窗口 = 512」不是引擎的普遍属性。在核验类任务上 LLM 触顶(n=1100 全对),故**互补性在该区制上不可测量**,而非「不存在」。多跳链式核验电池**已执行**(96 条设计;**修复真值后 68 条入池**,见 §8.6.1),其结果是上文的负结果。

Files

paper-zh.pdf

Files (7.3 MB)

Name Size Download all
md5:c9abe32ac003a128a5fff66d8768b833
234.1 kB Preview Download
md5:b87f99acaad538449afde2b1b996a091
7.0 MB Preview Download

Additional details

Related works

Is derived from
Preprint: 10.5281/zenodo.22901853 (DOI)
Is supplemented by
Software: 10.5281/zenodo.22901248 (DOI)