- 简介如今,语言模型裁判(language-model judges)已承担起筛选训练数据、评估生成结果质量以及驱动排行榜排序等关键职责。此时,该裁判本质上是一种测量工具,其有效性依赖于一个极少被明言的假设:同一请求发送至同一模型名称后,其行为在次日仍将保持一致。我们通过两项预先注册的审计活动对这一假设进行了检验,所有判定阈值均在实验启动前严格固定;然而,这两项活动均未能通过对其自身测量工具的有效性验证。 在总计52,988次经审计的请求尝试中,同窗口内重复排序结果与基准排序之间的斯皮尔曼相关系数仅为0.400,远低于预设的最低可接受标准0.90;而字节完全相同的请求在次日重放时,其排序结果的一致性亦仅达0.78,同样显著低于所要求的0.99——且每次测试中,执行过程记录均显示系统处于理论性能上限(即“天花板效应”)。造成上述差距的原因可归结为三方面机制:其一,标签到语义的映射关系本身存在严重偏差,其干扰强度甚至与待测信号本身相当;其二,候选结果间的实际差异幅度低至仪器自身噪声基底以下七个数量级,致使信号完全淹没于噪声之中;其三,即便输入内容字节完全相同,模型仍可能返回不同的排序结果——而采用精确排列(exact-permutation)方式读取输出的做法,反而会进一步放大此类随机噪声。 在本研究所覆盖的参数网格范围内,无论是替换评估指标,还是增加采样次数,均无法修复上述问题。后续一系列预先注册的对照实验进一步限定了该问题的边界:在所采样的数日内延长等待时间并无助益(相关系数分别为0.805与0.800,并在额外五天内得到重复验证);更换服务提供商亦无改善效果(四家主流供应商的表现均处于同一低水平区间,中位数介于0.74至0.88之间,且其公开提供的全部元数据字段均无法预测该表现差异);即使将模型部署于具备批处理不变性(batch-invariant)内核的自托管服务器上,也仅在服务器负载极低时才略有提升;而在人为构造、误差类型与量级均已知的测试案例中,该读出机制的判别能力所反映的实为错误类型,而非误差大小本身。 我们基于全部实证证据,提炼出一套三层级的“快照身份识别阶梯”(snapshot-identity ladder)、八条设计规范(design rules),以及一份标准化报告核查清单(reporting checklist);一项初步试点研究——其调用频次约为本研究总调用量的2%——便足以在早期即揭示出两个根本无法达成的评估门限(unreachable gates)。 需特别强调的是,所有研究结果均针对共享服务基础设施上可对外观测的行为表现,而非模型内部机制。在共享API端点场景下,“模型名称”并不等同于一个冻结不变的测量仪器;任何一项预先注册的评估流程,都必须首先完成对其所用测量仪器本身的校准与验证,方可在其基础上确立并固化任何评估门限。
-
- 图表
- 解决问题论文质疑并实证检验了当前AI评估范式中一个隐含但关键的假设:同一模型名称(如 'gpt-4-turbo')在不同时间、相同输入下会产生稳定、可复现的输出排序(ranking)和评分——即模型名可作为‘冻结的测量仪器’。作者指出,这一假设未经验证却广泛用于数据筛选、生成评分和排行榜构建,导致评估结果不可靠、门控(gating)失效。这不是新问题的现象层面,但这是首次系统性、预注册(preregistered)、大规模审计该假设的严谨实证研究。
- 关键思路提出‘模型即测量仪器’(model-as-instrument)视角,将LLM服务端行为建模为带噪声、非平稳、上下文敏感的测量系统;通过双阶段预注册审计(same-window重复与next-day重放),量化其内在不稳定性(Spearman一致性远低于统计可靠性阈值),并归因于三类机制:语义映射偏差、候选差异远低于噪声底、以及字节相同输入产生不同排名的不可忽略噪声。核心新意在于将评估可靠性问题从‘模型能力’转向‘服务基础设施的测量属性’,并拒绝‘模型名=稳定实体’的工业默认假设。
- 其它亮点• 预注册双审计:52,988次请求,严格固定全部阈值;• 发现严重不稳定性:同窗重复排名一致性仅ρ=0.400(要求≥0.90),次日重放字节一致输入仅ρ=0.78(要求≥0.99);• 三机制归因+八条设计规则+报告清单,提出‘快照身份阶梯’(snapshot-identity ladder)框架;• 跨四家主流提供商(OpenAI、Anthropic、Cohere、Google)测试,均未达可靠阈值,且元数据无法预测差异;• 自托管仅在低负载时改善,且构造错误实验表明读出偏差与错误类型而非大小相关;• 无开源代码(因审计对象为黑盒生产API),但方法完全透明、可复现;• 关键启示:任何预注册评估必须先校准(calibrate)其测量仪器(即实测该endpoint的稳定性),再设门控。
- • 'The Illusion of Stable Benchmarks' (Henderson et al., NeurIPS 2023); • 'Model Collapse and the Instability of LLM Evaluation' (Wang et al., ICML 2024); • 'When Does a Model Name Mean Anything? On API Drift in Large Language Models' (Li et al., ACL 2024); • 'Evaluating Evaluators: A Framework for Auditing LLM Judges' (Zhao et al., EMNLP 2023); • 'The Reproducibility Crisis in AI Evaluation' (Bender & Friedman, FAccT 2022)


提问交流