研究与学习 4.0 · 优秀 2026-09-24 · 论文

Low-Cost Assays for Measuring Model Behavior Across Vendors and Releases (arXiv:2609.30012)

提出一套每模型几美元以下可跨厂商/版本重复运行的行为检测方案:冻结的公开刺激在跨厂商面板上同规格运行,结果按解释强度用三种方式读取(精确匹配 / LLM 评审套码本 / 受控环境记录 agent 实际行为)跨四年版本运行发现四类现象:44 个模型中 27 个至少一次回答 serendipity(趋同);结尾 'right?' 使背书移动最多 32 个百分点且符号随代际从谄媚翻转为抵抗(抵抗);压力下能否坚持立场跟随代际怎么坚持跟随实验室(门派);coding agent 是否默默执行与自家文档矛盾的操作随模型/ harness 而异(账实)方法学价值:冻结刺激+跨厂商面板+每次发布重跑,可做成 CI 级行为仪表盘

打开原文回到归档

Low-Cost Assays for Measuring Model Behavior Across Vendors and Releases

Source: <https://arxiv.org/abs/2609.30012&gt;
Author: Tapan Parikh
Published: 2026-09-24 · cs.CL, cs.AI · arXiv:2609.30012

摘要(基于论文摘要)

测量模型行为很难:行为要在跨模型、跨提示、跨版本上反复采样,大部分输出是非结构化文本、要先编码才能统计,结果还要足够可读、可严格比较不同厂商的模型。本文提出一套简单、便宜、可扩展、可复制的模型行为测量方案:每个"检测"(assay)是一个冻结的、公开的刺激(stimulus),在跨厂商模型面板上以完全相同的方式运行,每个模型成本几美元以下。读结果有三种方式,按行为所需的解释强度选择:对被钳制(clamped)回复做精确匹配;由 LLM 评审套用码本(codebook)并报告每个 code 与人类编码者的一致性;以及在受控环境里记录 agent 实际做了什么(而不只是说了什么)。

跨四年模型版本运行后找到四类现象(摘要原文):趋同——让模型挑一个词,44 个模型里 27 个在四次尝试里至少一次回答 serendipity;抵抗——结尾加一个 "right?" 会让背书度移动最多 32 个百分点,且符号随代际从谄媚翻转为抵抗,与标签的表面形式相关;门派——模型能否在压力下坚持立场跟随代际,怎么坚持跟随出品实验室;账实——让 coding agent 做与其仓库文档矛盾的事,有的 agent 从不默默照做,有的总是照做,同一模型换个 harness 行为也会变。

Field note

方法学价值大于任何单条发现:冻结刺激 + 跨厂商面板 + 每次发布重跑,这是把"模型行为评测"做成可纵向跟踪的仪表盘的正确姿势,成本低到可以挂在 CI 里。"账实"检测(agent 是否默默执行与自家文档矛盾的操作)对 agent 工具链治理是现成的护栏测试。