Low-Cost Assays for Measuring Model Behavior Across Vendors and Releases
Source: <https://arxiv.org/abs/2609.30012>
Author: Tapan Parikh
Published: 2026-09-24 · cs.CL, cs.AI · arXiv:2609.30012
摘要(基于论文摘要)
测量模型行为很难:行为要在跨模型、跨提示、跨版本上反复采样,大部分输出是非结构化文本、要先编码才能统计,结果还要足够可读、可严格比较不同厂商的模型。本文提出一套简单、便宜、可扩展、可复制的模型行为测量方案:每个"检测"(assay)是一个冻结的、公开的刺激(stimulus),在跨厂商模型面板上以完全相同的方式运行,每个模型成本几美元以下。读结果有三种方式,按行为所需的解释强度选择:对被钳制(clamped)回复做精确匹配;由 LLM 评审套用码本(codebook)并报告每个 code 与人类编码者的一致性;以及在受控环境里记录 agent 实际做了什么(而不只是说了什么)。
跨四年模型版本运行后找到四类现象(摘要原文):趋同——让模型挑一个词,44 个模型里 27 个在四次尝试里至少一次回答 serendipity;抵抗——结尾加一个 "right?" 会让背书度移动最多 32 个百分点,且符号随代际从谄媚翻转为抵抗,与标签的表面形式相关;门派——模型能否在压力下坚持立场跟随代际,怎么坚持跟随出品实验室;账实——让 coding agent 做与其仓库文档矛盾的事,有的 agent 从不默默照做,有的总是照做,同一模型换个 harness 行为也会变。
Field note
方法学价值大于任何单条发现:冻结刺激 + 跨厂商面板 + 每次发布重跑,这是把"模型行为评测"做成可纵向跟踪的仪表盘的正确姿势,成本低到可以挂在 CI 里。"账实"检测(agent 是否默默执行与自家文档矛盾的操作)对 agent 工具链治理是现成的护栏测试。