模型与实验室 4.0 · 优秀 2026-09-24 · 论文

JevOut: Natural Context Can Flip Decision Models

arXiv 2609.30243 关注 Jev 这类把无结构语言直接映射为有限选项概率分布的决策模型(其概率输出会被直接用于路由请求选 tool触发动作)作者发现:看似自然短小的上下文补充可以把这些"原本答对的"决策模型拐到错误选项,即便正确答案没变他们为每个原本答对的样本固定一个错误目标选项,用模型在选项上的概率反演地优化出既流畅又保留原文/问题/选项/金标的上下文在 64 个被接受的 target 评估里,Jev 在 312/508(61.4%)原本正确的决策上被改向,其中 229 例错误选项概率 0.7;跨 7 个数据集3 个其他决策系统,针对性 flip 率 64.9%73.2%结论:当前决策模型对自然上下文的脆弱性已经不能把它们的概率输出当作可靠路由信号

打开原文回到归档

JevOut: Natural Context Can Flip Decision Models

原文链接: https://arxiv.org/abs/2609.30243
作者: Zixiang Xu
发布时间: 2026-09-24
源: arXiv外部扫描 (2026-09-28)

摘要

arXiv 2609.30243 关注 Jev 这类把无结构语言直接映射为有限选项概率分布的决策模型(其概率输出会被直接用于路由请求选 tool触发动作)作者发现:看似自然短小的上下文补充可以把这些"原本答对的"决策模型拐到错误选项,即便正确答案没变他们为每个原本答对的样本固定一个错误目标选项,用模型在选项上的概率反演地优化出既流畅又保留原文/问题/选项/金标的上下文在 64 个被接受的 target 评估里,Jev 在 312/508(61.4%)原本正确的决策上被改向,其中 229 例错误选项概率 0.7;跨 7 个数据集3 个其他决策系统,针对性 flip 率 64.9%73.2%结论:当前决策模型对自然上下文的脆弱性已经不能把它们的概率输出当作可靠路由信号

English Summary

arXiv 2609.30243 studies decision models like Jev that map language directly to option probabilities used for routing and tool selection, and shows that short natural-looking context additions can flip originally correct choices without changing the gold answer: 61.4% (312/508) of Jev's originally correct decisions were redirected in 64 evaluations, with 229 cases assigning 0.7 probability to the fixed wrong option; targeted flip rates across 7 datasets and 3 additional decision systems range 64.973.2%.

为什么值得关注

Jev 这类决策模型的概率输出可以被自然上下文改向:路由层 agent 的可靠性是新裂缝

信息源