Agent 与自动化 4.0 · 优秀 2026-09-24 · 论文

Screen Before You Serve: Simulation for Production CX Agents at 140M Scale (Nubank, arXiv:2609.3...

Nubank 团队提出假设驱动的仿真筛选流程:合成客户与仿真工具输出让多步 agent 工作流无需触碰生产后端即可测试在其巴西出货量最高的聊天客服 agent 上,跨 4 个已部署版本仿真分数与生产版本级评估高度相关;仿真引导的迭代让 tNPS 在线上 A/B 中提升 36.69 分;另在超过 16,000 段仿真对话中筛选开源权重配置,选出的模型把自助解决率提高 8.82 个百分点至 Nubank 历史最高核心论点:仿真让大范围探索模型/推理设置/提示词可行且不暴露客户

打开原文回到归档

Screen Before You Serve: Simulation for Production CX Agents at 140M Scale (Nubank)

Source: <https://arxiv.org/abs/2609.30137&gt;
Authors: Edesio Alcoba, Kevin Rossell, Aman Gupta, Shao Tang, Jiwoo Hong, et al. (Nubank + Snowglobe team)
Published: 2026-09-24 · cs.AI, cs.CL · arXiv:2609.30137

摘要(基于论文摘要)

客服(CX)agent 在受监管行业里难改版:要识别意图、遵守复杂运营策略、可靠调用工具;人工端到端测试覆盖有限,线上实验直接把失败暴露给客户。本文提出一套假设驱动的仿真筛选流程:合成客户对 agent 响应做出反应,工具输出也走仿真,使多步 agentic 工作流无需触碰生产后端。

实证规模来自 Nubank(巴西最大数字银行):在其出货量最高的聊天客服 agent(Card Delivery 及后续 Card Management)上,跨 4 个已部署版本,仿真评估分数与生产版本级二元评估分数高度相关。仿真引导的迭代在后续线上 A/B 测试中把交易净推荐值(tNPS)提升 36.69 分。另对开源权重配置做了超过 16,000 段仿真对话的筛选,选出的模型在后续线上 A/B 中把自助解决率(SSR)提高 8.82 个百分点,达到 Nubank 历史最高,tNPS 无统计显著变化。

核心论点:仿真让"大范围探索模型、推理设置、提示词"变得可行且不暴露客户,这类生产改进靠纯线上实验根本试不过来。

Field note

这是少见的把"仿真回归测试 → 线上 A/B 验证"全链路数字公开的生产级 agent 案例。对要改版生产 agent 的团队,方法论可抄:先在仿真环境里筛配置,再用版本级相关性验证仿真分数可信,最后才上 A/B。比"上线看事故"的迭代方式便宜一个数量级。