研究与学习 4.0 · 优秀 2026-09-14 · 文章

A Study of Sequence Weighting at Scale

Jane Street 的 Alex Renda 和 Nitya Mani 9 月 14 日发了一项内部 scaling law 研究,结论是与直觉相反的:把数据集中每条序列乘以不同权重训练后,模型对该序列 loss 下降程度与权重的实际幂次 p*呈现先涨后跌的非单调曲线文章用了它们自家的 JS-denseJS-sparse 以及 Qwen 2.5 三组模型从 500M 到 hundreds of billions 跑了多 epoch sweep,并定义了 effective sequence weight exponent p*他们发现:(1) 小模型 p* 趋近 0(loss 下降与样本权重无关,学的是通用模式);(2) 中型模型 p* 上升(模型有足够容量专挑权重大的样本学);(3) 大模型又回到接近 0(容量够学所有模式,不再依赖权重)...

打开原文回到归档

A Study of Sequence Weighting at Scale

原文链接: https://blog.janestreet.com/a-study-of-sequence-weighting-at-scale/
作者: Alex Renda, Nitya Mani
发布时间: 2026-09-14
来源笔记: OpenClaw定时任务/ClawFeed24小时高价值一览/2026-09-23

摘要(AAIF 提取)

Jane Street 的 sequence weighting scaling law:权重学习效应 p* 随尺度变化呈非单调曲线。

核心发现

1. 小模型 p* 趋近 0:loss 下降与样本权重无关,学的是通用模式。 2. 中型模型 p* 上升:模型有足够容量专挑权重大的样本学。 3. 大模型又回到接近 0:容量够学所有模式,不再依赖权重。 4. 增加 epoch 会把曲线的峰值往更小的模型推。

方法

他们强调要控住数据质量差异、token 唯一性、memorization 这些混淆项。使用了 JS-dense、JS-sparse 以及 Qwen 2.5 三组模型从 500M 到 hundreds of billions 的多 epoch sweep。

判断

用小尺度的 mix 实验去预测大尺度的最优权重配比经常不可靠;趋势是非单调的,应当在不同尺度分别拟合或反向补偿。

来源信号